Agent商业化元年:AI PM 要重写哪三栏

Agent商业化元年,AI产品经理如何重写PRD三栏?交付物从功能变结果、定价从用量变成果、验收从跑通变归因,模型退居二线后产品定义能力才是核心竞争力!

做电商那会儿,我做过一套 AI 智能客服的方案。

汇报的时候,总监和老板没怎么关心技术多牛,只盯着一件事:这玩意上了能替掉几个坐席、一年省多少人力,花的钱和省下来的钱到底成不成正比。这个问题我准备了。按传统方式算一笔账,一个坐席一年多少钱,这套客服能替掉几个,省下的减去投入的,账面很好看,报上去也过了。

但我心里清楚,这笔账是虚的。

因为以当时的技术,智能客服根本不是稳定替掉一个人。它有的问题答得又快又好,确实省人;有的答得不清不楚,用户还得转人工,甚至答错了引来投诉,反而多花钱。它不像坐席那样能拿工资精确折算。我账里替掉的坐席数,其实是拍出来的,我没法证明它稳定到能替那么多,也没法把省下的钱干净地算成它的功劳。

当时糊过去了。没想到这记回旋镖,到我做 Agent 的时候又飞回来了,而且比当年更狠。

因为账算不清,往下每一栏都写不出来。这东西按什么收费,按调用量还是按它帮客户省了多少、赚了多少?验收标准怎么写,以前点击 A 跳转 B、接口超时要兜底,测试用例一条条列就行,但一个 Agent 这次答对不代表下次答对,换个问法就崩,我真正要验的是它的能力边界在哪、背后大模型的能力边界在哪、超出边界是硬扛还是老实认怂?

那一刻我意识到,变的不是某一栏,是产品经理定义产品的整套方式。

先说个反差:WAIC 上,大厂集体让模型退场了

这不是我一个人的错觉。全网火热的 2026 WAIC,把它摆到台面上了。

逛过今年 WAIC 的人应该都有同感,展台的高频词已经不是模型了。华为、腾讯、百度、阿里,展区里挂在嘴边的是 Agent、智能眼镜、超节点、工作流、终端。模型当然还在,但它不再是那个被推到聚光灯下的主角。

多家媒体的会后共识很直接:Agent 商业化元年。有一个变化我印象很深,超六成的大模型厂商已经把 AI Agent 或智能应用当成自己的主标签,模型本身反而藏到了后面。

虎嗅有篇文章里的比喻我很喜欢,过去两年大家比的是谁的发动机更强,今年比的是谁能交付整辆车。模型从一个可以单独售卖的产品,变成了整车里的一个零部件。

真正决定用户体验的,不再是模型单点能力,而是算力、Agent、工具调用、数据、终端、开发框架拼起来的整套系统。

为什么会这样?说白了,模型这个东西正在快速变成基础设施,而基础设施是不值钱的,或者说是不该由它来定义产品价值的。

你想想电,一百年前谁家能通上电,那是能拿出来吹的核心卖点。今天没有任何一个电器会把”本产品可以用电”写进宣传语,因为电已经是水电煤一样的底座了。模型正在走这条路。当每一家都能调到差不多水准的模型,当同一个开源模型你能用我也能用,模型本身就不再是差异点了。

WAIC 上一个数据特别能说明问题。阿里云披露,过去整整五年,他们的某个数据库总共才建了四万个实例,而最近几个月,Agent 自己就建了差不多十二万个,环比增速 300%。有位负责人说了句很狠的话:

云的第一用户,正在从人变成 Agent。

你把这些信号连起来看,会发现一件事,AI 的价值重心正在往上走。往下是越来越便宜、越来越标准化的模型和算力,往上是真正解决业务问题、能被用户感知、愿意付钱的那一层。而那一层,正好是产品经理站的地方。

所以我劝你,别把”模型退居二线”当成一句讲给投资人听的战略。这是砸到你工位上的活。当卖点从模型能力变成交付结果,你手里三样最基础的东西全都要重写:你交付的到底是什么、这东西按什么收费、它做到什么程度才算做完。

这篇就聊这三栏怎么重写。不讲宏大叙事,讲产品经理具体要动哪几笔。

你交付的不再是功能,是结果

先看交付物本身。

传统产品的 PRD,本质是在描述功能。用户能点什么、系统会返回什么、每一步长什么样。我们习惯把产品拆成一个个功能点,因为过去软件的价值就是靠这些功能点堆出来的。功能越多、越好用,产品越值钱,这是我们做了十几年产品的肌肉记忆。

Agent 不吃这一套。

WAIC 上满帮集团分享过一个很典型的例子。他们把货运场景的转型本质总结成一句话,从人操作软件,走到人托管目标

以前司机是自己上 App 刷货,一条条看,一单单挑,软件负责把货源列给他,挑不挑、怎么挑是司机的事。现在变成司机把目标托管给 Agent,告诉它我要去哪、能接受什么价、愿不愿意空驶,剩下的 Agent 自己去理解、去匹配、去执行。系统上线后,司机的使用率从 15% 提到了 35%,用过一次的留存率到了 71%。

你看这里面产品经理要交付的东西,彻底换了。

以前你交付的是一个更好用的刷货界面:筛选更快、排序更聪明、信息展示更清楚。现在你交付的是一个能替司机把货找好的结果。前者你写功能点就行,后者你根本没有界面可写,司机压根不看界面了。

这就是为什么很多人拿老 PRD 模板去套 Agent,会套得很别扭。你在功能栏里拼命写支持语音输入、支持多轮对话,写完发现这些都是皮,真正的产品是那个被托管的目标有没有被达成,而这件事在旧模板里根本没有它的位置。

那 PRD 到底该怎么写?我自己的做法是,把 PRD 的第一栏从功能清单换成目标定义

具体说,写 Agent 的 PRD,我会先逼自己回答三个问题:

第一,用户托管给它的目标到底是什么? 不是”提供智能问答”这种功能描述,而是”让用户在不转人工的情况下解决 80% 的售后问题”这种结果描述。目标必须是可衡量的,不然后面的定价和验收全都落空。

第二,达成这个目标,Agent 需要哪些权限和边界? 它能不能自己发起退款?能不能调用库存接口?哪些事必须停下来问人?这一栏在传统 PRD 里几乎不存在,因为传统软件只执行不决策,但 Agent 是要替用户做决策的,你不把它的权力边界划清楚,上线就是灾难。

第三,达不成的时候怎么办? 传统功能要么可用要么报错,Agent 是介于中间的,它可能”做了一半”或者”自以为做好了其实做错了”。这一栏你得提前设计好兜底和交接机制。

再往深一层看,连你要喂给产品的原料都变了。

我看到一个做 Agent 电商基建的团队 Nile,创始人讲过一个细节,我觉得特别能说明问题。传统电商的商品信息是给人看的:一段 30 个字的描述、一张主图、六到八张详情图。为什么这么少?因为人的注意力窗口就这么大,你写多了没人看。

但 Agent 读商品,能读进去的信息量是原来的三四百倍,差不多十万个字符。它需要的是这个商品的核心卖点、关键参数,电动车能开多远、蜡烛能烧多久,这些在给人看的商品页里压根不存在。

原来的商品运营写 30 个字描述、一张主图,这全是错的。今天的 AI 协议里,信息量是原来的 300 到 400 倍,运营根本写不出来这些。

这句话你把它从电商翻译到任何 Agent 产品都成立。你过去为人准备的产品信息,喂给 Agent 是不够用的,甚至是错的。

拿我做过的智能客服举例。以前我们给客服系统配的知识库,是一问一答的 FAQ,问题写得干干净净,答案控制在三五句话,因为要显示在对话框里给人快速读。但如果背后是个 Agent,这套 FAQ 就太单薄了。它需要知道的是这个问题背后的完整逻辑:什么情况下适用、有哪些例外、涉及哪些关联政策、上游下游还牵扯到谁。信息量是原来的很多倍,而且结构完全不同,不是给人读的问答,是给机器理解的知识。

所以产品经理得重新定义,我这个产品到底要向 Agent 暴露哪些东西、以什么结构暴露。这已经不是画原型的活了,这是在定义一套给机器读的产品语言。

所以第一变说白了就一句:你交付的东西,从人能操作的功能,变成了Agent 能达成的结果。PRD 的主语变了,从”这个功能怎么做”,变成”这个目标怎么达成”。

定价从”按用量”走向”按结果”,但没那么简单

交付物变成结果,紧接着就是那个把我问穿的问题:这东西按什么收费?

传统软件的定价,本质是按你占用了多少资源算钱。按人头(席位)、按调用量、按存储、按时长。逻辑很清楚,我提供一套工具,你用得多就付得多,工具好不好用是你的事,反正我不为你的业务结果负责。

这套逻辑背后有个隐含前提:工具和结果是分开的。 我卖你一把锤子,你拿它盖了房子还是砸了手,跟锤子无关,你付的是锤子的钱。SaaS 时代所有的定价,本质都是在卖锤子。

Agent 把这个前提打破了。Agent 不是锤子,它是那个抡锤子的人。它直接下场干活、直接产出结果,你很难再说”它只是个工具,结果好不好是你的事”。既然它对结果负责,那按结果收费就成了一个绕不开的问题。

这一届 WAIC 上,两个大厂的技术一号位在这件事上公开唱了反调,我觉得这个分歧特别值得每个 AI PM 记下来。

阿里云 CTO 李飞飞这边,主张按结果付费。

他的判断很直接,类比 SaaS 行业,未来会走向智能体即服务,客户只为业务落地的成果付费,而不是为算力消耗付费。他甚至把话说得很重:

如果所有任务都去调用最强的模型,企业客户只会为自己无法控制的算力账单买单。

翻译成人话就是,客户不想再看那张算力账单了,他只想说,我要的结果你给我做到,多少钱你报,做不到我不付。这就是从卖工具到卖成果的定价革命。这个方向听着特别爽,也特别符合客户的心理,谁不想只为结果买单呢。

但腾讯云的吴运声这边,直接泼了盆冷水。

他说腾讯云一般不会按任务来收费,原因就一个,任务太难精确定义了。一个已经跑起来的 Agent,成本主要取决于它调用了什么模型、什么插件。他给的解法是把任务拆开:模糊的、需要反复琢磨的事交给 Agent 做,会多消耗 Token;确定的、有标准流程的事交给工作流做,不需要反复烧 Token。

你把这两个人的话放一起看,会发现他们吵的根本不是价格,是责任边界

李飞飞说的是理想态:我为你的结果负责,所以我敢按结果收钱。吴运声说的是现实的坑:结果这东西你根本定义不清,我凭什么为一个定义不清的东西背成本?

这个分歧,恰恰就是砸在产品经理头上的活。你要按结果收费,前提是你能把结果定义清楚、能把它准确归因到你的 Agent 头上。 定义不清、归因不了,按结果付费就是一句空话,最后还是得退回按用量算。

那到底什么样的产品适合按结果收费,什么样的不适合?我琢磨下来,判断标准就一条:结果可不可归因。

我看到一个已经跑通的案例,就是前面提到的 Nile。他们做 Agent 电商基座,收费方式是纯 CPS,商家真正卖出商品,他们才有收入,卖不出去一分不收。创始人说这套模式的 ROI 健康到能支撑五年,所有安装的商家至今零卸载。

你卖多少,我们才收费,我们希望和你一起成功。

为什么它敢这么收?因为在电商这个场景里,结果是天然可归因的。一笔订单从哪个渠道来、成没成交、金额多少,是可以被精确记录的。用户是从 Nile 搭的这个 Agent 渠道进来买的,这笔功劳板上钉钉算它的。结果清晰,按结果付费就成立,而且是双赢,商家没风险,Nile 赚得也踏实。

现在你回头看我那套智能客服,为什么当年那笔账是虚的?因为客服的结果天然难归因。用户这个问题解决了,你没法证明是客服 Agent 答好的,还是用户自己又找了别的办法,还是本来就不是啥大事。省下来的人力更难算,你说替掉了三个坐席,但万一是因为那阵子咨询量本来就降了呢?结果糊成一团,按结果收费就悬,最后只能退回按坐席数、按调用量这种笨办法算。

所以第二变给 AI PM 的启发,不是”以后都要按结果收费”这种口号,而是这么一条能落地的判断:

你的产品结果越可归因,你越有底气按结果收费;越不可归因,你越要老老实实设计一个能自证价值的验收和数据体系。

如果你现在正在做的 Agent 产品,结果暂时归因不清,我的建议是别硬上按结果付费,先做两件事:一是把能证明价值的数据埋点做扎实,二是先用”按用量 + 效果对赌”的混合定价过渡。等你的归因体系立住了,再谈纯按结果收费不迟。

这就自然引到了第三样要变的东西,归因。而归因,恰恰是验收标准的核心。

验收标准,从”跑通了”变成”归因得清”

回到最开始把我卡住的那笔账,它最终卡在的其实是验收。你没法验收,就没法定价,也没法向老板证明这东西值多少钱。

传统验收是二元的,跑通了就是通过,没跑通就是不通过。测试用例覆盖到,功能符合预期,签字上线。它验的是功能的确定性,这个按钮点了会不会跳转,这个接口超时了会不会兜底,答案是唯一的,非黑即白。

Agent 验的是完全不同的东西。它不是一个确定性系统,同样的输入可能给出不同的输出,你没法用是否必然跑通去卡它。我后来想明白,Agent 的验收其实要验三件事,这三件事传统测试用例里一件都没有。

一是能力边界。

这个 Agent 在哪些场景下是靠谱的,哪些是它的盲区。验收不是验它能不能答对某一道题,而是验它在多大的范围内稳定地答得对

拿智能客服说,你不能拿十个精心挑的问题让它答,答对了就说验收通过,那是自欺欺人。你得建一套评测集,把真实场景里五花八门的问题都灌进去,包括那些刁钻的、模糊的、多轮追问的、故意找茬的,然后看它的正确率和稳定性到底落在哪个区间。这套评测集,就是 Agent 时代的测试用例,只不过它验的不是对错,是概率和边界。

这件事的工作量比传统测试大得多,也重要得多。因为你划出来的这条能力边界,直接决定了后面能不能定价、敢不敢承诺效果。边界画得虚,后面全是坑。

二是失败时的行为。

超出能力边界的时候,它是硬着头皮编一个答案(幻觉),还是老实说这个我不确定、帮你转人工?

这一栏在传统验收里根本不存在,因为传统软件失败了就是报错,行为是确定的。但 Agent 失败的方式是不确定的,它可能一本正经地胡说八道。对客服来说,答错了误导用户,比说一句”这个我帮您转人工”要严重得多,前者可能引来投诉甚至赔偿,后者顶多慢一点。

所以验收必须把边界外的行为也框进去。你要明确规定:哪些情况它必须承认不会、必须交接给人、必须停下来确认。这不是技术细节,这是产品的安全底线,是你作为产品经理必须守住的东西。

三是效果的可归因。

这一条直接接住了第二变的定价问题。你要能说清楚,这个 Agent 到底为最终结果贡献了什么,而不是把功劳和锅都糊成一团。

关于这条,Nile 的做法给 AI PM 打了个样。他们专门做了一套归因面板,把用户从意图到提问到点击的整条链路,清清楚楚地呈现出来。更关键的是创始人说的一句话:

做不了严谨归因的,我们都不算。

这句话分量很重。别的渠道为了让数据好看,恨不得把沾边的转化都算成自己的功劳,他们反着来,归因不严谨的宁可不计。为什么这么轴?因为一旦你要按结果收费,归因的可信度就是你商业模式的地基。你虚报一次,商家发现了,就再也不信你的面板了,这条按结果收费的路也就断了。

所以我现在做 Agent 的验收方案,会专门加一栏叫”价值归因怎么算”。这个 Agent 处理了多少、其中多少是它独立完成的、多少是人机协作的、避免了多少次转人工,都要能落到具体数字上。这栏做扎实了,我才有底气去跟老板算那笔账,也才有底气去跟客户谈按结果收费。

你看,这三件事是层层递进的。能力边界决定了它能干什么,失败行为决定了它出事时的下限,效果归因决定了它值多少钱。一个 Agent 产品能不能商业化,很大程度上就取决于产品经理有没有在验收这一栏,把这三件事想清楚、定明白。

所以对 AI PM 来说,验收标准这一栏的重写,本质是从证明功能可用,升级到证明价值可信。你不光要证明这个 Agent 能干活,你还得能证明它干的活值这个钱。

这件事有多要紧?Gartner 有个预测可以做注脚,它预计将近四成的 Agent 项目会因为管控和安全问题失败。我的理解是,这里面很大一部分死因不是模型不够强,是产品经理没能在一开始就把边界、失败行为、归因这三件事定义清楚,结果 Agent 上线后既控不住风险,也证不明价值,老板一算账觉得不划算,自然就被砍掉了。

验收从”跑通了”到”归因得清”,这一栏的含金量,在 Agent 时代是指数级上升的。它不再是上线前的最后一道确认,而是整个产品能不能立起来的地基。

模型退二线,被推到台前的是产品定义能力

把这三样变化连起来看,其实是同一件事的三个切面。

交付物从功能变成结果,定价从用量变成成果,验收从跑通变成归因。它们背后是同一个转向,AI 产品的价值锚点,从模型能做什么,移到了你能替用户交付什么结果

这也是为什么我说,模型退居二线,对产品经理不是坏消息,反而是件好事。

模型是主角的时候,产品经理其实挺尴尬的。用户为模型的能力买单,那是算法和研发的功劳,你能做的更多是包装和交付,价值感不强,甚至会有一种”我是不是可有可无”的焦虑。可当卖点变成结果,事情就反过来了。定义什么是好结果、怎么给结果定价、怎么证明结果可信,这三件事没有一件是模型能替你干的,全是产品经理的活。

模型越强,这三件事反而越值钱。因为能力越强、越通用的模型,越像一片没有边界的海。而商业需要的是一个具体的、可交付、可收费、可验收的产品,是从海里舀出来、装进杯子的那杯水。这个把无边界的能力收敛成有边界的产品的人,就是产品经理。

回到开头那笔算不清的账。我现在再遇到老板问”这东西能省多少钱、值多少钱”,我不会再拍一个好看的数字糊过去了。我的答案是一串新的追问:这个 Agent 交付的结果是什么,这个结果能不能被清晰归因,如果能,我就有底气把省下的、赚到的算成它的功劳,也有底气按结果收费;如果暂时不能,那我第一件事不是急着报价,是先把归因和验收的地基打好。

当年那记回旋镖之所以能飞回来,就是因为我当年没把这件事想明白,只想着把账糊过去。这次我不想再糊了。

Agent 商业化元年,这个词听起来是讲大厂、讲融资、讲赛道的。但落到我们手里,它讲的是一件很具体的事:

你写的下一份 PRD,主语该换了。

这个功能怎么做,换成这个结果怎么交付、怎么定价、怎么验收。谁先把这三栏写明白,谁就先站到了 Agent 商业化的正确位置上。

作者: @楊yang