AI 智能体商业模式 · 行业认知研究报告
赛道本质
智能体的收费单位由谁扛得住单次任务成本的方差决定:扛不住的按 token 透传,扛得住的才敢按结果收钱。
核心判断
- 1
行业本质:智能体的收费单位由谁扛得住单次任务成本的方差决定:扛不住的按 token 透传,扛得住的才敢按结果收钱。
- 2
一 · 编码类智能体在 2025 年 6 月至 2026 年 7 月间先后撤下按「用户请求」计的单价,改为按 token 或按模型调用计的额度。
- 3
二 · 可比口径在分化:应用层「一件活多少钱」在消失,基础设施层的单位在趋同,但计量规则仍不同。
- 4
三 · 按结果公开标价以客服场景为主,销售场景已有一例,「结果」的定义权在卖方。
- 5
四 · 一次客服会话的公开标价在 0.08–2 美元之间,价格越低的档越依赖小模型、缓存和预设答案。
- 6
五 · 钱的锁定发生在算力层:应用层按月结算、额度过期作废,算力层是 3–10 年的具名长约。
- 7
六 · 算力长约的硬度要打折:最大几笔合同的买卖双方同时是股东、贷款人或担保人,有的可以 90 天通知终止。
- 8
七 · 毛利压力已写进上市公司财报:本报告所读 7 家美国上市公司中,6 家在整体毛利说明里点名 AI 成本;所读文件中只有智谱单列了云端 API 毛利(24.6%)。
- 9
八 · 这份报告的单价数字按月过期:取得历史快照的 8 家厂商中,至少 6 家在过去 12 个月内改过计价单位、单价、额度或单位定义。
完整目录
目录 100% 公开,不做删减 —— 你要先能判断它覆没覆盖你的问题,再决定买不买。
- 报告说明
- 核心判断
- 阅读说明
- 第一章 · 总论:智能体的钱从哪来、按什么收
- 1.1 一句话定义与边界
- 1.2 链条上的五类角色
- 1.3 四类付费方与各自的证据档次
- 1.4 计价单位谱系:七种单位,各自把风险放在谁身上
- 1.5 为什么现在要看定价,而不是规模
- 第二章 · 计价单位横截面:2026 年 9 月的 30 条官方定价
- 2.1 取样与口径
- 2.2 运行平台:单位最细,价格接近,计量规则不同
- 2.3 模型层:token 仍是通用货币,但一个 token 的价格已经有六个维度
- 2.4 应用层(编码与通用):座席+额度成了默认形态
- 2.5 应用层(客服与业务流程):按结果、按会话、按动作并存
- 2.6 这张横截面怎么用:哪些数能横比,哪些不能
- 第三章 · 计价单位迁移史:历史快照里的同一家厂商
- 3.1 取样方法
- 3.2 编码类:从「500 次请求」到「按 API 价格计费」
- 3.3 GitHub 的原话:为什么按次收费撑不住
- 3.4 被撤下的换算,以及另一条路:Devin、Replit、Copilot Studio、GitLab
- 3.5 没撤下的单位:按结果计价的厂商在改定义而不是改价格
- 3.6 结论:「一件活多少钱」在哪一层消失、在哪一层保留
- 第四章 · 按结果计价:在哪里成立,靠什么成立
- 4.1 本报告取得的公开标价,以客服场景为主
- 4.2 「结果」由谁判定
- 4.3 成立的四个条件
- 4.4 为什么编码类智能体没有走按结果这条路
- 第五章 · 单位经济:一次任务的成本与收费差多少
- 5.1 成本栈:一次任务的钱花在四个地方
- 5.2 厂商自己给出的放大系数
- 5.3 一次客服会话:官方算例能推到哪一步
- 5.4 一条编码请求:从 0.04 美元到 0.20–1.20 美元
- 5.5 财报里的毛利压力:方向一致,颗粒度不够
- 5.6 这门生意什么条件下算得过来
- 第六章 · 钱流与合同锁定:SEC 文件里的长约
- 6.1 应用层的合同:按月、过期作废、可以降档
- 6.2 模型层:云厂商既是渠道,也是股东与供应商
- 6.3 算力层:未履约合同余额与期限
- 6.4 一份 GPU 服务合同长什么样
- 6.5 循环安排:股权、贷款、担保与认股权证
- 6.6 并购整合:买的是分发、产品与算力出口
- 第七章 · 中国对照:同一条路,走得更快,披露更深
- 7.1 定价页:同样的三段式,同样的迁移方向
- 7.2 智谱:单列云端 API 毛利的模型公司
- 7.3 MiniMax:收入结构翻转之后的毛利
- 7.4 腾讯:免费智能体的成本落在哪里
- 7.5 地缘与制度:本报告的判断
- 第八章 · 本报告的保质期
- 8.1 为什么这个题材的数字按月过期
- 8.2 哪些数会在什么时候作废
- 8.3 两份 S-1 的位置
- 8.4 长期有效的部分
- 第九章 · A 股相关上市公司分类
- 9.1 这一章是什么
- 9.2 归位总表
- 9.3 主营直接对应(3 家)
- 9.4 主营部分对应(27 家)
- 9.5 具备能力但主营未列(62 家)
- 9.6 排除项或环节之外(382 家)
- 9.7 概念板块不等于产业链
- 9.8 非上市主要参与者
- 9.9 海外与港股可比公司
- 附录 A · 关键术语表
- 附录 B · 主要企业名录(按环节)
- 附录 C · 数据来源清单
- 附录 D · 本报告没做的事,以及为什么
- D.1 范围之外的三件事
- D.2 三处公开信息缺口,以及本报告的处置
- D.3 本报告没有取得的材料
- D.4 否定性断言的核验范围
- D.5 取数口径的限制
- 附录 E · 本报告的保质期
- E.1 会定时失效的数字
- E.2 会让判断需要重看的事件
- E.3 长期有效的部分
- E.4 本报告结论的主要不确定性
- 免责声明
试读版正文
第一章 · 总论:智能体的钱从哪来、按什么收
1.1 一句话定义与边界
本报告讨论的对象,是 AI 智能体这门生意的「收钱方式」。AI 智能体指这样一类软件(英文 AI agent):它接到一个目标后,会自己拆步骤、调用外部工具(搜索、数据库、代码执行、第三方系统接口)、根据中间结果调整下一步,直到把一件事做完,而不是回答一句话就结束。Anthropic 在自家工程博客里给过一个口径一致的描述:多智能体系统是「多个在循环里自主使用工具的大模型协同工作」(Anthropic《How we built our multi-agent research system》,2025-06-13,https://www.anthropic.com/engineering/multi-agent-research-system )。
这个区别决定了定价难题从哪来。一问一答的产品,一次请求消耗多少算力大致可以预估;智能体一次任务要循环多少步、每一步带多长的上下文、调用几次工具,事前都不知道。于是「一次多少钱」这个问题,在对话产品里是个定价问题,在智能体里首先是个风险分配问题。
本报告的边界如下:
| 含 | 不含 |
|---|---|
| 向终端买方收费的智能体产品(编码、客服、办公、通用任务) | 市场规模、增速、份额的测算 |
| 模型厂商按 token 向开发者和应用厂商收费的部分 | 模型能力的评测与排名 |
| 智能体运行平台(运行时、记忆、网关、工具)按资源计费的部分 | 智能体的技术架构与实现方式 |
| 算力层与模型厂商、应用厂商之间的长约、承诺用量与相关的股权、贷款、担保安排 | 芯片、服务器、光模块的制造环节(作为环节之外的卖方处理) |
| 海外为主体,中国作对照 | 训练数据的采购与标注(作为环节之外的卖方处理) |
排除市场规模的理由写在附录 D:这个题材的公开规模数字几乎全部来自匿名信源或第三方估算,把判断建在上面,等于把承重墙建在二手材料上。定价页、财报与合同附件不同,它们是厂商自己签字发布、对自己有约束力的文件。
1.2 链条上的五类角色
智能体的钱不是沿一条直线流动的。付钱的人和用的人常常不是同一批人(企业 IT 部门买座席、业务部门的员工在用),同一家模型可以直接卖、也可以经云厂商的市场转售,而且链条下游的算力供应商还在反向给上游的模型公司注资、放贷、担保。这是一张网状结构,不是分层链。
图 1 · 智能体的钱怎么流、每一段按什么计价
数据来源:本报告依据第二章所列 30 条产品线的官方定价页与第六章所列 SEC 文件整理,取数日 2026-09-27。
图 1 需要逐段读。第一段是应用层智能体厂商,它们直接面对终端买方,决定「按什么单位收钱」:Cursor、GitHub Copilot、Devin 按座席加额度,Intercom、Gorgias 按结果,Salesforce 可以按会话也可以按动作,Retell 按通话分钟。第二段是模型厂商,Anthropic、OpenAI、DeepSeek、月之暗面、智谱等,它们对外只有一种主计价单位:每百万 token。第三段是智能体运行平台,AWS AgentCore、Google Agent Platform、Microsoft Foundry、火山方舟 Managed Agents 等,它们把「运行一个智能体」拆成计算、内存、会话时长、调用次数分别计价。第四段是算力与数据中心,这一段按 GPU 小时收费,合同以年计。
这里需要解释两个撑着后文论证的词。token 是模型读写文字时使用的计量单位,一个 token 大约对应 1.5–2 个汉字或四分之三个英文单词;月之暗面的定价文档给出的换算是「1 个 Token 大约相当于 1.5–2 个汉字」(Kimi 开放平台《模型推理价格说明》,取于 2026-09-27,https://platform.kimi.com/docs/pricing/chat.md )。上下文是模型每一步推理时需要一并读入的全部文字,包括对话历史、检索到的资料和工具返回的结果;智能体走的步数越多,上下文越长,每一步读入的 token 越多,这是后文所有成本放大效应的来源。
环节之外的卖方单列在图底。芯片商、服务器与光模块制造商向算力层供货,但它们的收入按台、按片、按项目确认,不随「一次任务」浮动,所以不在本报告的计价链条内;训练数据供应商同理。第九章把 A 股概念板块成分股归位时,这一类公司落在「排除项或环节之外」。
1.3 四类付费方与各自的证据档次
谁付钱,决定了这笔钱能被看见多少。本报告按付费方把一手证据的档次排了一遍:
| 付费方 | 典型计价 | 能看到的一手证据 | 看不到的 |
|---|---|---|---|
| 个人订阅者 | 月付座席,附用量上限 | 官方定价页、用量说明、历史快照 | 实际用量分布、流失率 |
| 开发者 | 预充值,按 token 或按资源扣费 | 官方 API 价目表、官方算例 | 单个开发者的消耗 |
| 企业 IT 与业务部门 | 年约、承诺用量、按结果或会话 | 定价页上的公开档位、上市买卖双方的定期报告 | 企业议价后的实际单价 |
| 模型公司(作为算力买方) | 多年长约、GPU·小时 | 云厂商与算力商的 10-K、10-Q、招股书及合同附件 | 合同单价(附件里被遮盖) |
这张表的读法是:越往下,单笔金额越大、合同越长,但单价越不可见。Nscale 招股书附件里的 Anthropic GPU 服务订单,连「每 GPU 小时价格」一栏都以三个星号遮盖(Nscale Limited S-1 附件 10.25,2026-09-18,https://www.sec.gov/Archives/edgar/data/2110365/000119312526395475/ck0002110365-ex10_25.htm )。美国证监会规则允许发行人遮盖「不重大且通常作为机密对待」的合同条款(17 CFR 229.601,S-K 第 601 项,eCFR 现行版,https://www.ecfr.gov/current/title-17/chapter-II/part-229/subpart-229.600/section-229.601 ),发行人对单价作了这样的处理。所以本报告在算力层能拿到合同形态,拿不到合同单价。
1.4 计价单位谱系:七种单位,各自把风险放在谁身上
把 30 条产品线的主计价单位归类,可以得到七种。关键不在单位名称,在于每种单位把「这次任务到底要多少算力」的不确定性放在了哪一方。
| 单位 | 代表厂商(取于 2026-09-27) | 成本方差由谁承担 | 买方能否事前比价 |
|---|---|---|---|
| 座席(指按使用者人数、按月或按年收取的固定费用) | Gemini Enterprise 每席 21 美元起,Zendesk、Intercom 的人工座席 | 卖方 | 能,但只能比入场价 |
| 座席+额度 | Cursor、GitHub Copilot、Devin、Lindy、Replit | 额度内卖方,超额后买方 | 部分能 |
| token 透传 | 模型 API、Cursor 企业版第三方模型、Anthropic 企业版用量 | 买方 | 能比单价,不能比总价 |
| 资源时长 | AWS AgentCore、Google Agent Platform、Foundry、Kimi 托管智能体 | 买方 | 能 |
| 按动作或按次 | Salesforce Flex Credits、Dialogflow、Copilot Studio、Zapier | 大部分在卖方 | 能比单价,动作数难估 |
| 按会话或按分钟 | Salesforce 按会话、Freshworks、Retell、Amazon Connect | 卖方 | 能 |
| 按结果 | Intercom、Gorgias、Zendesk、Salesforce Help Agent、Sierra(后者未公开单价) | 卖方,但定义权也在卖方 | 能比单价,不能比定义 |
数据来源:各厂商官方定价页,取于 2026-09-27,网址见第二章表 2-1。
这张表的规律是:单位离算力越近,风险越在买方;离业务结果越近,风险越在卖方。 卖方愿意承担风险的地方,只有两种:一是单次成本上界可控(客服会话有明确的步数上限和答案库),二是单价高于成本(按结果收费的单价在小模型加缓存时是成本的数倍到十倍以上,在 Sonnet 5 不缓存、解决率一半时只有约 1.5 倍,见 5.3 节)。编码类智能体两个条件都不满足,一次会话可以跑几分钟也可以跑几小时,所以它们从「按次」退回到「座席+按 token 或按模型调用计的额度」。
1.5 为什么现在要看定价,而不是规模
一个行业在早期,规模数字大多是预测,定价却是已经发生的事实。定价页上的每一个数都是厂商愿意兑现的承诺,改价会留下痕迹,历史快照能把痕迹找回来。本报告因此把证据的重心放在定价页、历史快照与合同附件上。
第二个原因是时点。Anthropic 于 2026-06-01 向 SEC 保密递交 S-1 草案(Anthropic 官方公告《Anthropic confidentially submits draft S-1 to the SEC》,2026-06-01,https://www.anthropic.com/news/confidential-draft-s1-sec );OpenAI 随后于 2026-06-08 在官网发布《Confidential submission of draft S-1 to the SEC》,本报告访问该页面被拒(返回 403),标题与日期经新闻搜索确认,内容转引 TechCrunch《OpenAI files confidentially for IPO, following Anthropic》(2026-06-08)。市场对「智能体到底赚不赚钱」的讨论会在公开版 S-1 发布前后集中出现。本报告在那之前,把能从公开定价与公开合同里读出的机制先写清楚,公开版发布后再做一次定向更新;更新的触发条件写在第八章。
第二章 · 计价单位横截面:2026 年 9 月的 30 条官方定价
2.1 取样与口径
本章回答一个问题:2026 年 9 月,智能体链条上各段的厂商在官方定价页上公开的计价单位是什么、单价是多少。取样方法是直接访问官方定价页或官方文档页,取数日统一为 2026-09-27;取不到的不补二手数字,只记录原因。
本报告共尝试 35 条产品线的官方页面,其中 30 条取到了计价页面,覆盖 24 家厂商;其中 Sierra 一条官网只写「按结果计价」、未公开单价(本报告计算:对 35 个官方网址逐一访问,HTTP 状态为 200 且页面含价格文本的计为取到)。未取到的四条是:ChatGPT 个人版定价页(返回 403 拒绝访问)、HubSpot Credits 说明页(返回 404)、ServiceNow 定价页(连接失败)、Manus 定价页(页面只有导航文字、价格由网页动态加载、未能取得)。阿里云百炼的模型页取到了,但页面只列模型清单不列单价,因此不计入 30 条。
表 2-1 把 30 条产品线按图 1 的分段排列,列出主计价单位与页面上的公开单价摘要。
表 2-1 · 30 条产品线的官方计价单位与单价(取于 2026-09-27)
| # | 厂商与产品线 | 所在段 | 主计价单位 | 公开单价摘要 | 官方页面 |
|---|---|---|---|---|---|
| 1 | Anthropic Claude 订阅 | 应用层 | 座席+用量上限;企业版为座席+按 API 价计的用量 | Pro 月付 20 美元;Team 标准席年付每月 20 美元、高级席 100 美元;Enterprise 每席每月 20 美元另加按 API 价计的用量 | https://www.anthropic.com/pricing |
| 2 | Anthropic Claude 平台 | 模型层与运行平台 | 每百万 token;Managed Agents 另按活跃会话小时 | Sonnet 5 输入 2 美元、输出 10 美元;Opus 5.5 输入 4 美元、输出 20 美元;Managed Agents 每会话小时 0.08 美元;网页搜索每千次 10 美元 | https://www.anthropic.com/pricing |
| 3 | OpenAI API | 模型层 | 每百万 token;内置工具按次或按会话 | GPT-5.6 Terra 输入 2 美元、输出 12 美元;网页搜索每千次 10 美元;1GB 容器每 20 分钟 0.03 美元 | https://developers.openai.com/api/docs/pricing |
| 4 | OpenAI Codex 与 ChatGPT Work | 应用层 | 订阅+credits,credits 按 token 折算 | GPT-5.6 Sol 每百万输入 token 100 credits、输出 500 credits;GPT-5.6 每条消息平均 5–30 credits | https://developers.openai.com/codex/pricing |
| 5 | AWS Bedrock AgentCore | 运行平台 | vCPU·小时、GB·小时、每千次调用或事件 | Runtime v2 每 vCPU 小时 0.1276 美元、每 GB 小时 0.0169 美元;网关每千次调用 0.005 美元;短期记忆每千事件 0.25 美元 | https://aws.amazon.com/bedrock/agentcore/pricing/ |
| 6 | Amazon Connect | 应用层(客服) | 按消息、按分钟 | 聊天每条 0.010 美元,语音每分钟 0.038 美元 | https://aws.amazon.com/connect/pricing/ |
| 7 | Google Agent Platform | 运行平台 | vCPU·小时、GiB·小时;部分按请求计量的服务折算为 vCPU·小时 | Agent Compute 每 vCPU 小时 0.085 美元,Agent Memory 每 GiB 小时 0.009 美元 | https://cloud.google.com/vertex-ai/pricing |
| 8 | Google Gemini Enterprise | 应用层 | 座席;另有零座席费的按量版 | Business 每席每月 21 美元起,Standard 与 Plus 30 美元起 | https://cloud.google.com/gemini-enterprise |
| 9 | Google Conversational Agents | 应用层(客服) | 按请求、按音频秒 | 生成式 Playbooks 每次请求 0.012 美元、语音每秒 0.002 美元 | https://cloud.google.com/dialogflow/pricing |
| 10 | Microsoft Foundry Agent Service | 运行平台 | 原生智能体不另收费;托管智能体按容器小时;记忆按千事件 | 托管 vCPU 每小时 0.0994 美元(美国东部);短期记忆每千事件 0.25 美元;记忆检索每千次 0.50 美元 | https://azure.microsoft.com/en-us/pricing/details/foundry-agent-service/ |
| 11 | Microsoft Copilot Studio | 应用层与平台 | Copilot Credits,按功能折算 | 按量每 credit 0.01 美元;生成式回答 2 credits、智能体动作 5 credits | https://learn.microsoft.com/en-us/microsoft-copilot-studio/requirements-messages-management |
| 12 | GitHub Copilot | 应用层(编码) | 座席+AI Credits,按 token 折算 | Pro 每月 10 美元,含 10 美元基础额度与 5 美元浮动额度;1 credit 合 0.01 美元 | https://github.com/features/copilot/plans |
| 13 | Cursor | 应用层(编码) | 座席+两个用量池;团队与企业版的第三方模型另加每百万 token 0.25 美元 | Pro 20 美元、Pro+ 60 美元、Ultra 200 美元;Teams 标准席 40 美元、高级席 120 美元 | https://cursor.com/docs/models-and-pricing |
| 14 | Devin(含原 Windsurf) | 应用层(编码) | 座席+配额,超额按 API 价 | Pro 20 美元、Max 200 美元;Teams 每月 80 美元另加每席 40 美元 | https://devin.ai/pricing |
| 15 | Replit | 应用层(编码) | 订阅+credits;按工作量计费的检查点 | 第三方模型调用按供应商公开 API 价从 credits 中扣减 | https://docs.replit.com/billing/ai-billing |
| 16 | Lovable | 应用层(编码) | credits | 「改按钮颜色」0.50 credit,「加登录功能」1.20 credits;不同套餐的 credit 价值不一定相等 | https://lovable.dev/pricing |
| 17 | Lindy | 应用层(通用) | 座席+credits | Plus 每人每月 29.99 美元含 3,000 credits;日常任务 2–250 credits,大型构建 1,000–2,500 credits | https://www.lindy.ai/pricing |
| 18 | Zapier Agents | 应用层(通用) | 活动次数 | Pro 年付折合每月 33.33 美元,含每月 1,500 次活动 | https://zapier.com/pricing |
| 19 | Intercom Fin | 应用层(客服) | 按结果+人工座席 | 每次结果 0.99 美元,语音结果 1.99 美元;接入其他客服系统时每月至少约 50 次 | https://www.intercom.com/pricing |
| 20 | Zendesk AI agents | 应用层(客服) | 按自动解决计量,单价未公开 | Suite Professional 每人每月 115 美元(年付) | https://www.zendesk.com/pricing/ |
| 21 | Freshworks Freddy AI Agent | 应用层(客服) | 按会话包 | 每 100 次会话 49 美元;邮件会话以 72 小时为一次 | https://www.freshworks.com/freshdesk/pricing/ |
| 22 | Gorgias AI Agent | 应用层(客服) | 按工单+按自动处理 | 每次自动处理 0.85–1.00 美元;不按座席收费 | https://www.gorgias.com/pricing |
| 23 | Salesforce Agentforce | 应用层(客服与业务) | Flex Credits、按会话、按用户三选 | 每 10 万 credits 500 美元,一次动作 20 credits;每次会话 2 美元;员工附加包每人每月 125 美元不计量 | https://www.salesforce.com/agentforce/pricing/ |
| 24 | Sierra | 应用层(客服) | 按结果,单价未公开 | 官网只写「outcome-based pricing」 | https://sierra.ai/ |
| 25 | Retell AI | 应用层(语音) | 按分钟,拆分模型、语音与电话 | 每分钟 0.07–0.31 美元;默认配置 0.11 美元 | https://www.retellai.com/pricing |
| 26 | ElevenLabs | 应用层与平台(语音) | 订阅+credits | Business 每月 990 美元含 600 万 credits;语音合成每字符 1 credit | https://elevenlabs.io/pricing |
| 27 | DeepSeek API | 模型层 | 每百万 token,分高峰与低谷 | deepseek-flash 缓存未命中输入低谷 0.15 美元、高峰 0.3 美元;输出低谷 0.6 美元、高峰 1.2 美元 | https://api-docs.deepseek.com/quick_start/pricing |
| 28 | Kimi 开放平台 | 模型层与运行平台 | 每百万 token;托管智能体沙箱按小时、插件按千次 | kimi-k3 输入 20 元、输出 100 元;沙箱 1 核 1GB 每小时 0.072 元;插件每千次 1–450 元 | https://platform.kimi.com/docs/pricing/hosted-agents.md |
| 29 | 智谱开放平台 | 模型层与应用层(编码) | 每百万 token;GLM Coding Plan 按 token 抵扣积分 | GLM-5.3 输入 8 元、输出 28 元;Coding Plan 非高峰时段按基础积分的 50% 抵扣 | https://docs.bigmodel.cn/cn/coding-plan/overview.md |
| 30 | 火山方舟 | 模型层与运行平台 | 每百万 token;Managed Agents 按 token、运行时长、工具调用三项累加 | 首次开通赠 30 小时运行时与 500 次网页搜索 | https://www.volcengine.com/docs/82379/1544106 |
数据来源:上表各行官方页面,取于 2026-09-27;第 10、11 行的美元单价另经微软官方零售价格接口核对(https://prices.azure.com/api/retail/prices ,查询词 Foundry Agent 与 Copilot,取于 2026-09-27);第 15 行的现行套餐页访问返回 403,套餐价沿革见 3.4 节所引存档。
这张表横着读,能看出三件事。第一,30 条里只有 Gemini Enterprise 一条以座席为主计价单位,而且它同时提供零座席费的按量版;其余 29 条都至少带一个用量维度(本报告计算:按表 2-1「主计价单位」列逐行判定)。第二,公开单价越往下游越细:运行平台可以细到每千次调用 0.005 美元,模型层细到每百万 token,而应用层有 2 条不公开智能体部分的单价(Zendesk 与 Sierra)。第三,中国四家的结构与海外同构:DeepSeek 与智谱按时段打折,Kimi 与火山方舟把托管智能体拆成模型、运行时、工具三项分别计价,与 AWS、Google 的做法一致。
2.2 运行平台:单位最细,价格接近,计量规则不同
运行平台是这条链上最像公用事业的一段。表 2-2 把五家运行平台的同类单价并排。
表 2-2 · 智能体运行平台的同类单价(取于 2026-09-27)
| 项目 | AWS AgentCore | Microsoft Foundry | Google Agent Platform | Anthropic Managed Agents | Kimi 托管智能体 |
|---|---|---|---|---|---|
| 计算(每 vCPU 小时) | 0.1276 美元(v2 按量);0.0895 美元(v1) | 0.0994 美元(托管容器,美国东部) | 0.085 美元 | 按会话小时 0.08 美元,不拆计算与内存 | 1 核 1GB 每小时 0.072 元 |
| 内存(每 GB 小时) | 0.0169 美元(v2);0.00945 美元(v1) | 0.0118 美元 | 0.009 美元 | 同上 | 同上 |
| 短期记忆(每千事件) | 0.25 美元 | 0.25 美元 | 按存储与读写折算 | 未单列 | 未单列 |
| 长期记忆存储(每千条每月) | 0.25 或 0.75 美元 | 0.25 美元 | 按存储与读写折算 | 未单列 | 未单列 |
| 记忆检索(每千次) | 0.50 美元 | 0.50 美元 | 每 300 万次读操作折 1 vCPU 小时 | 未单列 | 未单列 |
| 空闲时间是否计费 | 等待模型与工具响应时 CPU 不计费 | 按容器运行小时 | 两轮对话之间的空闲不计费 | 按「活跃运行时」 | 按运行时长,最小按秒 |
数据来源:AWS AgentCore 定价页(https://aws.amazon.com/bedrock/agentcore/pricing/ );微软官方零售价格接口 Foundry Agents 条目,生效日 2026-02-01 至 2026-05-01(https://prices.azure.com/api/retail/prices );Google Vertex AI 定价页(https://cloud.google.com/vertex-ai/pricing );Anthropic 定价页(https://www.anthropic.com/pricing );Kimi《托管智能体定价》(https://platform.kimi.com/docs/pricing/hosted-agents.md );均取于 2026-09-27。
两家最大的云厂商对「记忆」这一项的标价完全一样:每千条短期事件 0.25 美元、每千次检索 0.50 美元。每 vCPU 小时的计算价落在 0.085–0.1276 美元之间,最高与最低相差 1.5 倍(本报告计算:0.1276 ÷ 0.085 = 1.50)。这一段已经是可以横比价格的商品市场。
但单位一致不等于账单一致。AWS 的计算只对「活跃处理」计费,等待模型响应、等待工具返回的时间 CPU 不收钱;AWS 在定价页上写明,智能体工作负载通常有 30%–70% 的时间在等待(厂商自述,AWS AgentCore 定价页 Browser 与 Code Interpreter 条目,取于 2026-09-27)。Google 对两轮对话之间的空闲也不计费;微软托管容器则按容器运行时长计。所以同样一个 10 分钟的会话,按 AWS 规则可能只计 1 分钟 CPU,按容器规则计满 10 分钟。可比的是单价,不可比的是计量规则。
AWS 自己的官方算例把这个差别算得很清楚:一个处理订单查询的客服智能体,单次会话 10 分钟、90% 时间在等待,v2 按量计价下 CPU 费 0.002127 美元、内存费 0.004576 美元,单会话运行时成本 0.006703 美元(AWS AgentCore 定价页 Runtime microVMs v2 算例,取于 2026-09-27)。这个数只含运行时,不含模型 token,后面 5.3 节会看到,它只是一次会话总成本里很小的一块。
2.3 模型层:token 仍是通用货币,但一个 token 的价格已经有六个维度
模型层的计价单位没有变过,一直是每百万 token;变的是同一个 token 的价格维度越来越多。把表 2-1 里模型厂商及相关平台的页面逐条读下来,一个 token 的价格至少取决于六件事:
| 维度 | 官方页面上的表述 | 价格差 |
|---|---|---|
| 输入、缓存、输出 | 各家均分三到四档 | Anthropic Sonnet 5 缓存读取每百万 0.20 美元,是普通输入 2 美元的十分之一 |
| 上下文长度 | OpenAI 对长上下文另列一档;火山方舟按输入长度分段计价 | OpenAI GPT-5.6 Sol 长上下文输入 8 美元,是短上下文 4 美元的两倍 |
| 速度 | Anthropic Opus 5.5 快速模式;OpenAI 的 Fast mode | Anthropic 快速模式为标准价的 2 倍;Codex 的 GPT-6 快速模式按 2.5 倍消耗 credits |
| 时段 | DeepSeek、智谱、火山方舟设高峰与低谷 | DeepSeek 低谷价为高峰价的一半 |
| 地域 | Anthropic 美国境内推理、OpenAI 数据驻留、Cursor 数据驻留 | 分别加价 10% |
| 批处理 | Anthropic、OpenAI、火山方舟 | 批处理约为在线价的 50% |
数据来源:Anthropic 定价页(https://www.anthropic.com/pricing );OpenAI《Pricing》(https://developers.openai.com/api/docs/pricing );OpenAI《Codex Pricing》(https://developers.openai.com/codex/pricing );DeepSeek《Models & Pricing》(https://api-docs.deepseek.com/quick_start/pricing );智谱《套餐概览》(https://docs.bigmodel.cn/cn/coding-plan/overview.md );火山方舟《模型价格》(https://www.volcengine.com/docs/82379/1544106 );Cursor《Models & Pricing》(https://cursor.com/docs/models-and-pricing );均取于 2026-09-27。
这些维度对智能体的影响比对对话产品大得多。智能体每一步都要把前面的对话与工具结果重新读一遍,缓存命中率(指模型对重复出现的前缀直接读缓存、按低价计费的比例)决定了大部分输入按原价还是按一折计费。智谱在 GLM Coding Plan 的说明里给出了一组官方换算:同样的 Pro 套餐,缓存命中率 95% 时每周可用 GLM-5.3 约 2.90–5.80 亿 token,98% 时约 3.13–6.27 亿 token(智谱《套餐概览》可用额度参考表,取于 2026-09-27)。命中率差三个百分点,可用量差约 8%(本报告计算:3.13 ÷ 2.90 − 1 = 7.9%)。
所以模型层的「单价可比」是有条件的:只有在同一档(同样的输入输出比、同样的缓存命中率、同样的速度档与时段)里比才有意义。跨厂商比较一个智能体跑一次的模型费,必须先把这六个维度对齐,而买方往往不知道自己的缓存命中率。
2.4 应用层(编码与通用):座席+额度成了默认形态
编码与通用任务类的 7 条产品线(表 2-1 第 4、12–15、17 行与第 1 行的个人档)全部采用「座席+额度」(第 16 行 Lovable 只按 credits、第 18 行 Zapier 按活动次数,不计入):付一个固定的月费,得到一笔用量额度(额度,指座席费里附带、按厂商规则折算的用量),用完再按量付费或升档(本报告计算:逐行核对表 2-1)。差别在于额度用什么计价:
| 额度的计价方式 | 厂商 | 买方能否换算成美元 |
|---|---|---|
| 直接以美元计,按模型 API 标价扣减 | Cursor、GitHub Copilot(1 credit=0.01 美元)、Replit、Devin 超额部分 | 能 |
| 以 credits 计,与 token 挂钩且换算比例公开 | OpenAI Codex(每百万 token 对应固定 credits 数)、智谱 Coding Plan(公开抵扣系数) | 能换算成 token,单个 credit 或积分的价格不公开 |
| 以 credits 计,与 token 的关系不公开 | Lovable、Lindy | 只能从套餐价倒推 |
数据来源:同表 2-1 各行,取于 2026-09-27。
OpenAI 这一行值得单独算一下。Codex 的 credits 价目表里,GPT-6 Sol 每百万输入 token 50 credits,API 标价是 2 美元;GPT-6 Astra 250 credits 对 10 美元;GPT-5.6 Sol 100 credits 对 4 美元;GPT-5.6 Terra 输出 300 credits 对 12 美元。每一对的比值都是 25(本报告计算:以 OpenAI《Codex Pricing》的 credits 表与 OpenAI《Pricing》的 API 标准价逐项相除,取于 2026-09-27)。也就是说,Codex 的 credits 被锚定在「每 1 美元 API 标价折 25 credits」,但 1 个 credit 卖多少钱,页面写的是「取决于你的套餐或协议」。买方能算出自己用了多少 token,算不出每个 token 实际付了多少钱。
厂商自己对用量的描述也说明了座席价和实际消耗的距离。Cursor 文档写「每天使用智能体的用户,每月总用量通常在 60–100 美元」,而 Pro 座席是每月 20 美元(Cursor《Models & Pricing》,取于 2026-09-27,厂商自述)。Lindy 把一件任务按规模分成三档,「日常请求」2–250 credits,「深度工作」250–1,000 credits,「大型构建」1,000–2,500 credits;按 Plus 套餐 29.99 美元对应 3,000 credits 换算,一件任务的价格从 0.02 美元到 25 美元不等,最大与最小相差 1,250 倍(本报告计算:29.99 ÷ 3,000 ≈ 0.01 美元每 credit;2,500 ÷ 2 = 1,250)。
这就是应用层「一件活多少钱」消失的直接原因:连厂商自己都给不出一个稳定的数。
2.5 应用层(客服与业务流程):按结果、按会话、按动作并存
客服类的 10 条产品线(表 2-1 第 6、9、11、19–25 行)是另一番景象:几乎每家都公开了一个与业务事件挂钩的单价。事件的颗粒度从细到粗排列是:每条消息(Amazon Connect 0.010 美元)、每秒语音(Dialogflow 0.002 美元)、每次动作(Salesforce 0.10 美元、Copilot Studio 0.05 美元)、每分钟通话(Retell 0.07–0.31 美元)、每次会话(Freshworks 0.49 美元、Salesforce 2 美元)、每次结果(Intercom 0.99 美元、Gorgias 0.85–1.00 美元)。
(本报告计算:Freshworks 每 100 次会话 49 美元,折 0.49 美元每次;Salesforce 每 10 万 credits 500 美元、一次动作 20 credits,折 0.10 美元;Copilot Studio 智能体动作 5 credits、每 credit 0.01 美元,折 0.05 美元。数据来源同表 2-1。)
客服场景能公开单价,原因在第四章展开:一次客服会话的步数、上下文长度、可调用的工具都有上限,卖方能估出成本的上界。Amazon Connect 的定价页甚至把「不按座席、不按 token」写成卖点:「no seat-based licensing requirements, and no tokens」(Amazon Connect Customer Pricing,取于 2026-09-27,https://aws.amazon.com/connect/pricing/ )。这与编码类的趋势正好相反,也说明「退回 token」不是全行业的方向,而是成本方差大的那一类产品的方向。
2.6 这张横截面怎么用:哪些数能横比,哪些不能
把本章的材料收拢成一张使用说明:
| 可以横比 | 前提 | 不能横比 | 原因 |
|---|---|---|---|
| 运行平台的每 vCPU 小时、每千次记忆事件单价 | 同时比较空闲时间计不计费 | 不同厂商的 credits | credit 的美元价值与消耗规则都由各家自定,Lovable 明写同一厂商不同套餐的 credit 价值也不相等 |
| 模型 token 标价 | 对齐六个维度 | 套餐「包含多少用量」 | 额度按 5 小时、每周、每月三种周期重置,且有浮动额度 |
| 客服类按结果、按会话单价 | 同时比较「结果」与「会话」的定义 | 「一次任务多少钱」 | 厂商已不再给出这个数,给出的区间跨度达上千倍 |
数据来源:本章表 2-1 至表 2-2 所引官方页面,取于 2026-09-27。
「跨厂商横比单位成本这件事现在做不成」的说法,按这张表需要改写:在运行平台与模型标价两层做得成,在应用层做不成。 第三章用历史快照说明应用层是怎么一步步变得不可比的。
第三章 · 计价单位迁移史:历史快照里的同一家厂商
3.1 取样方法
横截面只能说明「现在是什么」,说明不了「是怎么变过来的」。本章用互联网档案馆(即 Internet Archive,一家长期保存网页历史快照的非营利机构)保存的官方定价页历史快照,把 8 家厂商从 2023 年 3 月到 2026 年 9 月的计价方式逐张读出来。取样规则是:每家按半年左右取一张快照,只读快照里的原文,不用第三方对这些改动的描述。快照网址统一写成「web.archive.org/web/时间戳/原网址」的形式,读者可以直接打开到那一天的那一页。
本章另用两类官方材料补足快照够不到的地方:一是厂商的官方公告与更新日志(GitHub、智谱、微软),二是微软官方零售价格接口里各计费项的生效日期。后者是机器可读的官方价目表,GitHub Copilot 与 Copilot Studio 的计费项都在其中,每一项都带「生效起始日」字段(https://prices.azure.com/api/retail/prices ,查询词 Copilot,取于 2026-09-27)。
3.2 编码类:从「500 次请求」到「按 API 价格计费」
在本报告追踪的六家里,Cursor 动手最早。表 3-1 把它四个时点的专业版条款并排。
表 3-1 · Cursor 专业版条款的四个时点
| 快照日期 | 专业版月费 | 用量怎么写 | 快照网址 |
|---|---|---|---|
| 2024-07-01 | 20 美元 | 每月 500 次快速 GPT-4 调用,慢速调用不限 | web.archive.org/web/20240701003908/cursor.com/pricing |
| 2025-04-10 | 20 美元 | 每月 500 次快速高级请求;o3-mini 一次只算三分之一次 | web.archive.org/web/20250410060951/cursor.com/pricing |
| 2025-07-29 | 20 美元 | 「智能体使用上限延长」;常见问题写「专业版每月至少包含按 API 价格计的 20 美元智能体模型推理」 | web.archive.org/web/20250729150422/cursor.com/pricing |
| 2026-09-27 | 20 美元 | 两个用量池:自有模型池与第三方模型池,后者按模型 API 价扣减;团队与企业版的第三方模型每百万 token 另加 0.25 美元 | cursor.com/docs/models-and-pricing |
数据来源:上表快照与 Cursor 官方文档,取于 2026-09-27。
在本报告取得的四个时点(2024-07 至 2026-09,约两年零三个月)里月费没动过,变的是这 20 美元换到的东西。2024 年按 500 次请求折算,每次 0.04 美元(本报告计算:20 ÷ 500 = 0.04);2025 年 6 月 16 日起不再给次数,改为「按 API 价格计的 20 美元推理」(Cursor《Clarifying our pricing》,2025-07-04,https://cursor.com/blog/june-2025-pricing ),也就是把 20 美元原封不动地换成了 token。到 2026 年 9 月,Cursor 在第三方模型之外加了一层「Cursor Token Rate」,每百万 token 0.25 美元,而它自有的 Grok 与 Composer 模型免收这一项(Cursor《Models & Pricing》,取于 2026-09-27)。这个差异的背景在 6.6 节:Cursor 已于 2026-08-14 被 SpaceX 收购,Grok 是收购方的模型。
2025 年 4 月那张快照里还有一个细节:o3-mini「一次只算三分之一次请求」。这说明按次计价在它的最后阶段已经开始给不同模型打系数,相当于在「次」这个单位内部重新引入了成本差异。系数一多,「次」就只剩下名字。
3.3 GitHub 的原话:为什么按次收费撑不住
GitHub Copilot 的迁移是这一批里留下官方理由最完整的。表 3-2 是它的三个阶段。
表 3-2 · GitHub Copilot 的计价三阶段
| 阶段 | 起止 | 专业版条款 | 出处 |
|---|---|---|---|
| 按座席、不限量 | 至 2025 年上半年 | 每月 10 美元,对话不限条数 | web.archive.org/web/20240601185013/github.com/features/copilot/plans |
| 按次(高级请求) | 2025-06 前后至 2026-05-31 | 每月 10 美元含 300 次高级请求,超出部分每次 0.04 美元 | web.archive.org/web/20250603023935/github.com/features/copilot/plans ;微软零售价格接口「Premium Request」0.04 美元,生效 2025-03-01 |
| 按 token(AI Credits) | 2026-06-01 起 | 每月 10 美元含 10 美元基础额度与 5 美元浮动额度,1 credit 合 0.01 美元,按各模型 API 价扣减 | github.com/features/copilot/plans ;微软零售价格接口「AI Credit GAC」0.01 美元,生效 2026-06-01 |
数据来源:上表快照与接口,取于 2026-09-27。
GitHub 首席产品官在 2026-04-27 的官方博客里给出了切换理由,原文值得完整引用:「Today, a quick chat question and a multi-hour autonomous coding session can cost the user the same amount. GitHub has absorbed much of the escalating inference cost behind that usage, but the current premium request model is no longer sustainable.」意思是:今天,一个快速的对话提问和一次数小时的自主编码会话,用户付的钱可能一样;GitHub 承担了其中不断上涨的推理成本,但现行的高级请求模式已经不可持续(GitHub Blog《GitHub Copilot is moving to usage-based billing》,2026-04-27,https://github.blog/news-insights/company-news/github-copilot-is-moving-to-usage-based-billing/ )。
这段话里有三个信息。第一,成本上涨来自「智能体化」:同一篇博客写 Copilot「已从编辑器里的助手演变为能运行长时间、多步骤编码会话的智能体平台」。第二,按次计价下卖方在补贴重度用户,补贴大到「不可持续」(厂商自述)。第三,切换前 GitHub 已经在用限流对冲:博客写明发文前一周对个人版做了「临时调整」,并「暂停了自助购买商业版」,理由是「可靠性与性能」。2026-06-01 的更新日志确认切换已生效,同时写「新用户注册仍暂停」(GitHub Changelog《Updates to GitHub Copilot billing and plans》,2026-06-01,https://github.blog/changelog/2026-06-01-updates-to-github-copilot-billing-and-plans )。
切换前 GitHub 同时收紧了个人版用量并暂停商业版自助购买,官方理由是可靠性与性能;随后才换计量单位。按次计价不是被「更好的定价」替代的,而是在成本压力下撤掉的:博客的原话是现行模式「不可持续」(厂商自述)。座席价格一分没动(专业版 10 美元、商业版每人 19 美元、企业版每人 39 美元),动的是座席里包含的东西。
3.4 被撤下的换算,以及另一条路:Devin、Replit、Copilot Studio、GitLab
前三家的变化方式不同,但方向一致:把「一件活折多少钱」的公开换算撤下来。第四家 GitLab 走了另一条路。
Devin(Cognition 公司)曾经有一个自定义单位 ACU(即 Agent Compute Unit,官方定义为「对 Devin 所用资源的归一化度量」)。2024 年 12 月的快照写团队版每月 500 美元含 250 个 ACU,折每 ACU 2.00 美元(本报告计算:500 ÷ 250);2025 年 9 月的快照新增按量版,每 ACU 2.25 美元,团队版仍折 2.00 美元(web.archive.org/web/20241211030344/devin.ai/pricing ;web.archive.org/web/20250909144504/devin.ai/pricing )。2026 年 1 月 23 日的快照里 ACU 单价仍在;到 2026 年 6 月 6 日的快照,页面首行变成「Windsurf is now Devin Desktop」,ACU 从公开页面消失,换成「专业版每月 20 美元、超额按 API 价购买」(web.archive.org/web/20260123204157/devin.ai/pricing ;web.archive.org/web/20260606211533/devin.ai/pricing )。一个厂商自造的单位,存续约一年半后退回到 token。
Replit 撤掉的是一句括号里的换算。2025 年 5 月的快照写 Core 套餐「每月 25 美元额度(约 100 个智能体检查点)」,折每个检查点约 0.25 美元(本报告计算:25 ÷ 100);两个月后的 2025 年 7 月快照里,同一行只剩「每月 25 美元额度」(web.archive.org/web/20250504133953/replit.com/pricing ;web.archive.org/web/20250701223212/replit.com/pricing )。Replit 官方博客写明,按工作量计价自 2025-06-18 起对新用户生效,7 月 1 日起推给存量用户(Replit《Introducing Effort-Based Pricing for Replit Agent》,2025-06-18,https://blog.replit.com/effort-based-pricing )。现在 Replit 官方文档把计费方式称为「按工作量计价」:简单请求便宜,复杂构建合并成一个检查点、可能更贵,调用第三方模型「按供应商公开 API 价」从额度里扣(Replit《Replit AI Billing》,取于 2026-09-27,https://docs.replit.com/billing/ai-billing )。
Microsoft Copilot Studio 是改名不改价。微软文档写「自 2025 年 9 月 1 日起,智能体的通用计量单位由 messages 改为 Copilot Credits,预付包数量与按量单价不变」(Microsoft Learn《Licensing for agents powered by the standard harness》,2026-08-03 更新,https://learn.microsoft.com/en-us/microsoft-copilot-studio/billing-licensing );微软零售价格接口里,「Pay As You Go Message」0.01 美元生效于 2024-12-01,「Pay As You Go Copilot Credit」0.01 美元生效于 2025-09-01,单价确实没变。改名的意义在于「消息」这个词暗示「一问一答」,而 credits 可以按任意功能折算:同一页价目表上,一次生成式回答 2 credits、一次智能体动作 5 credits、一次租户图谱检索 10 credits(Microsoft Learn《Copilot Credits billing rates》,取于 2026-09-27,https://learn.microsoft.com/en-us/microsoft-copilot-studio/requirements-messages-management )。
GitLab 不在表 2-1 的 30 条之内,本报告补充取得了它的官方页面。GitLab 现行的智能体功能以 GitLab Credits 计费,每个 credit 1 美元(GitLab Pricing,取于 2026-09-27,https://about.gitlab.com/pricing/ );其官方博客在 2026-03-19 发布过《Agentic code reviews for $0.25 each》一文(标题与日期经新闻搜索确认,原页未能访问)。它的官方文档把智能体功能分成两类计费:多数智能体功能「按每次模型调用计费」,不同模型一个 credit 能调用的次数不同,例如 claude-opus-5.5 为 1.35 次、gpt-6-astra 最低档为 0.31 次;另一类是「固定价」功能,「每次端到端执行扣除预设数量的 credits,不论期间调用了多少次模型」,其中代码审查流程一个 credit 可执行 4 次,折每次 0.25 美元,漏洞修复流程一个 credit 可执行 0.25 次,折每次 4 美元;流程失败时分两种情形:GitLab.com 托管版「流程未完成即失败的不扣 credits」,自部署并使用自托管模型时,固定价功能「即使流程失败也按全价计费」(GitLab Docs《GitLab Credits》,取于 2026-09-27,https://docs.gitlab.com/subscriptions/gitlab_credits/ ;每次价格为本报告计算:1 ÷ 4 = 0.25,1 ÷ 0.25 = 4)。
GitLab 的做法不推翻本章的方向,反而把机制说得更清楚:开放式的智能体对话,计量单位从「用户请求」下沉到「模型调用」并按模型分价;边界清楚、输入可控的子任务(审一次代码、修一个漏洞),卖方敢给一个固定的按次价。能不能按次收费,取决于这个「次」的成本方差有多大,而不取决于它是不是编码场景。
上市公司文件里也有同一方向的证据。Figma 的 2026 年二季度 10-Q 写道:「2025 年我们在所有 Figma 座席引入了 AI credits;2026 年 3 月起开始执行 AI credit 限额,并提供按月加购与按量付费两种增量方式」(Figma Inc. 10-Q,截至 2026-06-30,https://www.sec.gov/Archives/edgar/data/1579878/000162828026053348/fig-20260630.htm )。从「附送」到「限额」再到「加购」,与 GitHub 的三阶段同构。
图 2 · 六家厂商编码与智能体套餐的计价单位迁移(2024-06 至 2026-09)
数据来源:本章所引官方定价页历史快照、GitHub 官方博客与更新日志、Microsoft Learn、智谱官方公告,取于 2026-09-27。
图 2 把六家的迁移放在同一条时间轴上。深色段集中在 2025 年,浅色段在 2025 年下半年到 2026 年年中陆续接上:迁移不是某一个月的集体行动,而是一条持续约一年的斜线。这也是 3.6 节修正「2026 年」这一时间判断的依据。
以上是免费试读部分(正文约 30%)。完整版包含全部 15 章正文、全部数据表与来源清单。
以上是免费试读部分。完整版包含全部章节与数据表。单篇 ¥380。