MLOps 机器学习工程化 · 行业认知研究报告
赛道本质
MLOps ***不是一个独立行业***,它是「模型能力」与「企业生产要求」之间的补丁层。落差扩大它就长,落差被上游填平它就被吸收。
核心判断
- 1
行业本质:MLOps ***不是一个独立行业***,它是「模型能力」与「企业生产要求」之间的补丁层。落差扩大它就长,落差被上游填平它就被吸收。
- 2
一 · 工具层的钱在变多,占比在变少
- 3
二 · MLOps 工具层与 GPU 同挤在「基础设施」一格里,是这一格里的少数派
- 4
三 · 赚钱的主要是把工具捆进平台卖的厂商,增速差距主要来自位置
- 5
四 · 最值钱的独立公司被上游、下游客户或平台厂商买走,没有一笔发生在独立工具厂商之间
- 6
五 · 独立软件层里唯一跑出曲线的是推理服务,它的收入随 token 用量走
- 7
六 · 最大的风险变量是同等能力的 token 单价年降约 3–7 倍
- 8
七 · MLOps 的商业形态更接近专业服务与运维外包,而不是软件产品
- 9
八 · 中国市场的商业模式尚未跑通
完整目录
目录 100% 公开,不做删减 —— 你要先能判断它覆没覆盖你的问题,再决定买不买。
- 报告说明
- 核心判断
- 阅读说明
- 第一章 · 总论:MLOps 是什么生意
- 1.1 一句话定义与边界
- 1.2 这门生意为什么存在:一条「落差」曲线
- 1.3 产业链形态判定:这是网络,不是链条
- 1.4 市场规模:三个口径,最宽与最窄差 15 倍以上
- 1.5 生命周期定位:「第二次重启」
- 第二章 · 需求侧:谁在买、买什么、预算从哪来
- 2.1 买家三层:三种完全不同的生意
- 2.2 预算的真实来源与量级
- 2.3 采购决策链:用的人和付钱的人不是同一批
- 2.4 需求结构的位移:三次转向
- 2.5 需求量的一个可核锚点,以及它的边界
- 第三章 · 供给侧:七层分工,各层在做什么、谁在做、卡在哪
- 3.1 第二层 · 数据:钱最多的一层,但不是软件生意
- 3.2 第三层 · 训练与实验:被吸收得最彻底的一层
- 3.3 第四层 · 模型与制品:一个被低估的控制点
- 3.4 第五层 · 部署与推理:软件各层里唯一跑出独立曲线的一层
- 3.5 第六层 · 观测与评估:2024 年之后新增的一整层
- 3.6 第七层 · 治理与合规:说了很多年,钱还没来
- 3.7 第八层 · 编排与 Agent 框架:入口价值大于收入价值
- 第四章 · 钱在哪一段:价值分配与商业模式
- 4.1 一块钱怎么分
- 4.2 四种定价模式与它们各自的天花板
- 4.3 成本结构:为什么这一层的毛利被夹住
- 4.4 单位经济:为什么增长曲线分成截然不同的两类
- 4.5 行业本质:MLOps 其实是什么行业
- 第五章 · 竞争格局:谁在赚、凭什么
- 5.1 四类玩家,四种赚钱方式
- 5.2 壁垒判定:三类壁垒,逐类过一遍
- 5.3 时间压缩:哪些优势是钱能买到的
- 5.4 并购整合:买家来自上游、下游与平台,没有一笔发生在独立工具厂商之间
- 5.5 独立厂商的两条活路,以及它们各自的代价
- 第六章 · 技术演化与关键变量
- 6.1 三代演进:名字没变,内容全换了
- 6.2 开源与商业的分界线在哪
- 6.3 评估:新的核心环节,也是最难产品化的一环
- 6.4 推理经济学:量增与价跌的赛跑
- 第七章 · 政策、地缘与制度环境
- 7.1 地缘暴露扫描:三条通路,落在哪几条
- 7.2 欧盟:法规在,但执行日期在退
- 7.3 中国:备案制是硬约束,也是本地厂商的结构性机会
- 7.4 一个必须澄清的常见误判
- 第八章 · 中国市场:三处结构性差异
- 8.1 差异一:需求集中在政企,而不是互联网公司
- 8.2 差异二:云市场高度集中,独立厂商的空间被两头压
- 8.3 差异三:商业模式尚未跑通——用两家公司的数字说清楚
- 8.4 信创与国产算力适配:一个真实但边界清楚的机会
- 第九章 · 核心逻辑总结:价值分布、传导与关键变量
- 9.1 价值分配:四句话说清
- 9.2 五条核心判断,逐条给机制与反例
- 9.3 关键变量:哪几个拿掉判断就不成立,哪几个观测不到
- 9.4 未来三年要跟踪的四个信号
- 第十章 · A 股相关上市公司分类
- 10.1 这一章是什么
- 10.2 归位总表
- 10.3 主营直接对应(2 家)
- 10.4 主营部分对应(8 家)
- 10.5 具备能力但主营未列(6 家)
- 10.6 排除项或环节之外(6 家)
- 10.7 概念板块不等于产业链
- 附录 A · 关键术语表
- 附录 B · 主要企业名录(按环节)
- 第二层 · 数据
- 第三层 · 训练与实验
- 第四层 · 模型与制品
- 第五层 · 部署与推理
- 第六层 · 观测与评估
- 第七层 · 治理与合规
- 第八层 · 编排与 Agent 框架
- 平台捆绑型(跨多层)
- 附录 C · 数据来源清单
- 第一档 · 一手文件
- 第二档 · 具名机构公开发布
- 第三档 · 整理性资料(正文已就地标注)
- 附录 D · 本报告没做的事,以及为什么
- 免责声明
试读版正文
第一章 · 总论:MLOps 是什么生意
1.1 一句话定义与边界
MLOps(Machine Learning Operations,机器学习运维)指的是:把一个在实验环境里跑通的机器学习模型,变成一个能在真实业务里长期稳定运行的系统,这中间所需的全部工具、流程与平台。
这个定义听起来抽象,用一个具体场景就清楚了。一家银行的风控团队训练出一个反欺诈模型,在测试数据上准确率 96%。从这个状态到「这个模型每天处理三百万笔交易、七乘二十四小时不出错、监管来查时能说清它为什么拒绝了某一笔」,中间要解决的事情包括:模型文件存在哪、谁有权限改、上线前怎么灰度、上线后准确率掉了怎么发现、发现了怎么回滚到上一版、训练它用的那批数据三年后还能不能找到。
这些事情没有一件是「机器学习」,全部是「工程」。MLOps 卖的就是这些事情的现成解法。
本报告的边界如下,含什么与不含什么同样重要:
| 含 | 不含 | |
|---|---|---|
| 数据 | 训练数据的采集、标注、版本管理、特征存储、向量检索 | 通用数据库、数据仓库的常规 OLAP 用途 |
| 训练 | 实验跟踪、超参搜索、分布式训练调度、微调工具链 | 模型算法本身的研究 |
| 部署 | 推理引擎、模型服务、路由网关、弹性伸缩 | 裸算力租赁、数据中心、服务器硬件 |
| 运行 | 追踪、评测、漂移检测、成本归属、审计与合规 | 通用 IT 运维(AIOps)、应用性能监控(APM) |
| 编排 | Agent 框架、工作流引擎、工具调用与记忆管理 | 上层业务应用本身 |
四个明确排除项需要单独说明,因为市场经常把它们混进来:
第一,算力与数据中心不在本报告范围内。服务器、机柜、GPU 租赁属于基础设施,它的定价逻辑是资本开支回收,与软件工具层完全不同。把两者放进同一个「AI 基建」篮子,会得出严重失真的规模数字。
第二,模型本身不在范围内。训练基础模型是另一门生意,它的成本结构是「一次性投入几亿到几十亿美元,然后按 token 收费」,与工具层的订阅制没有可比性。本报告在需要对照时会引用模型层的数字,但不把它算作 MLOps。
第三,通用 IT 运维不在范围内。AIOps 指的是「用 AI 做 IT 运维」,MLOps 指的是「运维 AI」。两者中文都带「智能运维」四个字,但一个的对象是服务器,一个的对象是模型。这个混淆在 A 股概念板块的归类里大量存在,本报告第十章会逐家指出来。
第四,上层业务应用不在范围内。一个 AI 客服产品、一个 AI 编程助手,它们是 MLOps 的用户,不是 MLOps 的一部分。
1.2 这门生意为什么存在:一条「落差」曲线
金句 MLOps 的市场规模,不由 AI 的总规模决定,由「模型能力」与「企业能直接用的状态」之间那道落差决定。
这是理解整条产业链的第一把钥匙,也是本报告与大多数行业研究口径不同的地方。多数报告把 MLOps 的增长挂在「AI 市场增长」上,得出「AI 涨十倍所以 MLOps 涨十倍」的结论。这个推论是错的,机制如下。
落差从哪里来。 一个模型被训练出来的时候,它的形态是一堆权重文件加一段推理代码。企业要的是一个「能接进现有系统、有权限控制、出问题能追责、成本可预测」的服务。这两个状态之间的距离,就是落差。落差有多宽,就有多少活要干,就有多大的市场。
落差会被两头挤压。
一头是模型厂商往下走。2023 年企业要自己搭一整套微调流水线;到 2026 年,主流模型厂商直接提供托管的微调、评估、批量推理接口,企业不需要碰任何工具就能完成同样的事。这一段落差被模型厂商自己填掉了。
另一头是云厂商往上走。数据平台把模型注册、实验跟踪、特征存储做成自己平台的一个功能标签页,对已经在用这个平台的客户来说是免费的。这一段落差被云厂商填掉了。
中间剩下的部分,才是独立 MLOps 厂商的市场。这个中间地带在 2020–2023 年很宽,因为当时模型和云都还没往这里走;2024 年之后它在被两头快速压缩。
一个可复算但无法一手核对的口径:Gartner 的市场预测把这个市场拆成四段,2025 到 2026 年的对照是——
| 分段 | 2025 年(亿美元) | 2026 年(亿美元) | 增速 |
|---|---|---|---|
| 基础生成式 AI 模型 | 114.38 | 233.56 | 104.2% |
| 领域专用与专项生成式模型 | 15.83 | 49.10 | 210.0% |
| AI 应用开发平台 | 68.85 | 95.41 | 38.6% |
| 数据科学与机器学习平台 | 194.05 | 264.44 | 36.3% |
| 合计 | 393.11 | 642.52 | 63.4% |
(来源:Gartner《Forecast: AI Platforms and Models, Worldwide》新闻稿 2026-07-20,分段数值转引自 TechEdgeAI 2026-07 的整理表格;本报告未能取得该报告的一手页面,故标为转引。)
这张表要回答的问题是:AI 的钱在往哪一层流。答案很直接——模型层两个分段的增速是 104.2% 与 210.0%,平台层两个分段是 38.6% 与 36.3%,差距接近三倍。
用占比看更清楚:平台层(后两段)在 2025 年占整个市场的 66.9%,2026 年降到 56.0%。(算式:2025 年 (194.05+68.85)÷393.11=66.9%;2026 年 (264.44+95.41)÷642.52=56.0%,输入值即上表,读者可自行复算。)按这个斜率,模型层在 2027 年就会在绝对额上超过平台层。
这不是说 MLOps 在萎缩 —— 264 亿美元、36% 的增速,放在任何一个软件细分里都是好赛道。 但它意味着:把 MLOps 的增长曲线画成 AI 总量曲线的等比例缩小版,会系统性高估。
1.3 产业链形态判定:这是网络,不是链条
多数产业链报告用「上游—中游—下游」的分层来组织,那个形态适用于有物理流转的行业:材料变成零件、零件变成整机、整机卖给用户,方向单一。
MLOps 不是这个形态,判据有三条:
第一,存在回路。模型上线后产生的真实数据,会回流成为下一轮训练的输入。数据层既在最前面,也在最后面。
第二,付钱的和使用的不是同一批人。直接使用者是算法工程师与平台工程师,付钱的是 CIO 或业务负责人。这决定了这个行业的采购逻辑与消费级软件完全相反——好用不等于卖得动。
第三,并行通路各自成立。同一件事(比如「把模型部署成一个服务」)至少有四条互不隶属的路径:用云厂商的托管服务、用独立厂商的产品、用开源自建、直接调模型厂商的接口。四条路都能走通,它们不是上下游,是替代关系。
所以本报告用「框架图」而不是「分层链」来描述它。
图 1 · MLOps 产业链框架图:谁把什么卖给谁
数据来源:本报告整理
这张图要回答的问题是:谁把什么卖给谁。它说明了三件事——
第一,七层工具都夹在「算力/模型」与「需求侧」之间,它是一个中间层。中间层的定价永远受两头挤压。
第二,右下角的开源社区不是供应商,是替代者。这是这个行业最特殊的地方:它的每一层都有一个功能覆盖度极高的免费对手,而且那个对手往往就是行业头部厂商自己捐出来的。
第三,图外的「潜在进入者」标了芯片厂商与模型厂商——这不是理论推演,2026 年 9 月 NVIDIA 收购 Hugging Face 就是芯片厂商直接进场的实例,第五章会展开。
1.4 市场规模:三个口径,最宽与最窄差 15 倍以上
这一节回答一个具体问题:MLOps 到底多大?答案取决于你问的是哪个口径——窄口径与中口径差 6–8 倍,与宽口径差 15–20 倍。
| 口径 | 2026 年规模 | 覆盖范围 | 来源 |
|---|---|---|---|
| 窄口径:MLOps 专用工具 | 33–44 亿美元 | 只算实验跟踪、模型注册、部署监控这类专用产品 | Fortune Business Insights / Persistence Market Research / Precedence Research / Technavio 各自的 MLOps 市场报告(2025–2026 年版) |
| 中口径:数据科学与机器学习平台 | 264.44 亿美元 | 加上一体化平台(含云厂商的 ML 平台产品线) | Gartner 2026-07-20,转引 |
| 宽口径:AI 平台与模型 | 642.52 亿美元 | 再加上模型本身与应用开发平台 | 同上 |
为什么必须把三个口径摊开,而不是挑一个。
窄口径的问题是它把云厂商的自带平台排除在外,而那恰恰是绝大多数企业实际在用的东西。用 33 亿美元去理解这个行业(窄口径来自四家市场研究机构,均未公开边界定义,见附录 D 第四项),会得出「这是个小到不值得研究的市场」的错误结论。
宽口径的问题是它把模型混了进来,而模型的增速是平台的三倍。用宽口径的增速去推平台层的增长,会高估约 64%–75%(63.4%÷38.6%≈1.64、63.4%÷36.3%≈1.75,本报告计算)。
本报告采用中口径(264.44 亿美元;Gartner《Forecast: AI Platforms and Models, Worldwide》新闻稿,2026-07-20 转引)作为主口径,理由是它的边界与本报告第 1.1 节的定义最接近:既包含独立厂商,也包含云厂商的对应产品线,同时不含模型与裸算力。
需要同时说明这个口径的强度:主口径与第 9.2 节的判断一都依赖同一份机构预测,而且本报告未能取得它的一手页面,数值转引自第三方整理。它可以自行复算(分段相加即得合计),但不能回溯核对。若该组数值被更正,主口径与判断一都需要重估。
本报告对市场规模只使用相对变化与结构占比,不使用任何单一口径的绝对值作为论证支点。 原因见上表:三个口径的边界差异足以让同一个判断得出相反结论。
关于市场规模数据的查证过程:
本报告就 MLOps 市场规模查证了六个来源——Gartner、IDC、Fortune Business Insights、Precedence Research、Persistence Market Research、Technavio。其中 Gartner 的分段口径最清晰且给出了逐段绝对值与增速,故采用;IDC 的公开发布中未见与本报告定义对应的独立细分;后四家的数值集中在 33–44 亿美元区间,但均未公开口径定义(是否含云厂商产品线、是否含向量数据库、是否含标注服务),因此它们之间的差异无法归因,本报告不做趋势图,仅在上表中并列。
1.5 生命周期定位:「第二次重启」
判断一个行业处在什么阶段,看三个信号:新进入者的数量、头部厂商的增速、并购的方向。
MLOps 这三个信号同时给出了矛盾的读数,这组矛盾本身说明了它所处的阶段。
第一,新进入者数量在增加,但集中在新的一层。2020–2022 年成立的一批公司做的是实验跟踪、模型注册、特征存储;2024 年之后成立的一批做的是 Agent 追踪、评估集管理、推理加速。名字都叫 MLOps,做的不是同一件事。
第二,老一层的增速已经明显放缓。Dataiku 在 2022 年 F 轮时的年度经常性收入(ARR,即按当前订阅合同折算的一年收入)约 2 亿美元,到 2025 年 10 月宣布突破 3.5 亿美元(Dataiku 公司公告,2025-10;估值与 ARR 对照转引自 Sacra 公司页面)。三年增长 75%(3.5÷2−1),年化约 20%——对一家仍在冲刺 IPO 的软件公司,这个增速接近成熟期。
第三,并购方向是被上游、下游客户或平台厂商吸收,没有同行整合。详见第五章。一个行业如果处在健康的成长期,应该看到同行之间的横向并购(买份额、买客户);这里看到的是上游、下游客户与平台厂商把头部公司整家买走——那是「这一层的独立价值正在下降」的信号。
所以本报告的定位判断是:
金句 MLOps 不处在成长早期,也不处在衰退期。它处在第一代产品被上游吸收、第二代产品刚刚立起来的换代窗口。 这个窗口的特点是:总规模在涨,但存量玩家的位置在贬值。
这个判断的反例检验:如果这个判断错了,最可能错在哪里?最可能的反例是——企业级客户对「中立性」的需求足够强,强到愿意为「不被云厂商锁定」单独付费,从而托住独立厂商。这个反例有真实证据支撑(第五章 5.5 会展开),但它只能托住价格底,托不住增长斜率。中立性能让独立厂商活下去,不能让它跑赢平台厂商。
第二章 · 需求侧:谁在买、买什么、预算从哪来
2.1 买家三层:三种完全不同的生意
这一节要回答的是:MLOps 的客户分三类,它们的采购逻辑互相之间没有可比性。
| 第一层:前沿实验室与超大规模平台 | 第二层:大型传统企业 | 第三层:中小企业与开发者 | |
|---|---|---|---|
| 典型客户 | 基础模型公司、头部互联网平台 | 银行、保险、能源、汽车、大型零售 | 创业公司、独立开发者、中小软件商 |
| 年 AI 相关支出量级 | 十亿美元级 | 百万到千万美元级 | 万到十万美元级 |
| 买不买 MLOps 工具 | 基本不买,全部自建 | 买,但更多是买平台不是买工具 | 不买,用开源与免费额度 |
| 他们的钱主要流向 | 算力、数据、人 | 云平台、系统集成商、人 | 模型 API 调用 |
这张表说明的是一件反直觉的事:MLOps 工具的钱,主要来自中间那一层,而中间那一层恰恰是最保守、决策链最长、最不愿意为工具单独付费的一层。
第一层为什么不买。 前沿实验室的技术需求超出了任何商业工具的能力边界。它们要在几万张卡上做分布式训练,要在训练中途动态调整数据配比,要为自己的模型结构定制推理内核。商用工具的通用性在这个规模上是负担而不是优势。这一层的钱花在算力(自建或长约租赁)、数据(见 3.2 节)和人身上。
第三层为什么不买。中小企业和开发者的需求可以被开源加免费额度完全覆盖。一个五人团队要做实验跟踪,装一个开源工具就够了,这层的付费转化率极低,且客单价撑不起销售成本。这一层对厂商的价值在「社区」和「未来的第二层客户」,当期收入很少。
第二层是真正的市场,它的特征决定了这个行业的形状。大型传统企业的采购有三个硬约束:
第一,必须能通过内部风控与审计。这意味着数据不能出境、权限要能细分到人、每一次模型变更要留痕。这三条把大量优秀的开源工具直接排除——它们缺一个能在合同里承担责任的法人实体。
第二,采购周期以季度计。从立项到签约通常六到十八个月,中间要过技术评估、安全评估、采购比价、法务审核。这个周期长度决定了这个行业的销售成本极高,也决定了小厂商很难跨过第一道门。
第三,倾向于买整套而不是买单点。一家银行不会分别向七家供应商买七层工具,它会向一家买一个平台。这是云厂商与数据平台厂商的结构性优势——它们本来就已经在这家银行里了。
2.2 预算的真实来源与量级
MLOps 的钱从哪个口袋出来,这件事决定了它的天花板。
先看总量。 根据 Andreessen Horowitz 对 100 家全球 2000 强企业的 VP 及以上高管的第三次年度调研(发布于 2026-01-30;样本中 88% 年收入超 10 亿美元、30% 超 100 亿美元),企业在大语言模型上的平均年支出从 2024 年的约 450 万美元涨到 2025 年的约 700 万美元,企业自己预期 2026 年会涨到约 1,160 万美元,增幅约 65%。
这个数字要正确理解,有两处容易读错。
其一,700 万美元是大语言模型相关的全部支出,包含模型调用费、应用采购、工具、人(Andreessen Horowitz 企业 AI 支出调研,2026-01-30 发布,样本为 100 位全球 2000 强高管)。不是 MLOps 工具的支出。
其二,同一份调研发现,企业原本预算给应用层约 390 万美元,实际花掉了近 600 万美元(同一份 a16z 调研,2026-01-30)——超支的部分去了应用,不是去了工具。
再看结构。 一份对企业 AI 预算分配的整理给出的比例是:基础设施(训练算力、推理托管、向量库、MLOps 工具、存储、网络)占 50–60%,模型与 AI 软件占 10–20%,集成与运营(数据工程、流程、企业嵌入)占 25–35%(Softude《AI Budget Allocation 2026: Infra vs Models vs Integration》;该来源未公开调研方法与样本,本报告将其列为第三档证据,仅用于说明量级,不用于任何精确测算)。
把两组数字叠起来,可以做一个粗略但方向可靠的推算:
图 2 · 单家大型企业 AI 支出的粗略拆分
数据来源:Andreessen Horowitz 企业 AI 支出调研(2026-01-30 发布);Softude《AI Budget Allocation 2026》(第三档证据);本报告整理
到这一步就停下。「基础设施」这一格里,算力(GPU 小时、云资源)与工具(软件订阅)的划分,本报告查证了 a16z、Gartner、IDC、Ramp AI Index 四个来源,均未公开这一层的拆分。因此本报告不给出「MLOps 工具占企业 AI 预算的百分之几」这个数字。
给一个没有依据的比例,比不给更糟——它会被拿去做投资测算。 能确定的只有方向:工具层在基础设施这一格里是少数派,因为同一格里装着 GPU。
一个可以交叉验证方向的锚点:Snowflake 的 AI 相关收入运行率,按同期年化口径粗算只占其产品收入的个位数百分比低位(数据、期间与口径差异见 5.1 节)。
这个数字说明:即便是一家把 AI 作为核心叙事的数据平台公司,AI 专属产品线的收入占比也只有个位数的零头。它不能直接等同于 MLOps 的占比,但它给出了一个量级参照——AI 工具的收入,远小于 AI 的声量。
2.3 采购决策链:用的人和付钱的人不是同一批
金句 这个行业容易被误判的一点:产品好不好用,和卖不卖得掉,几乎不相关。
决策链通常是这样的:
| 角色 | 关心什么 | 有什么权力 |
|---|---|---|
| 算法工程师 / 数据科学家 | 好不好用、能不能少写代码 | 有否决权,没有决定权 |
| 平台工程师 / 架构师 | 能不能接进现有系统、会不会增加运维负担 | 有很强的否决权 |
| 信息安全与合规 | 数据会不会出去、能不能审计 | 一票否决 |
| 采购部门 | 价格、合同条款、供应商资质 | 有议价权 |
| CIO / CTO | 这笔钱能不能向 CEO 交代 | 决定权 |
这条链有两个后果,是这个行业所有商业现象的根源。
第一个后果:自下而上的产品驱动增长在这个行业效果有限。一款工具可以让所有工程师爱不释手,然后在安全评估那一关被卡死。开源工具的商业版之所以卖的是「单点登录、审计日志、私有部署」,恰恰因为这三样是给否决者看的。
第二个后果:既有供应商的优势被极大放大。一家已经通过了这家银行安全评估的云厂商,推销它平台上的第八个功能模块时,不需要重新过这条链。而一家新厂商推销它唯一的产品时,要从头走一遍。这就是第 1.2 节说的「云厂商往上走」为什么如此有效。
横向对照:这条决策链与网络安全行业几乎一致(同样是工程师用、安全部门管、CIO 付钱),而网络安全行业的结局是高度平台化——独立单点产品厂商要么被并购,要么长期停留在小规模。MLOps 正在走同一条路,只是时间轴压缩了。
2.4 需求结构的位移:三次转向
2020 年以来,MLOps 的需求内容发生了三次实质转向,每一次都让上一代产品的价值缩水。
第一次转向:从训练为主到推理为主。传统机器学习时代,一个企业可能有几百个模型,每个模型的推理量都很小,工程的重心在「怎么高效地训练和管理这几百个模型」。生成式 AI 时代,企业可能只用三五个模型,但每个模型的调用量是前者的几个数量级。重心从「管理很多模型」变成「让很少的模型跑得又快又便宜」。
这次转向的直接后果是:模型注册、实验跟踪这类「管理很多模型」的工具,价值下降;推理引擎、路由网关这类「让模型跑得便宜」的工具,价值上升。
一个可核的量级参照:字节跳动火山引擎披露,豆包大模型日均 token 调用量在 2026 年 6 月达到 180 万亿,较 2024 年 5 月发布时增长超 1,500 倍,过去一年增长超 10 倍(火山引擎 FORCE 大会披露,2026-06,转引自证券时报 2026-06 报道)。
第二次转向:从「模型对不对」到「输出好不好」。传统机器学习的正确性是可计算的——预测值与真实值比对,得到准确率。生成式模型的输出是一段文字或一个动作,没有标准答案。于是「评估」从一个自动化的数学步骤,变成了一个需要专门工具、专门数据集、甚至专门人力的独立环节。
这次转向凭空创造了一整层新市场(第 3.5 节),也是 2024 年之后新公司最集中的地方。
第三次转向:从「模型」到「智能体」。一个模型的行为是「输入进去,输出出来」,一次调用结束。一个智能体的行为是「调用模型、调用工具、看结果、再调用、循环若干轮」。后者的失败模式完全不同,典型情况是「在第七步调错了工具,导致后面全歪了」。
这次转向让「追踪」(把一次完整的多步执行过程完整记录下来)成为刚需,也让传统的监控工具直接失效——它们的数据模型里没有「一次执行包含多步」这个概念。
2.5 需求量的一个可核锚点,以及它的边界
这一节给出一个能核对的需求侧数字,同时说明它能推到哪一步、不能推到哪一步。
中国国家互联网信息办公室按期公布完成备案的生成式人工智能服务清单。截至 2026 年 6 月 30 日,累计 988 款生成式人工智能服务完成备案,598 款生成式人工智能应用或功能完成登记(国家网信办公告,2026 年 7 月发布,覆盖 5–6 月新增 120 款)。逐期数据为:截至 2025-12-31 累计 748 款,截至 2026-02-28 累计 796 款,截至 2026-04-30 累计 868 款。
这个数字能推出什么:
第一,中国境内向公众提供服务的生成式 AI 产品,数量在半年内增长约 32%(988÷748−1,两个端点均取自网信办公告)。这是一个官方口径、逐期公布、可以自己去核的序列,在这个行业里极为罕见。
第二,每一款备案服务背后必然存在一套上线流程——模型托管、内容安全过滤、日志留存、变更管理。这就是 MLOps 需求的物理来源。
这个数字不能推出什么:
它不能用来推算市场规模。备案的是「服务」,不是「企业」,一家公司可以备案十几款;且备案只覆盖面向公众的服务,企业内部使用的模型完全不在此列,而后者才是 MLOps 工具的主要战场。
它不能用来做国际对比。美国、欧盟没有对应的强制备案制度,不存在可比的分母。
本节为方向性判断,不构成精确测算。 可以确定的是需求在增长且增长可核;增长的幅度与它转化成工具采购的比例,没有公开数据支持。
第三章 · 供给侧:七层分工,各层在做什么、谁在做、卡在哪
本章逐层回答四个问题:它是什么 · 谁在做 · 为什么是他们 · 卡在哪。
一个贯穿全章的观察先放在前面:每一层都有一个功能覆盖度很高的开源对手,而且大多数是行业头部自己捐出来的。这在其他软件行业极为罕见,它是理解这一层利润率的关键,第四章会展开。
3.1 第二层 · 数据:钱最多的一层,但不是软件生意
它是什么。 模型需要数据来训练。数据层要解决的是:从哪里拿数据、怎么把原始数据变成模型能吃的形式、怎么保证同一批数据在三年后还能复现、怎么在几十亿条向量里毫秒级找到最相似的那几条。
这一层再分四小块,商业形态差别极大:
| 小块 | 干什么 | 商业形态 | 典型收入量级 |
|---|---|---|---|
| 数据标注与专家数据 | 雇人给数据打标签、写标准答案、做偏好排序 | 人力服务,项目制 | 十亿美元级 |
| 合成数据 | 用模型生成训练数据 | 软件 + 算力 | 千万美元级 |
| 数据版本与特征存储 | 记录「这次训练用了哪批数据」、把特征算好存起来复用 | 软件订阅 | 千万美元级 |
| 向量存储与检索 | 把文本变成向量、在海量向量里找最相近的 | 软件 / 托管服务 | 亿美元级 |
为什么标注这一小块的钱这么多。
Surge AI 在 2024 年收入超过 10 亿美元,Scale AI 同期约 8.7 亿美元(两家均为非上市公司,数字转引自 Sacra 与多家媒体整理,未经公司确认,属第三档证据)。Mercor 的两组数字要分开读:已实现收入口径下,2026 年上半年收入 6.14 亿美元、同比增长约 70%;年化运行率口径下,2026 年 2 月越过 10 亿美元、6 月越过 20 亿美元(转引自 BigGo Finance 与 Value Add VC 的整理,同属第三档证据)。半年已实现收入与年化运行率不是同一把尺,不能串成一条增长曲线。
对照:这一层里做软件的公司,没有一家接近这个量级。机制有三条——
第一,供给侧是人,不能被软件复制。给一段医学诊断做标注需要执业医生,给一段法律推理做标注需要律师。软件的边际成本趋近于零,人的边际成本不会。这既是这个生意的天花板(不可能有 80% 的毛利),也是它的护城河(不可能被开源替代)。
第二,买家是前沿实验室,预算口径完全不同。一家银行给 MLOps 工具的年预算可能是几十万美元;一家前沿实验室给数据的单笔合同可能是几千万美元,因为这笔钱是从模型训练预算里出的,而那个预算的分母是几十亿美元。
第三,它是项目制不是订阅制,所以客户集中度是致命弱点。Mercor 的收入中约 90% 来自 OpenAI 等少数巨头(转引自 BigGo Finance 2026 年对 Mercor 上半年收入的报道;本报告未能追溯到一手来源,将其列为第三档证据)。这个结构在 2025 年被现实检验过一次——2025 年 6 月 Meta 以 143 亿美元收购 Scale AI 约 49% 股权后,Google、OpenAI、xAI 相继削减或大幅缩减了与 Scale AI 的合同,业务转向 Mercor 与 Surge AI(Google、xAI 暂停合作见 Business Insider,2025-06;OpenAI 停用见 TechCrunch,2025-06-18;Meta 的投资金额与股比来自公开披露)。
金句 这个案例揭示了数据层的真正资产:不是产能,是中立性。 一旦被某一个模型厂商控股,其余所有模型厂商就成了「把训练数据交给竞争对手」——这在结构上不可接受。
卡在哪。这一层的瓶颈是专家供给。通用标注(图片里有没有猫)早已白菜化,价值全部转移到「需要博士级专业知识的标注」上,而这类人的供给是刚性的。
向量检索这一小块要单独说一句。 它在 2023 年被视为独立赛道;到 2026 年,主流数据库(关系型、文档型、搜索引擎)已普遍内置向量检索能力,独立向量库的差异化空间因此收窄——客户没有理由为一个功能单独引入一个新系统。本报告未取得独立向量库厂商的收入或客户数序列,无法量化它被替代到什么程度;能确定的是内置这件事已经发生,而且从被视为独立赛道到被普遍内置,间隔不到三年。
3.2 第三层 · 训练与实验:被吸收得最彻底的一层
它是什么。 训练一个模型要试很多组参数,每一组都会产生一堆指标和一个模型文件。实验跟踪工具的作用是把「第 347 次实验用了什么参数、得到什么结果、对应哪个模型文件」记下来,让人能找回去。
谁在做,以及为什么现在轮不到他们。
这一层曾经是独立 MLOps 厂商最集中的地方,也是被吸收得最彻底的一层。下表是本链的三笔主要收购(Hugging Face 属第四层「模型与制品」,见 3.3 节),方向一致:
| 被收公司 | 收购方 | 收购方是什么 | 价格 | 时间 |
|---|---|---|---|---|
| MosaicML | Databricks | 数据平台 | 约 13 亿美元 | 2023 年 |
| Weights & Biases | CoreWeave | 算力商 | 约 17 亿美元 | 2025-05-05 完成 |
| Hugging Face | NVIDIA | 芯片商 | 约 129 亿美元 | 2026-09-02 签约 |
(MosaicML 交易:约 13 亿美元含留任安排,为 Databricks 官方公布的金额(Databricks 新闻稿,2023-06-26)。Weights & Biases 交易:CoreWeave 官方新闻稿确认完成于 2025-05-05,价格约 17 亿美元系媒体报道口径(The Information,2025-03-04),公司未公开确认具体金额。Hugging Face 交易:NVIDIA 2026-09-02 签署最终协议,对价约 119 亿美元现金支付给股东,另有最高约 10 亿美元的员工股权留任计划,合计约 129 亿美元,预计 2027 年上半年完成交割,来源为 NVIDIA 向美国证券交易委员会提交的 8-K 文件,文件日期 2026-09-02。)
这张表要回答的问题是:谁在买这一层,以及为什么。
答案是:买家都不是独立工具厂商。数据平台、算力商、芯片商各买了一家——第一家是同层平台,另外两家来自链上游。它们买的不是收入——三家被收公司的年收入加起来不到收购方任何一家的零头——买的是「开发者从哪里开始」这个入口。
机制拆解:一个算法工程师在做实验的时候,选了哪个跟踪工具,就基本决定了他后面会在哪里训练、在哪里部署。这个位置的价值不在它自己能收多少钱,而在它能把多少算力需求导到谁家。所以它对算力商与芯片商的估值,远高于它对财务投资人的估值。
金句 对上游有战略价值、对自己没有定价权——这就是这一层的全部处境。 它解释了为什么这一层的公司卖得掉,也解释了为什么它们独立时长不大。
卡在哪。 卡在免费替代品太强。开源的实验跟踪工具 MLflow 月下载量超过 3,000 万次(MLflow 官方项目页披露,2026 年数据),功能覆盖了商业产品的绝大部分。商业版能收费的部分只剩「托管、单点登录、审计日志、企业支持」(这四样的性质见 6.2 节)。
3.3 第四层 · 模型与制品:一个被低估的控制点
它是什么。 训练完的模型是一个文件(或一组文件)。这一层管的是:这个文件存在哪、有几个版本、谁能下载、它是用什么许可证发布的、它有没有被人动过手脚。
为什么它比看起来重要。在传统软件里,这一层对应的是代码仓库和制品库,那是整个软件行业最有控制力的位置之一。在 AI 里,开放权重模型的分发几乎集中在一个平台上——这正是 NVIDIA 花 129 亿美元买 Hugging Face 的原因。
用一组数字看清这笔交易的性质:Hugging Face 的年化收入运行率在 2026 年中越过 1 亿美元,2024 年约 7,000 万美元(转引自 Sacra 公司研究页面,2026-04-27 更新,属第三档证据)。129 亿美元对应约 129 倍的收入倍数(129÷1)。
这个倍数用软件公司的估值框架完全解释不了。能解释它的只有一句话:它买的是位置。全世界的开发者在下载开放权重模型时会经过这个平台,控制这个平台就等于控制了「开发者第一眼看到哪块芯片的优化版本」。
卡在哪。 卡在开放权重生态的持续性。这一层的价值完全建立在「大量高质量的模型以开放权重形式发布」这个前提上。如果前沿模型全部转为闭源 API,这一层的战略价值会大幅下降。这是影响该层的关键变量。
以上是免费试读部分(正文约 30%)。完整版包含全部 15 章正文、全部数据表与来源清单。
以上是免费试读部分。完整版包含全部章节与数据表。单篇 ¥380。