AI 训练数据与语料预训练后训练RLHFRLVR强化学习环境验证器合成数据

AI 训练数据与语料 · 行业认知研究报告

编号 NH-4发布 2026-09-05 篇幅 57 页版本 v1.0 数据截止 2026-09-05

赛道本质

训练数据是三门生意 —— 结构最好的环节规模最小,结构最差的人力外包反而拿到最高估值

核心判断

  1. 1

    行业本质:训练数据是三门生意 —— 结构最好的环节规模最小,结构最差的人力外包反而拿到最高估值

  2. 2

    一 · 「训练数据」这个词把三门经济性完全不同的生意装进了一个筐,投资判断的第一步是把它拆开

  3. 3

    二 · 人类数据服务没有强壁垒:常见的四项转换成本都不成立,唯一的「信任」可以被一次股权事件清零

  4. 4

    三 · 钱正在从「标注」流向「专家」;专家数据是价格问题不是可得性问题,最接近稀缺的顶尖层也不构成卡脖子

  5. 5

    四 · 买方只有十几家,且他们同时是最有能力自建的一方 —— 这是整条链的定价天花板

  6. 6

    五 · 「数据耗尽」是一个被普遍误读的命题:耗尽的不是数据,是「免费且高质量」这个组合

  7. 7

    六 · 中国这条链的钱,主要不来自模型厂商

  8. 8

    七 · 强化学习环境是这条链上最有可能产品化、沉淀为资产的环节,也是客户最容易自建的一个

完整目录

目录 100% 公开,不做删减 —— 你要先能判断它覆没覆盖你的问题,再决定买不买。

  • 报告说明
    •  核心判断
    •  阅读说明
  • 第一章 · 总论:这门生意到底是什么
    • 1.1 边界:本报告写什么,明确不写什么
    • 1.2 先判形态:这条链不是链,是一张网
    • 1.3 五条通路的性质对照
    • 1.4 市场规模:三个口径互相打架,先解释为什么打架
    • 1.5 行业生命周期定位
  • 第二章 · 需求侧:谁在买、买什么、为什么买
    • 2.1 需求的三个层次,对应三种完全不同的采购行为
    • 2.2 训练范式迁移是需求结构的第一变量
    • 2.3 客户分层:四类买家,采购逻辑完全不同
    • 2.4 需求的量级:一个自下而上的推算
    • 2.5 需求的节奏:跟着模型发布周期走,不是线性增长
  • 第三章 · 供给侧之一:公开抓取与开放语料 ——「免费」这一层正在坍缩
    • 3.1 开放语料的真实构成
    • 3.2 「数据耗尽」:一个被误读的命题
    • 3.3 数据公地的关闭:从协议到墙
    • 3.4 从技术协议到收费闸门:CDN 成了新的收费站
    • 3.5 本章判断
  • 第四章 · 供给侧之二:版权授权 —— 当权利变成商品
    • 4.1 已成交的价格谱系
    • 4.2 定价机制:为什么同样是内容,价格能差几十倍
    • 4.3 卖方的真实经济性:三个公开数字
    • 4.4 结构演化:从一次性买断走向按使用付费
    • 4.5 本章判断
  • 第五章 · 供给侧之三:人类数据服务 —— 这条链的利润主池
    • 5.1 从「标注」到「专家数据」:同一个词,两门生意
    • 5.2 单位经济学:这门生意到底怎么赚钱
    • 5.3 gross 与 net:投资者最容易被误导的地方
    • 5.4 劳动力供给:一个价格跨度以数十倍计的三层市场
    • 5.5 竞争格局:为什么头部在一年内换了人
    • 5.6 三类壁垒判定:这个环节的典型玩家靠什么立足
    • 5.7 卡脖子检验:高质量专家数据算不算卡脖子
  • 第六章 · 供给侧之四:合成数据与强化学习环境 —— 供给的工业化
    • 6.1 合成数据:能替代什么,不能替代什么
    • 6.2 模型坍缩:证据的真实强度
    • 6.3 强化学习环境:从「数据」到「软件」的形态跃迁
    • 6.4 环境的经济学:为什么它可能是这条链上最好的生意,也可能是最差的
    • 6.5 具身智能数据:唯一还在物理世界里的瓶颈
    • 6.6 两个被反复提到、却从没被算过账的环节:评测与数据溯源
  • 第七章 · 中国市场:另一套规则
    • 7.1 驱动力:政策在前,需求在后
    • 7.2 市场规模与结构:117.53 亿元这个数字说明了什么
    • 7.3 数据要素制度:哪些是真交易
    • 7.4 中文语料的真实缺口
    • 7.5 本章判断
  • 第八章 · 法律与地缘:这条链的制度约束
    • 8.1 版权诉讼版图:已定的与未定的
    • 8.2 Anthropic 15 亿美元和解的真实含义
    • 8.3 欧盟:把训练数据披露变成法定义务
    • 8.4 中国的合规口径
    • 8.5 地缘暴露扫描
  • 第九章 · 商业模式与利润池:钱从哪来、被谁截留
    • 9.1 全景利润池:价值流向图
    • 9.2 五种收费模式对照
    • 9.3 典型玩家的商业模式归类
    • 9.4 成本结构:这门生意的规模经济到底存不存在
    • 9.5 时间压缩:这条链上哪些优势是钱买得到的
    • 9.6 五通路壁垒对照:把 1.3 节 立的题答完
  • 第十章 · 核心判断与关键变量
    • 10.1 七条核心判断
    • 10.2 未来三年最关键的五个变量
    • 10.3 什么会证明我们错了
    • 10.4 监测信号清单
    • 10.5 本报告结论的主要不确定性
  • 第十一章 · A 股相关上市公司分类
    • 11.1 这一章是什么
    • 11.2 归位总表
    • 11.3 主营直接对应(1 家)
    • 11.4 主营部分对应(2 家)
    • 11.5 具备能力但主营未列(24 家)
    • 11.6 排除项或环节之外(36 家)
    • 11.7 概念板块不等于产业链
  • 附录 A · 关键术语表
  • 附录 B · 主要企业名录(按环节)
  • 附录 C · 数据来源清单
  • 附录 D · 本报告没做的事,以及为什么
  • 免责声明

试读版正文

第一章 · 总论:这门生意到底是什么

1.1 边界:本报告写什么,明确不写什么

「AI 训练数据」在公开讨论中是一个极不精确的词。它有时指爬来的网页文本,有时指标注公司雇人打的标签,有时指出版社卖出的版权包,有时指一段能让智能体反复试错的软件沙盒。这些东西的共同点只有一个 —— 它们最终都变成了模型权重的一部分。除此之外,它们的生产方式、成本结构、买家、法律地位、可复制性没有任何一处相同。

本报告的边界如下:

包含不包含
对象用于训练、微调、对齐、评测 AI 模型的一切数据资产与相关服务企业内部的数据治理、BI、数据仓库(不进入模型训练的部分)
环节语料获取与授权 · 数据加工与标注 · 专家数据生产 · 合成数据 · 强化学习环境 · 评测集算力、芯片、模型本身、推理服务
地域全球,其中中国单独成章(第七章),因为它的驱动机制与欧美不同—
数据形态文本 · 图像 · 视频 · 音频 · 代码 · 结构化专业数据 · 机器人本体交互数据单纯的数据存储与传输基础设施

明确排除的一类:企业为了自用而做的数据准备工作。一家银行整理自己的客服记录去微调一个内部模型,这件事在会计上是 IT 支出,在产业上不构成外部市场。本报告只统计发生了外部交易的部分。这个边界很重要 —— 很多咨询机构的「数据标注市场规模」把企业内部人力成本折算进去了,这是三个口径互相打架的主要原因之一(见 1.4 节)。

1.2 先判形态:这条链不是链,是一张网

产业研究的惯例是画「上游—中游—下游」。这个惯例在这里会误导人。

判断一个产业该画成线性链还是网络图,判据有三条:环节之间是不是单向先后关系?有没有回路?付钱的人和使用的人是不是同一批?

训练数据产业三条都不满足:

  1. 有回路。模型的输出被用来生成下一代模型的训练数据(合成数据),模型也被用来给人类标注做预标注。产出回流成投入,这是典型的网络特征。
  2. 付钱的和产生数据的不是同一批人。一个 Reddit 用户写下的回答,价值由 Google 支付给 Reddit,用户本人不在交易结构里。
  3. 并行通路各自成立。一个实验室可以完全不买授权语料而只靠爬取 + 合成,也可以完全不做人工标注而只做可验证奖励的环境。这些通路不是先后关系,是替代关系。

所以本报告用行业框架图,不用分层链:

图 1 · 训练数据产业框架:五条互为替代的供给通路

报告图表

数据来源:本报告整理;各类买家数量量级见 2.3 节

这张图要回答的问题是:一个实验室要把模型训出来,它的数据从哪几条路进来。图里最关键的信息不是有几个环节,而是五条通路是互相替代的预算竞争关系。一个实验室今年多花 10 亿美元在 RL 环境上,这 10 亿大概率不是新增预算,而是从人类偏好标注的预算里挪过来的。理解这一点,才能理解为什么这个行业里会出现「整体高速增长、个别头部玩家收入腰斩」这种表面矛盾的现象。

1.3 五条通路的性质对照

五条通路里,通路一与通路四不以数据本身收费(见 9.6 节),真正形成生意的是通路二、三、五,也就是核心判断里说的三门生意。下表要回答的是:这五条路各自是什么性质的生意,为什么不能用同一套指标衡量。

通路一 · 公开抓取通路二 · 版权授权通路三 · 人类数据服务通路四 · 合成数据通路五 · RL 环境
本质基础设施获取版权许可人力外包算力换数据软件工程
主要成本带宽、存储、清洗算力许可费(固定)人工时薪(变动)推理算力工程师人时
边际成本极低近零(授权一次可反复用)线性,几乎不下降随算力线性首次高、复用近零
交付物数据集使用权人时产出的标注/对话/评分生成的数据可运行的代码环境
典型毛利基础设施型,偏低卖方视角接近 100%项目制 30–45%;抽成市场净收入口径约 70%视算力成本理论可达软件水平
卖方结构有卖方,但卖的是基础设施不是数据极分散(数百万权利人)中度集中(十余家平台)无独立卖方极分散、早期
买方结构—极集中极集中—极集中
可持续性风险来源关闭替代成本下降后价格坍塌客户自建 / 模型替代质量退化客户自建

这张表说明了三件事。

第一,只有通路三形成了可观察的、有规模的、以「数据」本身收费的独立市场。

这里要纠正一个常见的说法:通路一并非「没有卖方」。代理与抓取服务商(Bright Data、Zyte、Oxylabs、Apify 一类,按流量与成功率收费)、CDN 与抓取控制层(Cloudflare 一类,按抓取或使用收通行费,见 3.4 节)、开放语料的加工与托管方(多为非营利或平台的获客投入)都是真实存在、有规模收入的卖方。这条通路的特征不是没有卖方,而是卖方赚的是基础设施的钱,不是数据的钱 —— 同一套代理网络卖给做价格比对、广告核查、风控的客户,与卖给模型公司没有区别。因此它高度分散、毛利偏低,收入与训练数据需求只弱相关。通路四则确实没有独立卖方(合成数据基本由实验室自己生成),通路五刚刚开始。所以当媒体说「AI 数据是个百亿美元市场」时,它统计的其实主要是通路三。

第二,通路二和通路三的经济性正好相反。版权授权是一次付费、永久可用、边际成本为零 —— 这是最好的生意形态,但卖方极度分散,单个卖方拿不到定价权。人类数据服务是持续付费、按量计价、边际成本刚性 —— 这是最差的生意形态,但供给侧集中度更高。结果是:结构最好的环节利润被分散化稀释,结构最差的环节反而出现了百亿美元估值的公司。这个错配是理解本行业估值的关键。

第三,边际成本那一行是全表最重要的一行。人类数据服务的边际成本几乎不随规模下降 —— 多做一倍的标注就要多雇一倍的人。这决定了这个环节不存在真正的规模经济,只存在采购规模带来的谈判优势和管理效率的边际改善。第九章 9.4 节 会把这个机制拆到具体的成本项。

1.4 市场规模:三个口径互相打架,先解释为什么打架

公开数据里,「AI 训练数据市场」的规模数字相差可以达到六倍。这不是谁算错了,是在算不同的东西。

口径来源数字它实际统计的是什么
Grand View Research(数据采集与标注)2026 年 63 亿美元,2030 年 171 亿美元,CAGR 28.4%采集 + 标注的服务费,不含内部人力
Grand View Research(数据标注解决方案与服务)2024 年 186.3 亿美元,2025 年 229.0 亿美元,2030 年 576.3 亿美元含企业内部标注人力的折算与软件工具许可
第三方汇总(AI 训练数据集市场)2025 年 35.9 亿美元,2026 年 44.4 亿美元只统计成品数据集的采购,不含定制服务

(来源:Grand View Research 行业报告,2025–2026;第三方数据汇编,2026。三者口径不同,不可直接比较。)

这三个数字的差异全部来自边界定义:63 亿是「外部采购的服务」,229 亿是「外部服务 + 内部成本 + 软件」,35.9 亿是「现成数据集商品」。一个把内部人力折算进去的市场规模,对判断「谁在赚钱」几乎没有用 —— 因为那部分钱从来没有离开过买方的资产负债表。

我们的自下而上估算

与其在口径里绕,不如从可核验的公司收入加总。下面这张表和它后面的三步算式,是本报告最主要的自主量化产出,因此每一步都写出来让读者能跟着算。

参与者商业模式收入口径与规模年份来源
Mercor抽成市场年化 8.4–20 亿美元 gross(两个口径互相矛盾,取舍理由见 5.2 节)2026Dealroom 等媒体报道
Surge AI项目制14 亿美元 ARR(自有收入口径)2025多家媒体报道
Scale AI项目制指引约 10 亿美元(自有收入口径)2026媒体转述
Handshake AI抽成市场接近 10 亿美元 gross2026媒体报道
Micro1抽成市场5 亿美元 年化 gross2026-08TechCrunch
Appen项目制指引 2.7–3.0 亿美元(公司以美元列报)2026公司指引
中国全市场项目制为主约 117.53 亿元人民币(约 16 亿美元)服务收入2025第三方咨询

第一步 · 按各自口径直接相加:8.4–20 + 14 + 10 + 10 + 5 + 2.7–3.0 + 16 = 66–78 亿美元。这一步的结果不能直接用,因为其中三家报的是 gross(流经平台的交易额),另外四家报的是自有收入。

第二步 · 把 gross 折成 net。折算规则:只折抽成市场型的三家(Mercor、Handshake、Micro1),统一按 35% 抽成计;另外四家不折(Surge、Scale、Appen、中国全市场报出的本来就是自有收入,再折一次是重复打折)。

  • 抽成市场三家:(8.4–20 + 10 + 5)× 35% = 8.2–12.3 亿美元
  • 非抽成四家:14 + 10 + 2.7–3.0 + 16 = 42.7–43.0 亿美元
  • 合计 net 口径:51–55 亿美元

第三步 · 补上未计入的部分:加上版权授权市场(公开可见的年度许可费总额约 10–20 亿美元量级,见 4.1 节),得 61–75 亿美元。未上榜的 Turing、Invisible Technologies、Centific、iMerit 等中型服务商没有可核的收入数字,未计入。

我们据此判断:2026 年全球 AI 训练数据的真实外部交易规模在 60–75 亿美元区间,net 口径,且这是一个下限。这个数字显著低于「229 亿美元」的咨询口径,也高于「44 亿美元」的成品数据集口径。

这个估算有三处必须标出的误差,两处方向一致:

误差来源方向
跨年份加总 —— Surge 与中国市场用的是 2025 年数,其余是 2026 年数,而这是一个高速增长的市场使结果偏低
未上榜的中型服务商未计入使结果偏低
Mercor 的 gross 存在 8.4 亿与 20 亿两个互斥口径(见 5.2 节),本报告并列采用是上述区间宽度的主要来源

本节为方向性估算,不构成精确测算。另有两点不确定性:一是多家头部玩家为非上市公司,收入数据来自媒体转述而非审计报表;二是 gross/net 折算比例按行业通行的 30–40% 抽成推定(上表统一取 35%),个别玩家可能显著偏离。

1.5 行业生命周期定位

用 Gartner 技术成熟度曲线(Hype Cycle)定位,本行业的五条通路不在同一个位置上,这本身就是重要信息:

图 2 · 五条通路在技术成熟度曲线上的位置

报告图表

数据来源:本报告整理,定位依据见第四、五、六章

标记通路位置说明
⑤通路五 · RL 环境期望膨胀期顶部最热,也最未经检验
③b通路三之二 · 专家数据期望膨胀期后段,仍在上行按小时计价,价格与量同时在涨
④通路四 · 合成数据峰值后回落,已进入务实使用2024 年「模型坍缩」讨论后完成了一轮期望修正
③a通路三之一 · 通用标注幻灭期后段,仍在下行按件计价,正被模型预标注吞掉
②通路二 · 版权授权幻灭之后的理性爬升期2024 年定价狂热后,价格中枢正在下移
①通路一 · 公开抓取生产力高原总量仍在增长,但边际质量在降

金句 请特别注意 ③a 与 ③b:同一个「人类数据服务」标签下,是两条方向相反的曲线。这是本节最重要的信息,也是 5.1 节所说两门生意分化的直接后果。

这张图要回答的是:现在进入这个行业,你会踩在哪一段。

我们判断:人类数据服务已经越过期望峰值、正在经历分化式的幻灭 —— 低端标注被压缩、高端专家数据仍在膨胀;RL 环境处在期望膨胀期的顶部附近,最热但也最未经检验;合成数据在 2024 年的「模型坍缩」讨论之后已经完成了一轮期望修正,目前处在务实使用阶段;版权授权在经历了 2024 年的定价狂热后进入了理性爬升期,价格中枢正在下移。

判断依据分别见第五章(人类数据服务)、第六章(RL 环境与合成数据)、第四章(版权授权)。这里先给一个反例检验:如果人类数据服务真的整体越过峰值,为什么 Mercor 能在四个月内从 7.6 亿美元做到 20 亿美元 gross(该 gross 口径存在争议,见 5.2 节)?答案是这两件事不矛盾 —— 越过峰值的是「按件计价的通用标注」,膨胀的是「按小时计价的专家数据」。同一个行业标签下两条曲线在反向运行,这正是 5.1 节所说两门生意分化的后果。


第二章 · 需求侧:谁在买、买什么、为什么买

2.1 需求的三个层次,对应三种完全不同的采购行为

模型训练在工程上分三段,每段需要的数据、采购方式、价格弹性都不同。不理解这三段的区别,就无法理解为什么这个行业的需求会在一年内换方向。

【定义】预训练(Pre-training):用海量无标注文本/图像让模型学会语言与世界的基本统计规律。数据要求是量大、覆盖广、去重干净,对单条数据的质量要求相对低。

【定义】后训练(Post-training):在基础模型之上,用高质量的示范数据、人类偏好比较、强化学习等手段,把模型调成一个「有用、听话、不乱说」的产品。数据要求是量小、质量极高、领域精准。

【定义】评测(Evaluation):用独立的、模型没见过的题目衡量模型能力。要求是未被污染(模型训练时没见过)。

预训练数据后训练数据评测数据
数量级万亿 token 级万到百万条级千到万条级
单价极低(爬取近似免费,授权按包计)极高(专家时薪 50–200 美元)最高(需专家出题且保密)
采购形态一次性大包 / 长期许可持续的、按周结算的人力流单次是项目制,但因污染需高频复购
谁在供给内容平台、出版社、爬虫专家平台、标注公司专业评测机构、实验室自建
需求驱动新一代基础模型的训练启动持续,且随产品迭代不断加码每次模型发布
可否被模型替代部分(合成数据)部分,且正在快速推进难(会污染)

这张表最重要的一行是「采购形态」。预训练数据的采购是脉冲式的 —— 训一个新基础模型时集中采购,训完就停。后训练数据的采购是流量式的 —— 只要产品在迭代,就要持续买人时。这个差别决定了:做预训练语料授权的生意收入波动极大,做后训练人类数据的生意收入连续性好得多。这解释了为什么估值最高的公司都在后训练这一侧。

2.2 训练范式迁移是需求结构的第一变量

这是本章、也可能是本报告最重要的一节。

2023–2024 年的标准配方是:在数万亿 token 上做预训练,然后用相对便宜的一轮 RLHF(基于人类反馈的强化学习)做对齐。在这个配方下,数据支出的大头在预训练语料,人类反馈是配角。

到 2026 年,重心已明显向后训练偏移。多家实验室在 2025–2026 年的公开表述都指向后训练投入的大幅提升,方法栈也从单一的 RLHF 变成了 GRPO、DAPO、RLVR 等一系列以可验证奖励为核心的方法。

需要说明的是:「后训练消耗的算力是否已在总量上超过预训练」,没有任何一家实验室披露过可核验的数字。流传中的「后训练算力已超预训练」是一个未经证实的说法,本报告不采用。本报告只作方向判断 —— 后训练在决定模型可用能力上的权重显著上升 —— 不作量级判断。这个方向判断另有三条独立支撑:RLVR 方法栈的普及、Anthropic 讨论中的超 10 亿美元 RL 环境预算(见 6.3 节)、以及专家型数据平台在 2026 年远高于行业整体的增速。

【定义】RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习):不再依赖人类打分来判断模型答得好不好,而是用一个能自动判定对错的程序(比如运行代码看能不能通过测试、检查数学答案对不对)来给奖励。它的关键优势是可以无限扩展而不需要更多人。

这个方法学变化对数据产业的后果,是结构性的:

旧配方(RLHF 主导)新配方(RLVR + 环境主导)
核心采购品人类偏好比较数据(A 和 B 哪个更好)可运行的任务环境 + 验证器
人的角色打分员出题人、环境设计者、争议裁决者
人力需求量大而浅小而深
单位价格低高
可扩展性受限于人的数量受限于工程师和算力
供应商类型众包平台专家市场 + 软件工程团队

我们的判断:这场方法学迁移正在把训练数据行业从「劳动密集型服务业」推向「工程密集型服务业」,而这个转变对现有玩家是不对称的 —— 一个管理着五万名众包标注工的平台,和一个能交付一套可运行的金融建模沙盒的工程团队,是两种完全不同的组织。前者的资产(人员规模、任务分发系统、质检流程)在新配方下贬值。

反例检验:会不会人类数据需求整体萎缩?我们认为不会,理由有三:第一,RLVR 只适用于有客观对错的领域(数学、代码、部分科学),而模型能力需求正在向法律意见、医疗判断、投资分析这些没有唯一正确答案的领域扩展,这些领域仍然只能靠专家判断;第二,环境本身需要人来设计和校验,Anthropic 讨论中的超 10 亿美元 RL 环境预算里,相当部分最终仍会流向人;第三,实证上,Mercor、Handshake 这类专家型平台在 2026 年的增速远高于行业整体,说明需求是在换形态而不是在消失。

2.3 客户分层:四类买家,采购逻辑完全不同

这张表要回答的是:如果你是这条链上的供应商,你面对的到底是几种客户。

客户类型数量级年数据预算量级采购什么决策特征议价能力
前沿实验室约 10–15 家单家可达十亿美元级全部五条通路技术团队直接决策,速度快,质量优先于价格极强
二线模型公司数十家(含开源模型团队、主权 AI 项目)千万至亿美元级主要是通路三、四预算敏感,倾向用开源语料 + 定向补充中
应用层企业数万家十万至千万级领域微调数据、评测集采购流程长、合规要求高弱
具身智能公司数百家千万至亿级物理交互数据(本报告 6.5 节)数据必须自采或定制,无现成品可买弱(供给稀缺)

(数量与预算量级为本报告基于公开报道的估算,非精确统计。)

解读:这个行业的收入极度集中于第一类客户。从公开信息推断,Mercor 约 90% 的收入来自 OpenAI 等头部客户(媒体报道,2026);Surge AI 的增长由约 12 家前沿实验室驱动(媒体报道,2025);Handshake AI 服务约 8 家头部实验室(媒体报道,2026)。

这是本行业最重要的结构性事实:一个百亿美元估值的公司,它的真实客户名单可以写在一张便签纸上。用第九章的护城河框架说,这意味着客户集中度风险不是「风险提示」里的一句套话,而是这门生意的定义性特征。Scale AI 的案例(见 5.5 节)已经把这个风险的量级演示了一遍。

2.4 需求的量级:一个自下而上的推算

没有任何一家前沿实验室公开披露过数据采购预算。但可以从两端夹逼。

从供给端加总:1.4 节 已经算过,2026 年可见的人类数据服务外部支出约 51–55 亿美元(net 口径)。其中中国全市场约 16 亿美元与 Appen 约 2.7–3.0 亿美元以自动驾驶、安防等传统标注需求为主(见 5.1、7.2 节),扣除后约 32–36 亿美元(本报告计算),这部分的绝大部分流向前沿实验室的采购。

从买方支出结构估算:OpenAI 2026 年算力支出预计约 500 亿美元(媒体报道,2026)。若数据支出占算力支出的比例在 3–8% 区间(这是本报告的假设,理由见下),则单是 OpenAI 一家的年度数据支出量级就在 15–40 亿美元。

3–8% 这个假设从哪来:一是 Anthropic 曾讨论单在 RL 环境一项上投入超 10 亿美元(见 6.3 节),而 Anthropic 的整体算力支出规模小于 OpenAI;二是从供给端反推,若流向前沿实验室的 net 支出约 32–36 亿美元、而前沿实验室合计算力支出在千亿美元量级,比例约为 3–4%,落在这个区间的下沿(本报告推算)。这是一个交叉验证,不是精确测算,比例的真实值可能在 2% 到 12% 之间。

这个推算的用处不在数字本身,而在它揭示的比例关系:数据支出大约是算力支出的一个零头。这意味着,当实验室为了追求模型能力而愿意多花钱时,数据是最容易被追加预算的一项 —— 因为它便宜。反过来,当资本市场收紧、实验室要削减开支时,数据也是最容易被砍的一项 —— 因为砍掉它对短期产品影响最小。这条链的景气度,因此比算力链更不稳定。

2.5 需求的节奏:跟着模型发布周期走,不是线性增长

这条链的收入曲线不平滑。原因是采购行为跟着模型训练的工程节奏走:

图 3 · 数据采购跟着模型训练的工程节奏走

报告图表

数据来源:本报告整理

这个节奏对供应商意味着三件事:第一,收入有明显的季度波动,用单季度数据外推年度是危险的;第二,同时服务多家实验室的供应商,波动会被抹平,这是多客户结构除了分散风险之外的第二个价值;第三,做预训练语料的供应商波动最大(脉冲式),做后训练专家数据的最平滑(流量式)—— 这是估值差异的又一个来源。


第三章 · 供给侧之一:公开抓取与开放语料 ——「免费」这一层正在坍缩

3.1 开放语料的真实构成

大多数人以为大模型的训练数据是「整个互联网」。实际情况要具体得多。

【定义】Common Crawl:一个非营利组织自 2008 年起持续抓取的公开网页存档,按月发布快照。它是几乎所有大模型预训练语料的原始底料。

【定义】FineWeb:Hugging Face 于 2024 年 5 月发布的开放语料,从 96 个 Common Crawl 月度快照(2013–2024)中提取、过滤、去重而成,规模约 15 万亿 token(英文),发布时是最大的完全开放、完全可复现的预训练语料(Hugging Face, 2024-05)。

从 Common Crawl 到可用语料之间,隔着一条极长的加工链。原始抓取的绝大部分是导航栏、广告、模板文字、重复内容和机器生成的垃圾。FineWeb 的价值不在于它抓了多少,而在于它公开了怎么筛。它的衍生版 FineWeb-Edu 只保留了教育性内容,规模降到约 1.3 万亿 token(Hugging Face, 2024),但用它训练的模型在知识与推理类基准上表现显著更好。

这个 15 万亿 → 1.3 万亿的比例,是理解整个「数据稀缺」议题的钥匙:稀缺的从来不是字节,是密度。互联网上的文本还在爆炸式增长,但其中值得让模型学的比例在下降 —— 一部分因为 AI 生成内容本身在稀释语料,一部分因为高价值内容正在被移到付费墙和 App 里。

多语种情况更严峻。FineWeb-2 专门处理 Common Crawl 中未被识别为英文的部分(英文在 FineWeb 里),覆盖 1,000 多种语言,全部合计约 20TB(Hugging Face,2024-12);作为对照,单一英文的 FineWeb 约 44TB(Hugging Face,2024-05)—— 一千多种语言加起来,不到英文一种的一半。这直接决定了非英语市场的模型能力天花板,也是中国、欧洲、中东各自搞语料库建设的根本原因(见第七章)。

3.2 「数据耗尽」:一个被误读的命题

金句 耗尽的不是数据,是「免费 + 高质量 + 可合法使用」这个组合。

Epoch AI 的测算是这个议题的原始出处:人类生成的公开文本,经质量与重复调整后的有效存量约 300 万亿 token;按当时的训练数据规模增长趋势外推,语言模型将在 2026 至 2032 年之间用尽这一存量,若过度训练则更早;按计算最优方式训练,约在 2028 年用尽(Epoch AI,2024-06)。这比它 2022 年的旧版估计明显推后,主因是经仔细筛选的网页数据被证明可以替代精选语料,高质量数据存量的估计因此上调约 5 倍,另有多轮重复训练的可行性进一步扩大了有效存量(Epoch AI,2024-06)。

这个估计对「有效」二字的定义高度敏感 —— 这是它必须被谨慎使用的原因。同一批网页,按不同的质量阈值筛选,有效 token 可以相差一个数量级。新旧两版的差别,也不是因为发现了新数据,而是存量估计本身被上调。

更重要的是,这个命题在 2026 年的实际相关性已经下降,原因是 2.2 节 的范式迁移:当模型能力的增量主要来自后训练而非预训练时,「预训练语料够不够」就不再是最紧的约束。我们判断:「数据墙」这个叙事在 2024 年是对的,到 2026 年已不再是最紧的约束。当前真正紧的不是预训练 token 的总量,而是「能验证对错的高难度任务」的数量 —— 这是第六章的主题。

反例检验:如果预训练数据真的不再是约束,为什么各家还在花大钱买版权语料?我们的解释是:买版权语料现在的主要目的不是补量,是补法律确定性和补特定领域的密度。一家实验室买下一家医学出版社的全部期刊,不是因为缺 token,是因为缺这个领域的、可以在法庭上说清来源的高密度语料。这个动机与 2023 年的「补量」动机完全不同,也解释了为什么价格结构在变(见 4.4 节)。

3.3 数据公地的关闭:从协议到墙

MIT 数据溯源计划(Data Provenance Initiative)在 2024 年做了第一次大规模纵向审计,覆盖 14,000 个网络域名,结论是数据公地正在快速关闭:

限制类型覆盖比例说明
robots.txt 完全限制占 C4 全部 token 的 5%+按 token 加权
robots.txt 完全限制占 C4 中最活跃关键来源的 28%+按重要来源加权
服务条款(ToS)限制抓取占 C4 的 45%法律条款层面

(来源:Data Provenance Initiative, 「Consent in Crisis」, 2024-07)

这张表的解读关键在于第一行和第二行的差异。按 token 总量算只有 5% 被限制,按「最活跃、最关键的来源」算是 28%。两个数字都对,但它们说的是两件事:绝大多数被限制的是少数高价值站点,而剩下开放的绝大多数是低价值内容。这正是 3.1 节 说的「密度下降」在数据上的表现形式。

审计还发现了一个对合规判断很重要的细节:网站的服务条款和 robots.txt 经常不一致。一个站点可能在 robots.txt 里允许抓取,却在服务条款里禁止用于 AI 训练。这个不一致不是疏忽,是因为这两套协议都不是为 AI 训练场景设计的 —— robots.txt 诞生于 1994 年,设计目的是防止搜索引擎爬垮服务器,它从来没有「允许索引但禁止训练」这个语义。一个三十多年前为搜索引擎写的技术约定,现在承担着数十亿美元内容授权谈判的法律地基作用 —— 这是本行业最脆弱的制度基础,也是 3.4 节 那套新机制出现的原因。

3.4 从技术协议到收费闸门:CDN 成了新的收费站

2025–2026 年发生的一个结构性变化是:内容分发网络(CDN)开始替内容方收钱。

Cloudflare 在 2025 年推出 Pay Per Crawl(按抓取付费)市场,2026 年演进为 Pay Per Use(按使用付费)—— 不再按每次抓取页面收费,而是在内容实际被使用时收费,例如出现在 AI 搜索答案中或被访问付费内容时(Cloudflare 官方博客与 TechCrunch 报道,2025–2026)。同时 Cloudflare 提供托管的 robots.txt 服务,替中小站点管理抓取声明。

更强硬的一步是:自 2026 年 9 月 15 日起,Cloudflare 的默认设置将阻止「混用型」爬虫访问任何投放广告的页面 —— 所谓混用型,指同时用于搜索索引和 AI 训练的同一个爬虫。这实质上是逼迫 AI 公司把「搜索抓取」和「训练抓取」分开标识(TechCrunch, 2026-07-01)。

为什么这一步很关键:内容方过去无法区分「Google 抓我是为了把我放进搜索结果给我带流量」和「Google 抓我是为了训练模型替代我」。爬虫身份分离之后,内容方第一次可以对这两种行为分别定价。

支撑这套机制的经济学论据是抓取与回流的极端不对称。2025 年 6 月 OpenAI 的抓取/引流比约为 1,700:1,Anthropic 约为 73,000:1(Cloudflare Radar,2025-06);更近的数据显示 Anthropic 的爬虫每带来一次引流要抓取约 2 万个页面,且全部 AI 爬虫流量中约九成服务于训练或混合用途而非搜索(基于 Cloudflare 网络数据的第三方分析,2026-01 至 2026-03)。

这组数字的可靠性提示:它们来自 CDN 和第三方流量分析商,而这些机构正是新收费机制的受益方,因此我们把这组数据视为「方向可信、幅度存疑」—— 抓取远大于引流这个结论是稳的,具体倍数不宜直接引用。

我们的判断:CDN 层的收费闸门是本行业过去两年最重要的制度变化,因为它第一次把「内容被 AI 使用」变成了一个技术上可计量、商业上可收费的事件。它的意义不在于短期能收上多少钱(目前极少),而在于它为通路二(版权授权)从「几家大内容方谈大单」走向「千万家小内容方自动收费」提供了基础设施。这是第四章 4.4 节 讨论的定价结构演化的前提条件。

3.5 本章判断

金句 免费层不会消失,但它的边际质量在持续下降,而下降的速度快于总量增长的速度。

机制拆解,三条:

第一,高价值内容在系统性退出开放网络。专业内容进入付费墙,社交讨论进入 App 和私域,创作者内容进入订阅制。留在开放网络上、且允许抓取的,正在向低价值一端集中。MIT 审计中「按重要来源加权 28% 被限制 vs 按总量加权 5% 被限制」的差异,量化了这个趋势。

第二,AI 生成内容正在稀释语料池。这不是理论担忧 —— 当新抓取的网页中有相当比例本身是模型生成的,语料的信息量在下降而字节数在上升。这与 6.2 节 的模型坍缩研究指向同一个问题,但发生在语料层而非训练循环内,更难被检测和过滤。

第三,法律风险使得「能抓」和「敢用」分离。在 Anthropic 15 亿美元和解(见 8.2 节)之后,实验室对来源不明的数据的容忍度大幅下降。一份技术上可获取但法律地位不明的语料,对一家准备 IPO 的公司来说,价值可能是负的。

例外与边界:这个判断不适用于代码和科学文献两类。代码有 GitHub 这样的集中、许可清晰、持续增长的来源,且开源许可证本身提供了相对明确的法律路径;科学文献虽有版权问题,但已有多家出版社完成授权交易。这两类是免费/低价层里质量没有下降的部分,也是为什么代码能力在各家模型上进步最快的供给侧原因之一。


第四章 · 供给侧之二:版权授权 —— 当权利变成商品


以上是免费试读部分(正文约 29%)。完整版包含全部 16 章正文、全部数据表与来源清单。

以上是免费试读部分。完整版包含全部章节与数据表。单篇 ¥380。