AI 训练数据与语料 · 行业认知研究报告
摘要
这门生意是什么 · 钱在哪一段 · 谁在赚、凭什么 · 什么会让它变
核心判断
- 1
「训练数据」这个词把三门经济性完全不同的生意装进了一个筐,投资判断的第一步是把它拆开 语料授权是版权生意(边际成本近零、定价靠谈判、卖方分散);人类数据服务是人力外包生意,内部还分成两种经济性完全不同的结构 —— 项目制(承担交付风险、毛利 30–45%、净利个位数)与抽成市场(不承担交付风险、净收入口径毛利约 70%、自由现金流可为正),二者的资产负债表完全不同;强化学习环境是软件生意(可复用、可版本化、但客户最容易自建)。它们的利润率、增长曲线、壁垒结构、终局形态没有一条是相同的。用同一个市场规模数字覆盖它们,是本行业绝大多数公开研究的通病。
- 2
人类数据服务环节的客户转换成本接近于零,这一点已经被实证,而且是以最昂贵的方式 Meta 于 2025 年 6 月以 143 亿美元取得 Scale AI 约 49% 的无表决权股权、且不进入董事会(多家媒体报道,2025-06;Scale AI 估值约 290 亿美元),创始人与核心高管随即整体加入 Meta。数月内,Google(2024 年实际采购约 1.5 亿美元、2025 年原计划约 2 亿美元)、OpenAI、Microsoft 相继缩减或终止合作。它的收入此后停在原地 —— 2024 年 8.7 亿美元、2025 年接近 10 亿美元、2026 年指引仍约 10 亿美元(媒体报道,2026),而此前市场预期是 20 亿美元。请注意这里失去的不是存量收入,是全部增长:同期竞争对手四个月增长 163%,行业第一原地不动。在一个有真实转换成本的行业里,最大的几家客户不可能因为供应商的股东名单变化就在几个月内走掉。
- 3
这条链上的钱正在从「标注」流向「专家」,单位价格差了两个数量级 肯尼亚数据标注工的时薪区间为 1.46–3.74 美元(学术审计口径,2025);而 PhD 级领域专家在头部平台的时薪为 50–200 美元,Mercor 平台 2026 年 8 月的平均合约时薪约 114 美元。同一个「数据标注」行业标签下,按各自区间的中位数计算两端价格差约 45 倍,按极值计算可达约 140 倍,且低价端正在被模型预标注吞掉。
- 4
买方只有十几家,且他们同时是最有能力自建的一方 —— 这是整条链的定价天花板 全球有能力持续采购前沿训练数据的实验室约十余家。供应商的议价能力上限不由数据的价值决定,而由「客户自建这件事需要多久、多贵」决定。而随着工具链成熟,自建成本正在下降。
- 5
「数据耗尽」是一个被普遍误读的命题:耗尽的不是数据,是「免费且高质量」这个组合 Epoch AI 估算人类公开文本的有效存量约 300 万亿 token,80% 置信区间下在 2026–2032 年间被用尽(Epoch AI, 2024;该机构后续已将窗口前端从 2026 年推后至 2028 年)。真正在变化的是获取成本曲线,不是存量。 MIT 数据溯源计划 2024 年 7 月的审计显示,C4 语料中最活跃的关键来源已有 28%+ 被 robots.txt 完全限制;按 C4 全量计,45% 被服务条款限制(Data Provenance Initiative, 2024-07)。注意这是两年前的快照,两个比例的分母也不同;考虑到 2025–2026 年抓取控制的普及,当前实际比例应当更高。
- 6
中国这条链的钱,主要不来自模型厂商 2025 年中国数据标注市场规模约 117.53 亿元(第三方咨询口径,2026)。同期 A 股以训练数据为核心主营的上市公司海天瑞声营业收入 3.77 亿元、同比 +59%,但综合毛利率下滑 18.38 个百分点至 48.08%,公司归因为定制服务占比提升(公司 2025 年报,2026-04)。需求爆发与毛利下滑同时发生,说明这门生意的增长要靠定制化人力换取 —— 高毛利率的标准化产品正在被低毛利的定制服务替代。这是产品结构的劣化,不是执行问题。
- 7
强化学习环境是这条链上唯一可能真正产品化的环节,也是最危险的一个 训练范式已从「预训练为主」转向「后训练为主」,可验证奖励(RLVR)成为主流方法栈。Anthropic 曾讨论在未来一年内于 RL 环境上投入超过 10 亿美元(TechCrunch, 2025-09)。环境的交付物是代码而不是人时,因此它有毛利结构跃升的可能;但正因为它是代码,客户自建的门槛也最低。这两件事是同一个属性的两面。
完整目录
目录 100% 公开,不做删减 —— 你要先能判断它覆没覆盖你的问题,再决定买不买。
- 1 第一章 · 总论:这门生意到底是什么
- 1.1 1.1 边界:本报告写什么,明确不写什么
- 1.2 1.2 先判形态:这条链不是链,是一张网
- 1.3 1.3 五条通路的性质对照
- 1.4 1.4 市场规模:三个口径互相打架,先解释为什么打架
- 1.5 1.5 行业生命周期定位
- 2 第二章 · 需求侧:谁在买、买什么、为什么买
- 2.1 2.1 需求的三个层次,对应三种完全不同的采购行为
- 2.2 2.2 训练范式迁移是需求结构的第一变量
- 2.3 2.3 客户分层:四类买家,采购逻辑完全不同
- 2.4 2.4 需求的量级:一个自下而上的推算
- 2.5 2.5 需求的节奏:跟着模型发布周期走,不是线性增长
- 3 第三章 · 供给侧之一:公开抓取与开放语料 ——「免费」这一层正在坍缩
- 3.1 3.1 开放语料的真实构成
- 3.2 3.2 「数据耗尽」:一个被误读的命题
- 3.3 3.3 数据公地的关闭:从协议到墙
- 3.4 3.4 从技术协议到收费闸门:CDN 成了新的收费站
- 3.5 3.5 本章判断
- 4 第四章 · 供给侧之二:版权授权 —— 当权利变成商品
- 4.1 4.1 已成交的价格谱系
- 4.2 4.2 定价机制:为什么同样是内容,价格能差几十倍
- 4.3 4.3 卖方的真实经济性:三个公开数字
- 4.4 4.4 结构演化:从一次性买断走向按使用付费
- 4.5 4.5 本章判断
- 5 第五章 · 供给侧之三:人类数据服务 —— 这条链的利润主池
- 5.1 5.1 从「标注」到「专家数据」:同一个词,两门生意
- 5.2 5.2 单位经济学:这门生意到底怎么赚钱
- 5.3 5.3 gross 与 net:投资者最容易被误导的地方
- 5.4 5.4 劳动力供给:一个价格跨度以数十倍计的三层市场
- 5.5 5.5 竞争格局:为什么头部在一年内换了人
- 5.6 5.6 三类壁垒判定:这个环节的典型玩家靠什么立足
- 5.7 5.7 卡脖子检验:高质量专家数据算不算卡脖子
- 6 第六章 · 供给侧之四:合成数据与强化学习环境 —— 供给的工业化
- 6.1 6.1 合成数据:能替代什么,不能替代什么
- 6.2 6.2 模型坍缩:证据的真实强度
- 6.3 6.3 强化学习环境:从「数据」到「软件」的形态跃迁
- 6.4 6.4 环境的经济学:为什么它可能是这条链上最好的生意,也可能是最差的
- 6.5 6.5 具身智能数据:唯一还在物理世界里的瓶颈
- 6.6 6.6 两个被反复提到、却从没被算过账的环节:评测与数据溯源
- 7 第七章 · 中国市场:另一套规则
- 7.1 7.1 驱动力:政策在前,需求在后
- 7.2 7.2 市场规模与结构:117.53 亿元这个数字说明了什么
- 7.3 7.3 数据要素制度:哪些是真交易
- 7.4 7.4 中文语料的真实缺口
- 7.5 7.5 本章判断
- 8 第八章 · 法律与地缘:这条链的制度约束
- 8.1 8.1 版权诉讼版图:已定的与未定的
- 8.2 8.2 Anthropic 15 亿美元和解的真实含义
- 8.3 8.3 欧盟:把训练数据披露变成法定义务
- 8.4 8.4 中国的合规口径
- 8.5 8.5 地缘暴露扫描
- 9 第九章 · 商业模式与利润池:钱从哪来、被谁截留
- 9.1 9.1 全景利润池:价值流向图
- 9.2 9.2 五种收费模式对照
- 9.3 9.3 典型玩家的商业模式归类
- 9.4 9.4 成本结构:这门生意的规模经济到底存不存在
- 9.5 9.5 时间压缩:这条链上哪些优势是钱买得到的
- 9.6 9.6 五通路壁垒对照:把 §1.3 立的题答完
- 10 第十章 · 核心判断与关键变量
- 10.1 10.1 六条核心判断
- 10.2 10.2 未来三年最关键的五个变量
- 10.3 10.3 什么会证明我们错了
- 10.4 10.4 监测信号清单
- 10.5 10.5 本报告结论的主要不确定性
- 11 第十一章 · A 股相关上市公司分类
- 11.1 11.1 这一章是什么
- 11.2 11.2 主营直接对应(1 家)
- 11.3 11.3 主营部分对应(2 家)
- 11.4 11.4 落在本报告排除项内(24 家)
- 11.5 11.5 具备能力但主营未列(36 家)
- 11.6 11.6 概念板块不等于产业链
- 12 附录 A · 关键术语表
- 13 附录 B · 主要企业名录(按环节)
- 14 附录 C · 数据来源清单
- 14.1 免责声明
数据来源清单
共 20 条。每个外部数字都能回溯到具体文件。
| 用于 | 来源 | 数据时点 |
|---|---|---|
| §3.2 数据存量与耗尽窗口 | Epoch AI《Will we run out of data?》及后续更新 | — |
| §3.3 robots.txt 与 ToS 限制比例 | Data Provenance Initiative《Consent in Crisis》(arXiv:2407.14933) | 2024-07 |
| §3.1 开放语料规模与构成 | Hugging Face FineWeb / FineWeb-Edu / FineWeb-2 数据集文档 | — |
| §3.4 付费抓取与默认阻断政策 | Cloudflare 官方博客与 TechCrunch 报道 | — |
| §7.1 中国政策目标 | 国家发展改革委等四部门《关于促进数据标注产业高质量发展的实施意见》 | 2025-01-13 |
| §7.1、§7.3 基地进展与交易规模 | 国家数据局公开信息与地方部门通报 | 2025 |
| §7.2 财务数据 | 海天瑞声 2025 年度报告与业绩快报 | — |
| §7.3 数据资产入表 | 上海高级金融学院《中国企业数据资产入表情况跟踪报告》 | 2026-06 |
| §4.3 授权收入的真实规模 | Reddit 2025 年第四季度财报 | 2026-02 |
| §4.1、§4.3 图像授权收入变化 | Shutterstock 财务披露与媒体报道 | — |
| §8.1、§8.2 和解内容与法律区分 | Bartz v. Anthropic 相关司法文件与媒体报道 | — |
| §8.3 欧盟披露义务 | 欧盟委员会《训练内容公开摘要模板》及说明 | 2025-07-24 |
| §8.4 中国合规口径 | 《生成式人工智能服务管理暂行办法》(国家网信办等七部门) | 2023-07-13 |
| §6.3、§5.1 环境市场与份额流动 | TechCrunch 关于 RL 环境与 Micro1 的报道 | — |
| §1.4 市场规模口径对比 | Grand View Research 行业报告(两个不同口径) | — |
| §1.4、§5.5 非上市公司收入与估值 | Dealroom、Sacra 等一级市场数据库 | — |
| §6.2 模型坍缩 | Shumailov et al。《AI models collapse when trained on recursively generated data》(Nature) | 2024 |
| §6.5 具身数据缺口与采集成本 | 国内具身智能数据产业研究报告 | 2026 |
| §5.4 各层劳动力时薪 | 第三方外包成本对比与劳工研究 | — |
| §5.4 专家时薪区间 | 各公司官网、招募页面与公开定价 | 2026 |
正文节选(前 13 页)
NH-IND-2026-0004
AI 训练数据与语料 · 行业认知研究报告
制作日期 2026-09-05 · 数据截止 2026-09-05
关键词AI 训练数据与语料 · 预训练 · 后训练 · RLHF · RLVR · 强化学习环境 · 验证器 · 合成数据
面向 需要建立行业认知的投资人与产业从业者
回答 这门生意是什么 · 钱在哪一段 · 谁在赚、凭什么 · 什么会让它变
不做 不含投资建议、标的评级与目标价
被一个词装进同一个筐的三门生意:谁在赚钱、赚的是谁的钱、还能赚多久
行业本质:训练数据不是一门生意,是被同一个词装进一个筐的三门:版权授权、人力外
包、软件工程,边际成本与终局没有一条相同
一 · 「训练数据」这个词把三门经济性完全不同的生意装进了一个筐,投资判断的第一步是把它拆开
语料授权是版权生意(边际成本近零、定价靠谈判、卖方分散);人类数据服务是人力外包生意,内部还分成两种经济性
完全不同的结构 —— 项目制(承担交付风险、毛利 30–45%、净利个位数)与抽成市场(不承担交付风险、净收入口径
毛利约 70%、自由现金流可为正),二者的资产负债表完全不同;强化学习环境是软件生意(可复用、可版本化、但客
户最容易自建)。它们的利润率、增长曲线、壁垒结构、终局形态没有一条是相同的。用同一个市场规模数字覆盖它们,
是本行业绝大多数公开研究的通病。
二 · 人类数据服务环节的客户转换成本接近于零,这一点已经被实证,而且是以最昂贵的方式
Meta 于 2025 年 6 月以 143 亿美元取得 Scale AI 约 49% 的无表决权股权、且不进入董事会(多家媒体报道,2025-06;
Scale AI 估值约 290 亿美元),创始人与核心高管随即整体加入 Meta。数月内,Google(2024 年实际采购约 1.5 亿美
元、2025 年原计划约 2 亿美元)、OpenAI、Microsoft 相继缩减或终止合作。它的收入此后停在原地 —— 2024 年 8.7
亿美元、2025 年接近 10 亿美元、2026 年指引仍约 10 亿美元(媒体报道,2026),而此前市场预期是 20 亿美元。请注
意这里失去的不是存量收入,是全部增长:同期竞争对手四个月增长 163%,行业第一原地不动。在一个有真实转换成本
的行业里,最大的几家客户不可能因为供应商的股东名单变化就在几个月内走掉。
三 · 这条链上的钱正在从「标注」流向「专家」,单位价格差了两个数量级
诺辉投资研究部 · 深度报告 AI 训练数据与语料 · 行业认知研究报告
本报告不构成投资建议 1 / 42
肯尼亚数据标注工的时薪区间为 1.46–3.74 美元(学术审计口径,2025);而 PhD 级领域专家在头部平台的时薪为 50–
200 美元,Mercor 平台 2026 年 8 月的平均合约时薪约 114 美元。同一个「数据标注」行业标签下,按各自区间的中位
数计算两端价格差约 45 倍,按极值计算可达约 140 倍,且低价端正在被模型预标注吞掉。
四 · 买方只有十几家,且他们同时是最有能力自建的一方 —— 这是整条链的定价天花板
全球有能力持续采购前沿训练数据的实验室约十余家。供应商的议价能力上限不由数据的价值决定,而由「客户自建这件
事需要多久、多贵」决定。而随着工具链成熟,自建成本正在下降。
五 · 「数据耗尽」是一个被普遍误读的命题:耗尽的不是数据,是「免费且高质量」这个组合
Epoch AI 估算人类公开文本的有效存量约 300 万亿 token,80% 置信区间下在 2026–2032 年间被用尽(Epoch AI,
2024;该机构后续已将窗口前端从 2026 年推后至 2028 年)。真正在变化的是获取成本曲线,不是存量。 MIT 数据溯源
计划 2024 年 7 月的审计显示,C4 语料中最活跃的关键来源已有 28%+ 被 robots.txt 完全限制;按 C4 全量计,45% 被
服务条款限制(Data Provenance Initiative, 2024-07)。注意这是两年前的快照,两个比例的分母也不同;考虑到
2025–2026 年抓取控制的普及,当前实际比例应当更高。
六 · 中国这条链的钱,主要不来自模型厂商
2025 年中国数据标注市场规模约 117.53 亿元(第三方咨询口径,2026)。同期 A 股以训练数据为核心主营的上市公司
海天瑞声营业收入 3.77 亿元、同比 +59%,但综合毛利率下滑 18.38 个百分点至 48.08%,公司归因为定制服务占比提
升(公司 2025 年报,2026-04)。需求爆发与毛利下滑同时发生,说明这门生意的增长要靠定制化人力换取 —— 高毛利
的标准化产品正在被低毛利的定制服务替代。这是产品结构的劣化,不是执行问题。
七 · 强化学习环境是这条链上唯一可能真正产品化的环节,也是最危险的一个
训练范式已从「预训练为主」转向「后训练为主」,可验证奖励(RLVR)成为主流方法栈。Anthropic 曾讨论在未来一
年内于 RL 环境上投入超过 10 亿美元(TechCrunch, 2025-09)。环境的交付物是代码而不是人时,因此它有毛利结构跃
升的可能;但正因为它是代码,客户自建的门槛也最低。这两件事是同一个属性的两面。
免责声明与阅读说明
本报告为行业认知型研究报告,目的是让读者理解「AI 训练数据与语料」这个产业如何运转、价值如何分配、变量在哪
里。本报告不含任何证券代码、标的推荐、估值测算或买卖建议,报告中出现的企业名称仅作为产业事实与机制的例证。
报告中的事实性陈述均标注来源与时间;判断性陈述以「我们认为」「本报告判断」引出。凡数据存在多口径冲突的,本
报告并列呈现冲突并说明取舍理由,不私自择一。
阅读路径建议:只有 20 分钟的读者,读封面七条判断 + 第九章(利润池)+ 第十章(核心判断与变量)。需要建立完整
认知的读者按序通读,第五、六、九章是本报告信息密度最高的部分。
诺辉投资研究部 · 深度报告 AI 训练数据与语料 · 行业认知研究报告
本报告不构成投资建议 2 / 42
第一章 · 总论:这门生意到底是什么 3
第二章 · 需求侧:谁在买、买什么、为什么买 7
第三章 · 供给侧之一:公开抓取与开放语料 ——「免费」这一层正在坍缩 10
第四章 · 供给侧之二:版权授权 —— 当权利变成商品 12
第五章 · 供给侧之三:人类数据服务 —— 这条链的利润主池 14
第六章 · 供给侧之四:合成数据与强化学习环境 —— 供给的工业化 19
第七章 · 中国市场:另一套规则 23
第八章 · 法律与地缘:这条链的制度约束 27
第九章 · 商业模式与利润池:钱从哪来、被谁截留 29
第十章 · 核心判断与关键变量 34
第十一章 · A 股相关上市公司分类 36
附录 A · 关键术语表 39
附录 B · 主要企业名录(按环节) 40
附录 C · 数据来源清单 40
免责声明 41
第一章 · 总论:这门生意到底是什么
1.1 边界:本报告写什么,明确不写什么
「AI 训练数据」在公开讨论中是一个极不精确的词。它有时指爬来的网页文本,有时指标注公司雇人打的标签,有时指
出版社卖出的版权包,有时指一段能让智能体反复试错的软件沙盒。这些东西的共同点只有一个 —— 它们最终都变成了
模型权重的一部分。除此之外,它们的生产方式、成本结构、买家、法律地位、可复制性没有任何一处相同。
本报告的边界如下:
对象 用于训练、微调、对齐、评测 AI 模型的一切数据资产与相关服务企业内部的数据治理、BI、数据仓库(不进入
模型训练的部分)
环节 语料获取与授权 · 数据加工与标注 · 专家数据生产 · 合成数据 ·
强化学习环境 · 评测集 算力、芯片、模型本身、推理服务
地域 全球,其中中国单独成章(第七章),因为它的驱动机制与欧美不
数据形态 文本 · 图像 · 视频 · 音频 · 代码 · 结构化专业数据 · 机器人
本体交互数据 单纯的数据存储与传输基础设施
明确排除的一类:企业为了自用而做的数据准备工作。一家银行整理自己的客服记录去微调一个内部模型,这件事在会计
上是 IT 支出,在产业上不构成外部市场。本报告只统计发生了外部交易的部分。这个边界很重要 —— 很多咨询机构的
「数据标注市场规模」把企业内部人力成本折算进去了,这是三个口径互相打架的主要原因之一(见 §1.4)。
1.2 先判形态:这条链不是链,是一张网
诺辉投资研究部 · 深度报告 AI 训练数据与语料 · 行业认知研究报告
本报告不构成投资建议 3 / 42
产业研究的惯例是画「上游—中游—下游」。这个惯例在这里会误导人。
判断一个产业该画成线性链还是网络图,判据有三条:环节之间是不是单向先后关系?有没有回路?付钱的人和使用的人
是不是同一批?
训练数据产业三条都不满足:
有回路。模型的输出被用来生成下一代模型的训练数据(合成数据),模型也被用来给人类标注做预标注。产出回流
成投入,这是典型的网络特征。
付钱的和产生数据的不是同一批人。一个 Reddit 用户写下的回答,价值由 Google 支付给 Reddit,用户本人不在交
并行通路各自成立。一个实验室可以完全不买授权语料而只靠爬取 + 合成,也可以完全不做人工标注而只做可验证奖
励的环境。这些通路不是先后关系,是替代关系。
所以本报告用行业框架图,不用分层链:
┌──────────────────────── 需求端:模型开发者 ────────────────────────┐
│ 前沿实验室(约 12 家) │ 二线模型公司 │ 应用层企业 │ 具身智能公司 │
└──────┬─────────┬─────────────┬──────────────┬───────────────┬──────┘
│ │ │ │ │
┌───▼───┐ ┌───▼────┐ ┌─────▼──────┐ ┌────▼─────┐ ┌──────▼──────┐
│ 通路一 │ │ 通路二 │ │ 通路三 │ │ 通路四 │ │ 通路五 │
│ 公开抓取│ │ 版权授权│ │ 人类数据服务 │ │ 合成数据 │ │ RL 环境 │
└───┬───┘ └───┬────┘ └─────┬──────┘ └────┬─────┘ └──────┬──────┘
│ │ │ │ │
┌────▼────┐┌───▼─────┐ ┌─────▼──────┐ ┌────▼─────┐ ┌──────▼──────┐
│ 开放语料 ││ 内容平台 │ │ 众包标注平台│ │ 教师模型 │ │ 沙盒基础设施 │
│ 爬虫工具 ││ 出版社 │ │ 专家市场 │ │ 数据蒸馏 │ │ 验证器/评分器│
│ CDN/协议 ││ 图库/媒体│ │ BPO 交付中心│ │ 仿真引擎 │ │ 环境开源社区 │
└─────────┘└─────────┘ └────────────┘ └──────────┘ └─────────────┘
▲ ▲ ▲ ▲ ▲
│ │ │ │ │
┌────┴──────────┴────────────┴────────────────┴──────────────┴────┐
│ 横切层:法律与合规 · 数据溯源 · 质量评估 · 隐私脱敏 │
└──────────────────────────────────────────────────────────────────┘
周边三类 ——
以上是免费试读部分。完整正文 42 页,年费会员 ¥398 全站可读,单篇 ¥180。