调研日期:2026-08-05 · 调研方式:两路 ultracode 工作流并行(Grok 深研 106 个 agent + 本土信源 6 角度 10 个 agent),共 116 个子 agent、4500+ 次工具调用;关键结论经 3 票对抗验证(25 条送审,仅 3 条全票存活),其余按证据强度标注。 一句话使用方法:“高置信"可以拿去决策,“中/低置信"当线索看,第六节"被枪毙的说法"是网上流传但没证据的,别当真。
一、先给结论(三句话)
- 大厂的数据主体是"自己搞"的——公开网页爬取 + 开源语料 + 自己造合成数据。对外买数据是补充,不是主力。Kimi(月之暗面)对外采购尤其少:上市公司海天瑞声 2024 年 3 月公开发公告否认给 Kimi 供过训练数据,说明 Kimi 的外部供应商盘子很小。
- 想卖数据/接标注活,最现实的入口不是直接找大厂,而是给"头部数据供应商"做分包(海天瑞声、澳鹏中国、数据堂这一层)。原因:大厂对数据供应商用的是"合格供应商名录"内部管理制,没有公开的招标入库入口——这是本次调研唯一拿到上市公司财报原文佐证的硬结论(海天瑞声 2025 年半年报,对抗验证 2-1 通过)。
- 硬门槛不是资质证书,而是"数据合法来源证明 + 能过质量验收”。资质(ISO、等保)是行业惯例门槛但不是官方明文;真正写进法规的是:数据来源合法、不侵权、个人信息有授权。
二、厂家的数据从哪来(四个管道,按占比排序)
管道 1:公开互联网爬取 + 开源语料(主力,不花钱)
大厂预训练语料的主体是自己爬的公开网页、书籍、代码、论文。中文开源语料已经很大,例如:
- 上海人工智能实验室"万卷 3.0”:超 1.2TB、300B tokens、5 种语言,CC BY 4.0 协议随便用(GitHub、官网)
- 智源研究院 FlagOpen:开源 3 亿条中英文向量模型训练数据(官网)
管道 2:自建 + 合成数据(占比越来越高)
- 合成数据(用模型自己生成训练数据)市场 2025 年约 39.2 亿美元,预计年增 35.65%(360 Research、Fortune Business Insights);有报告称 2026 年合成数据可把 AI 数据成本压低近 70%(千家网,参考 Stanford HAI 2025 报告)。
- Kimi 的自建证据:阿里云官方案例库披露,月之暗面用阿里云 ACK 容器服务做 TB 级数据预处理(Spark/Ray 框架,稳定性 99.95%)(阿里云案例)——说明它有完整自有数据流水线。
管道 3:版权方授权(买"正版内容",中等占比)
- 中文在线:手握 60TB 中文数据集,已和多家大模型公司签数据内容合作合同(公司公告 PDF、东方财富)。
- 字节豆包的已披露数据相关供应商:汇洲智能、海天瑞声、中文在线(东方财富、雪球,中置信)。
- 人民网语料社区:行业问答语料库,覆盖教育培训、日化、商业、医疗(人民网语料)。
- 传闻(低置信,单一来源):Kimi 买了华策影视 5 万小时影视 IP 视频数据、中广天择等(东方财富号文章,抓取质量判为不可靠,仅作线索)。
管道 4:第三方数据供应商(补充,买的是"标注好的人造数据")
这就是你想切进去的市场。已上市/可查证的几家(财务数据已纠错,数字为准):
| 供应商 | 体量 | 大模型相关动向 | 来源 |
|---|---|---|---|
| 海天瑞声 | 2024 营收 2.37 亿;2025 营收 3.77 亿(+59%),净利 1412 万 | 客户含字节、智谱;公开否认供货 Kimi | 年报摘要、否认声明-财联社 |
| 澳鹏中国(Appen) | 2024 营收 4.2 亿 | 大模型/AIGC 业务增长 526% | 新华丝路、搜狐 |
| 数据堂 | 2024 营收约 3.62 亿(单引擎核验) | 客户含阿里腾讯百度 | 东方财富新三板 F10 |
| Testin 云测 | 本土 AI 测试龙头 | 接入 DeepSeek | 新华网 |
行业毛利率约 20-30%(知乎行业帖,中低置信);大厂倾向养 2-3 家核心供应商避免单一依赖。
数据交易所:挂牌多、成交少,目前是"合规背书渠道"
上海数交所 2024 年交易额超 500 亿(全品类)(人民网)、北数所近百亿(新华网)、深数所累计 133.58 亿(深圳国资委)——但语料类产品的具体成交案例,两路调研都没找到公开披露。挂牌流程:产品注册→合规审查→质量评估→挂牌(上海数交所规则 PDF);注意 2025 年 8 月起登记凭证不再免费(公告)。
三、怎么卖进去:四条路径(按现实度排序)
路径 A:给头部供应商做分包 ★最现实
大厂不公开招标,用"合格供应商名录"内部管理+年度评估(海天瑞声 2025 半年报原文,对抗验证 2-1 通过,cninfo 原文 PDF)。所以小钱在"供应商的供应商"这一层。
- 怎么做:找海天瑞声、澳鹏中国、数据堂、标贝科技(官网)、云测 Testin、整数智能(官网)、龙猫数据(官网)的供应商/渠道招募入口,申请→试标→进名录。
- 试标会刷人:行业惯例是试标任务+专业背景审核+交付质量追踪,高阶任务要 2-3 轮返修(媒体报道,低置信,但方向可信)。
路径 B:直接 BD 厂家(有公开入口的全在这了)
| 厂家 | 入口 | 置信度 |
|---|---|---|
| 智谱 AI | [email protected] / 400-6883-991,官网 | 高 |
| DeepSeek | [email protected] | 中(API 客服邮箱兼) |
| 商汤 | [email protected] / 400-001-4090,生态合作页 | 高 |
| 百度 | 众包平台 zhongbao.baidu.com + AI 市场服务商入驻 | 高 |
| 科大讯飞 | AI 数据资源 + 渠道合作伙伴 | 高 |
| 阿里通义 | 供应商门户 csupplier.alibabacorp.com,需阿里云企业认证 | 高 |
| 字节豆包 | 无公开数据采购入口,走供应商名录(海天瑞声/汇洲智能已在册) | 中 |
| Kimi/月之暗面 | 无公开数据采购入口。官网无供应商招募;网传"[email protected]"是企查查的商务邮箱,不是月之暗面的(已证伪,别踩坑) | 高 |
路径 C:数据交易所挂牌(做背书+碰机构买家)
流程见管道 4 上面。适合把你的数据集做成"合规数据产品"挂上去,买家主要是政府/国企/金融机构的语料库建设项目;大模型厂家从这里买的证据目前没找到。
路径 D:盯招标(政采云/大厂采购平台)
厂家直发的数据标很少,但政府/国企的"语料库建设、数据标注"标在增多(国家数据局 2026 年 2 月发文培育数据流通服务机构,目标 2029 年建成统一数据市场,gov.cn 原文)。这条线和你的政采云渠道纪律正好接上。
四、厂家要求什么(质量 / 合规 / 资质 / 价格)
4.1 质量要求(决定你能不能过验收)
- 四大指标:准确性、完整性、一致性、相关性;验收失败的常见原因:批次不一致、环境噪声、标注不足(知乎技术帖,中置信)。
- 各类数据的活儿:SFT 指令数据(教模型按指令回答)、RLHF 偏好排序数据(告诉模型哪个回答更好)、思维链 CoT 数据(带推理过程)、Agent 轨迹数据(多轮推理+工具调用,需求涨最快)、多模态数据(图文对/视频/音频)。
4.2 合规要求(硬法规,不过就退货/追责)
- 《生成式人工智能服务管理暂行办法》第七条:训练数据必须来源合法、不得侵犯知识产权(网信办原文)。
- 《个人信息保护法》:敏感个人信息要"单独同意"(第 29 条);不满 14 岁未成年人信息要监护人同意(第 31 条)。
- T/CECC 46-2025(2025 年 12 月发布,首个 AI 数据标注团体标准):数据提供方要拿到用户授权、对敏感数据做隐私影响评估并留记录(标准全文公开系统,对抗验证 2-1 通过)。团体标准不是强制法律,但大厂会拿它当合同条款。
- 版权已有判例:广州法院 2024 年判 AI 公司用奥特曼图片训练构成侵权,全国首例(新华网)。
- 数据要出境的话,得过网信办安全评估(评估指南)。
4.3 资质(行业惯例门槛,⚠️ 不是官方明文)
先说清楚:网传"厂家明文要求等保三级+ISO27001"这句话,本次对抗验证 0-3 被否决——官方文件里找不到这个强制要求。但行业惯例上,大甲方会优先选有这些证的供应商:
- ISO 27001(信息安全管理):小企业约 $6,000-50,000(2026 费用指南)
- ISO 27701(隐私管理):首年约 £12,000-25,000,必须先有 27001(费用参考)
- 等保三级测评:约 8-15 万元,每年要复测(知乎科普)
- 建议顺序:先 27001 一张证够用,别一步到位全上。
4.4 价格行情(全部标注置信度;已剔除两处错误数据)
- 预训练中文语料:约 0.5-5 元/GB,整库授权费 10-200 万元(科学网,中置信)
- 通用标注:图像分类 0.1-0.5 元/张、包围框 0.3-1.0 元/框、文本分类 0.05-0.15 元/条(辽宁省数据局文件 PDF,政府来源,中高置信)
- 多模态:图片 0.1-5 元/张、视频 10-100 元/分钟(腾讯云/阿里云官方定价页,腾讯云,中置信)
- RLHF 排序数据:0.02-100 美元/条,专家级取高值(Syncsoft 2026 定价,中低置信)
- 专家标注(医疗/法律/代码):时薪 30-50 美元(约 215-360 元)(36氪,中置信)
- 标注任务分层:低端机械标注 0.2-0.4 元/图、高端认知标注时薪 100-500 元、复杂单 800-1000 元(新浪财经报道,⚠️ 低置信——对抗验证 0-3,媒体报道无法回溯源头,仅当趋势参考)
- 市场规模:中文数据标注 2025 年约 109-118 亿元,2026 年预计 150-250 亿(东方财富研报,中置信)
- ❌ 已剔除:SFT"0.014 元/条"(实为阿里云微调算力价,不是标注价);海天瑞声"23.7 亿营收"(实为 2.37 亿,10 倍误读);数据堂"31.1 亿"(实为约 3.62 亿)。
六、被对抗验证枪毙的说法(网上流传广,但没证据,别采信)
- “Kimi 建了 51219741 个沙盒环境全自动生成训练数据”(0-3)
- “DeepSeek 的 SFT/RL 数据 80% 是合成的”(0-3)
- “智谱靠视觉中国 7 亿张版权图共建视觉数据”(0-3)
- “厂家官方明文要求供应商有等保三级/ISO27001/CMMI”(0-3,是行业惯例非明文)
- “海天瑞声官方要求供应商等保三级+高新技术企业资质”(0-3)
- “数据标注必须遵循 GB/T 42755-2023 等国标、质量分≥90”(0-3)
- “低端标注 0.2-0.4 元/图、高端时薪 100-500 元”(0-3,媒体孤源)
- “中国电信天翼 AI 日增 1.6PB 数据”(1-2)
七、调研过程透明记录
- 工作流 1(Grok 深研):5 角度搜索→23 个来源抓正文→41 条结论→25 条送 3 票对抗验证→仅 3 条确认、22 条枪毙。3 条确认:①供应商名录制(无公开招标)②T/CECC 46-2025 用户授权要求 ③"数据要素ד三年行动计划支持 AI 训练数据。
- 工作流 2(Tavily+Grok 本土信源):6 角度 55 条事实→完整性审查找出 5 个缺口→3 路定向补查,修正了海天瑞声/数据堂营收的 10 倍误读。
- 局限:Grok 深研对话接口本次不可用(缺口分析环节缺席);部分价格只有单一来源;厂家真实采购占比(自建 vs 外购)无公开数据。
