行业观察 · 数据与铲子
AI 淘金热里,谁在卖铲子
淘金的人大多没赚到钱,卖铲子的先富了。这句老话在 AI 这轮又应验了一次。
淘金的人大多没赚到钱,卖铲子的先富了。这句老话在 AI 这轮又应验了一次。
什么叫卖铲子
1848 年,加州有人在河里发现了金子。一个开杂货店的人,把旧金山能买到的镐、铲、淘金盘全部买光。

淘金盘从 0.2 美元涨到 15 美元,一把铲子从 1 美元涨到 30 美元,一双靴子从 3 美元涨到 40 美元。开卖头九周的利润是 3.6 万美元。他成了加州第一个百万富翁,一盎司金子都没挖过。
所以「卖铲子」是什么意思?不是卖工具,是换掉了一整套风险结构。
- 淘金的人:赌一件概率的事,挖到了发财,挖不到血本无归,结果不确定。
- 卖铲子的人:卖一件确定的事,只要还有人在挖,铲子就卖得出去,收入确定。
收入不取决于「谁挖到金子」,只取决于「有多少人在挖」。

这一轮,铲子有好几层。离金子越远,越是铲子:电力与能源、芯片与设备(NVIDIA、台积电、ASML)、算力与云、数据与环境(Scale、Surge、Mercor、Handshake)、工具链与评测。以上都是铲子。以下是淘金的人:模型层(OpenAI、Anthropic、xAI)和应用层各种 AI 产品。他们在烧钱赌一个结果,而上面每一层都先收到了钱。
怎么判断一家公司是不是在卖铲子?三条标准:中立性——不管哪家赢,钱都要从你这儿过;收入前置——客户还没赚到钱,就得先付你钱;持续消耗——是卖一次,还是每天都要再买。
最容易被忽略的是第一条。一个教科书级反例:2025 年 6 月之前,Scale AI 同时服务 Google、OpenAI、xAI,中立意味着谁都敢用。Meta 花 140 亿美元买下 49% 股权之后,几周之内就出现砍单、减单。铲子的护城河不是产品,是中立。一旦选边站,就不是铲子了。
为什么是数据
这么多层铲子,为什么单讲数据?第一,别的层都被讲烂了,芯片、算力、电力人人都在聊,数据这层最少人真正看懂。第二,它是唯一一层「越用越贵」,芯片和算力的单位成本一直在降,只有数据的单价在往上涨。第三,它刚刚换了形态,从「卖数据集」变成「卖训练场」,是正在发生的事,不是定局。而且它离金子最近——模型卡在哪,数据公司最先知道。
这条赛道现在多大?Menlo Ventures 合伙人 Deedy 在 2026 年 7 月的统计显示:50+ 家公司合计年收入 85 亿美元,合计估值 1000 亿美元,四家吃掉的收入占比 75% 以上——Scale、Surge、Mercor、Handshake。按收入算,训练数据已是 AI 产业第三大板块,仅次于算力和大模型。
数据以前不算铲子,因为它是一次性的原材料,不是持续消耗品。旧的项目制采购,GPT-4 到 GPT-4o 隔 13 个月才买一次;新的按需采购,GPT-5.4 到 GPT-5.5 只隔 1 个月。迭代越快,实验室越频繁地发现能力缺口,数据采购就从一年几次变成了每天都要买。
「互联网上不是有的是数据吗?」因为模型要学的东西换了。学「答题」,网上到处都是现成的;学「做事」,过程记录世上本来没有。一份完整的工作过程——中间怎么想、卡在哪、改了几版、最后怎么验收——几乎没人记录过。没有,就只能造。所以这行的本质不是采矿:AI 数据公司不是矿工,是工厂。
为什么 AI 的代码能力进步得最快?因为程序员这行早就把过程全记下来了。GitHub 上的一条 commit 记录包含问题描述、修改方案、代码评审、测试结果,从问题出现到解决,一整条链路都在里面。这是全世界最大的「真实工作过程」数据库,而且是免费的、天然存在的。其他行业缺的不是需求,是没有自己的 GitHub。
AI 越强,数据越贵。很多人以为会反过来。早期众包标注一条数据是 0.02 美元 / 条,如今的专家是 90-110 美元 / 小时。因为要教的东西变难了:2024 年的代码基准改 11 行,2025 年的代码基准跨 4 个文件改 107 行。只有比模型更强的人,才教得动它。学生变聪明了,老师就得更贵。
什么是 RL 环境
实验室现在抢着买的,已经不是数据集了。静态数据集约等于教科书加标准答案,题看多了答案背得出来,但看再多驾驶教材也不会开车。RL 环境约等于驾校的练车场——一个可以随便撞、撞了重来的模拟世界。模型自己动手做,做对加分、做错扣分,分数再回去改模型,反复练,直到练熟。因为 AI 的任务从「回答问题」变成了「完成任务」,而做事这件事教不会,只能练。
拆开看,一个环境三件套:沙箱,把真实软件复刻一份;任务,给模型一个具体的活;判分器,专家写的评分标准。难的不是前两件,是第三件。分数回去改模型,再练一轮。
这些沙箱是一行行代码手工搭出来的,比如 Excel、Salesforce、Slack、Zendesk。复刻一个网站环境的造价约 2 万美元,已采购数百个。另有实验室内部讨论过一年花 10 亿美元。
那「世界模型」呢?是不是就是 RL 环境?不是一回事。RL 环境是一种用途,给 AI 练习的场地,不管你是怎么把它造出来的。世界模型是一种技术,一个学出来的神经网络,能预测「你这么做,世界会变成什么样」。两者的关系是:世界模型是造训练场的一种新方法。手搭的 Slack 沙箱是 RL 环境,但它不是世界模型。
世界模型在赌什么?赌能不能把训练场从「手工造」变成「自动生成」。手搭环境的三个死穴:贵——一个约 2 万美元;慢——一块砖一块砖砌;盖多少只有多少——覆盖不了真实世界。已经做到哪一步?一句话生成一个能走进去逛的 3D 世界,实时可交互,720p、每秒 24 帧,能维持几分钟一致。但它还够不着企业场景——现在的动作基本只有移动和转镜头,而 AI 要学的「用 Excel 干活」属于软件世界,它生不出来。
裂缝与下一步

但铲子也有裂缝。只讲好的那半边,就成广告了。客户高度集中,有公司九成以上收入来自基础模型厂商;人力成本吃掉大半,毛利被人工费压着,不是软件生意;手搭环境可能被自动生成取代,世界模型一旦成了,2 万美元一个的环境就贬值。
那个卖铲子的人后来怎么样了?他晚年破产,在默默无闻中去世。卖铲子赢的是这一轮,不是永远。
模型在赌能不能赢,而给模型供燃料的人,已经先收到钱了。
下一篇想问的是:这些「真实工作数据」,到底是谁的?当公司开始把员工的日常文件卖给 AI 实验室,隐私和安全就不再是背景板了。
整理自公开报道 · 数字以官方为准