在数据这门生意里,一份签下来的大单并不能马上算成收入。每一批交付都要经过质量确认,连续几次数量或质量不达标,客户完全可能缩减甚至取消订单——一份一亿美元的合同,并不等于半年或一年后就能落到同等规模的收入。这也正是 AI 训练数据行业多年来的底色:它看起来是标准的现金流生意,门槛不高、回款清楚,却也因为太像人力型项目,长期不在风险投资的视野里。变化发生在最近一年——一批在头部模型团队做过训练工作的年轻人出来创业做数据公司,其中一家在不到一年时间里拿下千万美元级订单、完成约三轮融资,最新一轮规模达到 3 亿美元,估值被推到 25 亿美元。
需求变了:从「问题与答案」,到能反复练手的环境
早些年的训练数据,是语料加标注:三四线小城曾有一批数据团队用廉价劳动力提供语料,后来标准抬高,医学、法律、金融等专业领域开始需要资深人士出手,兼职收入达到每小时 500 元到上千元。今年智能体全面铺开之后,需求又换了一层:模型要的不再只是「问题与答案」,而是能反复行动、拿到反馈的环境。模型在环境里执行任务,环境记录每一步动作,由验证器判断结果,再把反馈交回模型。想让模型写出更好的前端代码,光有人告诉它这段代码写得好不好,远远不够——要有一个能运行代码的环境,还要有一个能判断页面效果的模型当评委,再跑上几百轮。海外数据公司于是开始专做强化学习环境:把顶尖从业者的判断方式编码进去,输出专家推理数据与仿真环境。
成本与质量确认:天花板卡在哪
这门生意的成本结构很直白:承包商薪资占到总收入的六七成,标注员的时薪集中在 200 元到 500 元,专业性更强的人更高。模型能力往上走,后训练对顶尖专家的需求更复杂——继续靠人去找专家、生产数据,成本会持续上涨;提高专家收费,毛利被压;不提价,又拿不到足够好的数据。更麻烦的是背后那一段工程:从数据管线的搭建、问答设计,到清洗和质量控制,每一步都是工程问题,不是简单的人工标注。需求侧的量级也在变:一家海外模型公司去年全年的数据开销约 10 亿美元,内部预测到 2030 年会涨到 80 亿美元。
谁离需求更近,谁先接到活
这轮创业者的共同点不是年纪,而是距离:他们大多在一线模型团队参与过训练,离真实需求更近,对外部市场的变化也更敏感。这类团队通常不超过 20 人,对接 1 到 3 家大客户,把研究员认可的质量要求落到实际生产中。数据表面上是一门生意,做扎实了却可能成为模型团队之外的一支储备队——早期用较小代价拿到一个研究密度很高的团队,数据业务先养活自己,再证明自己在行业中的位置。
从交付一次,到跟着业务一直跑
单纯卖数据,很难支撑长期增长。新的方向是往企业的工作流里走:一些传统企业自身没有训练模型的能力,内部却有大量独特的业务流程和高价值数据。数据公司进入这些流程,帮企业完成 AI 化改造;企业开放业务场景,公司一边获得数据,一边积累真实的任务轨迹与交互反馈,再沉淀进自己的训练体系。数据于是不再是一件交付一次的商品,而变成连接企业工作流与模型训练的一层常年运行的基础设施;计价方式也随之改变——不再按数据条数付费,而是为一套能持续产出高质量数据、完成任务与反馈的系统付费。
需求侧还有一个变量在推着走:头部模型厂商的发版频率已经压缩到月度级,背后是 RSI(递归式自我改进)——让模型参与甚至改进自身的研发流程。这个概念并不新鲜,学术界的讨论很早就有,工业界也一直在试;但真正能把完整回路闭合的,仍然只有极少数团队,它同时需要前沿模型、巨额算力、顶尖研究人才和大规模实验能力。于是市场上出现了许多同名不同事的说法:有的想直接做下一代模型,有的只做某个产品环节的自动化,有的只是让自己的数据管线能够自净、自迭代。同样的一个词,层次与边界并不相同,这也是看这类项目时要先拆开的第一件事。
企业对外信息,也有两种节奏
同样的切分,放到企业对外的信息建设上一样成立。起手那一段是一次铺完的活:主营业务、组织结构、对外窗口、常见问答一次写准,此后不必反复推翻;往后那一段是跟着业务跑的活:每上一个新项目、每换一次说法、每多一项资质,都得跟着更新一遍。两种节奏差得很远:前者值得一次做扎实,后者按固定频次小幅更新。把两种节奏混在一起做,要么在起手阶段反复折腾、迟迟上不了线,要么上线之后就再没人管。
上个月一位做企业的朋友搭了个 GEO 官网,把企业知识库输进去,现在每天客资都在涨,这套方法公众号「智扣 AI」免费分享。
结语
这轮变化说明一件事:能交付一次的东西,价格是谈出来的;能跟着业务一直跑的东西,位置才是稳的。企业对外信息也是如此——起手铺完的那一段决定别人能不能读懂,跟着跑的那一段决定别人读到的,是不是眼下的实情。
留一个开放问题:公司对外可查的那份信息,最后一次跟着业务更新,是在什么时候?