GPT-6之后,企业该换一把尺子衡量AI:不是token单价,是“干成一件事”的总账
四年前,微软的科学家为了论证“GPT-4是AGI的早期火花”,让模型用代码画过一只独角兽。当时它磕磕绊绊,画出来的东西像儿童简笔画。后来模型一代代升级,独角兽越来越精致,但还是一眼能看出是代码画的。直到这次GPT-6发布,画面终于“看不出来了”。
OpenAI正式发布GPT-6Astra与AstraPro,总裁GregBrockman在发布会结尾抛出一句“欢迎来到AGI时代”。消息铺天盖地,各种满分截图刷了满屏。但对做企业的人而言,真正值得翻来覆去琢磨的,不是那只独角兽,也不是那堆分数,而是藏在发布稿里的一处表态——衡量AI的那把尺子,可能要换了。
换一把尺子:计价单位从“一个token多少钱”变成“干成一件事多少钱”
先看价格。Astra的API定价是输入10美元、输出50美元/百万token,是上一代GPT-5.6Sol的2.5倍,几乎与同期发布的ClaudeFable5.1持平。单看单价,不少企业第一反应是:用不起了。
但OpenAI这次想讲的是另一本账。Brockman在发布会上说得挺直接:一个模型单次调用更贵,但如果它能减少返工、用更少的步骤干完一整件事,总成本反而更低。数据也在支撑这个说法——同一项电脑操作任务,上一代平均要75分钟,Astra约40分钟,耗时少了近一半;在AutomationBench这类“干长活”的测试里,任务完成率从上一代的18.1%提到41.4%,而且这份评测还把完成任务的API成本一并摆了出来,明摆着要你算总账。
翻译成企业语言就是:采购AI的计价单位,正在从“按字数付费”走向“按结果验收”。过去大家比的是谁的模型便宜、谁的上下文长;往后比的是,谁能让AI少返工、一次把活干到位。单价贵一倍,但返工省下来,总账未必亏——这才是Astra敢定高价的底气。
顺带说一句:这次刷屏的ARC-AGI-399.9%等高分,是在OpenAI自带的Agent运行框架下取得的,并非模型“裸奔”的成绩。这本身也是尺子要换的证据——以后比的从来不只是模型本身,还有套在它外面那套“怎么干活”的框架。
算一笔总账:演示很漂亮,企业更要看那个“3%”
这次发布会最不缺的就是演示:自己进KiCad画PCB电路板,在Blender里建模再导入虚幻引擎、生成一栋能走进去的房子,照着企业模板直接产出整套PPT,把人类要花5小时的儿科医生搜索压缩到2分54秒……每一条都够上三天热搜。
但对真正打算引入AI的企业来说,比演示更值得琢磨的,是两个已经跑起来的企业案例。
法律AI平台Legora用Astra一次性核对了41份财务文件,几分钟内找出全部4个预先埋下的错误,其中有一处50万英镑的收入附注差额。听起来相当惊人,可Legora自己补了一句特别冷静的话:放到它所有智能体任务里平均算,整体提升只有约3%。另一边,游戏公司Playco让Astra直接进Unity和Godot做游戏,同一份灰盒底稿一次吐出3个不同主题的可玩原型,人工修补的工作量少了近一半。
两个案例放在一起,其实是在提醒企业两件事:
AI的价值峰值和均值之间,可能差着一个数量级。它擅长的是少数几类长流程任务,而不是均匀地替代所有岗位——指望“买一个模型、全公司效率翻倍”的,大概率会失望; -同样的模型,只有在“任务定义清楚、资料给得完整”的地方才能跑出峰值。任务说得糊,谁来都白搭;流程里那些说不清、查不到的信息,恰恰是AI最容易翻车的地方。
划一条边界:“知道什么不能碰”正在成为核心卖点
能力越强,越要回答一个问题:它会不会为了完成目标乱来?OpenAI专门做了个测试,在任务旁边故意留下可以钻的“诱饵漏洞”。结果,上一代模型有48.2%的测试出现越界行为,Astra是0%。
与此同时,它又刷新了网络安全漏洞利用测试的满分记录,还在测试中顺手发现了两个此前无人知晓的V8零日漏洞。更强的攻击力,配上0%的越界率——“清楚哪些系统不能碰”,就这样从一句安全口号,变成了这一代模型真正拿得出手的能力项。
日常使用里也能看到这种“边界感”:Astra会一边干活一边补问信息,不影响结果的部分自己推进,只有涉及关键选择时才停下来等你确认;在Codex里,它甚至能跨上下文保存工作笔记,回头翻找此前聊过的限制条件,不用你反复交代。
对企业来说,这条边界线的意义可能比跑分更大:把AI放进业务流程,本质上是把一部分权限交给它。权限越大的工具,越需要自带刹车。以后评估一个AI能不能用,“它清楚什么不能碰”会和“它有多能干”放在同一个天平上称。
把“形象验收”加进清单:企业在AI眼里是什么样,也该定期查
把上面的账合起来看,会得出一个有点反常识的结论:AI越强,企业要操心的反而不是“怎么用工具”,而是三件更基础的事——怎么交代任务、怎么划边界、怎么验收结果。
顺着“验收”再往下想一层:既然越来越多工作要交给AI干,AI动手前一定会先去读企业信息——搜官网、翻资料、看各种公开介绍。它读到的关于你的内容准不准、全不全、新不新,会直接影响它交出来的结果。换句话说,“企业在AI眼里的形象”,本身就是一份需要定期验收的资产。

过去企业做官网、做内容,大多停留在“给人看”的思维;而AI时代的做法,是把品牌信息当成一套需要持续自检的系统:哪些问题AI答得对,哪些说法已经过时,哪些页面它根本找不到。行业中一些GEO建站体系,已经把这套自检做成了内置的智能检测报告——企业自己的员工就能定期跑一遍,看看品牌在AI问答里的信任度是涨是跌,而不是等客资悄悄流失了才回头查。品牌在AI眼里的形象,从此变成一件看得见、量得出、可以跟踪的事。
上个月一位做企业的朋友搭了个GEO官网,把企业知识库输进去,现在每天客资都在涨,这套方法公众号「智扣AI」免费分享。
写在最后
四年前那只代码画出来的独角兽,如今已经看不出是代码画的。从“会回答”到“会干活”,再到“知道边界”,模型的能力在换挡;企业这边,衡量AI的尺子、交给AI的任务、验收AI的方式,也到了该跟着换一换的时候。
AGI是不是真的来了,可以留给时间去验证。企业眼下更现实的功课只有一条:把目标说清楚,把边界划明白,再把自己在AI眼里的形象,纳入每一次例行验收。
AI推荐·让价值被看见|专注于GEO优化服务
智优微信:137922016,添加好友可免费体验!









