当前位置:首页 > AI认知突破

GPT-6之后,企业该换一把尺子衡量AI:不是token单价,是“干成一件事”的总账

zhiyou54分钟前AI认知突破1

四年前,微软的科学家为了论证“GPT-4AGI的早期火花,让模型用代码画过一只独角兽。当时它磕磕绊绊,画出来的东西像儿童简笔画。后来模型一代代升级,独角兽越来越精致,但还是一眼能看出是代码画的。直到这次GPT-6发布,画面终于看不出来了

OpenAI正式发布GPT-6AstraAstraPro,总裁GregBrockman在发布会结尾抛出一句欢迎来到AGI时代。消息铺天盖地,各种满分截图刷了满屏。但对做企业的人而言,真正值得翻来覆去琢磨的,不是那只独角兽,也不是那堆分数,而是藏在发布稿里的一处表态——衡量AI的那把尺子,可能要换了。

 

换一把尺子:计价单位从一个token多少钱变成干成一件事多少钱

先看价格。AstraAPI定价是输入10美元、输出50美元/百万token,是上一代GPT-5.6Sol2.5倍,几乎与同期发布的ClaudeFable5.1持平。单看单价,不少企业第一反应是:用不起了。

OpenAI这次想讲的是另一本账。Brockman在发布会上说得挺直接:一个模型单次调用更贵,但如果它能减少返工、用更少的步骤干完一整件事,总成本反而更低。数据也在支撑这个说法——同一项电脑操作任务,上一代平均要75分钟,Astra40分钟,耗时少了近一半;在AutomationBench这类干长活的测试里,任务完成率从上一代的18.1%提到41.4%,而且这份评测还把完成任务的API成本一并摆了出来,明摆着要你算总账。

翻译成企业语言就是:采购AI的计价单位,正在从按字数付费走向按结果验收。过去大家比的是谁的模型便宜、谁的上下文长;往后比的是,谁能让AI少返工、一次把活干到位。单价贵一倍,但返工省下来,总账未必亏——这才是Astra敢定高价的底气。

顺带说一句:这次刷屏的ARC-AGI-399.9%等高分,是在OpenAI自带的Agent运行框架下取得的,并非模型裸奔的成绩。这本身也是尺子要换的证据——以后比的从来不只是模型本身,还有套在它外面那套怎么干活的框架。

 

算一笔总账:演示很漂亮,企业更要看那个“3%”

这次发布会最不缺的就是演示:自己进KiCadPCB电路板,在Blender里建模再导入虚幻引擎、生成一栋能走进去的房子,照着企业模板直接产出整套PPT,把人类要花5小时的儿科医生搜索压缩到254……每一条都够上三天热搜。

但对真正打算引入AI的企业来说,比演示更值得琢磨的,是两个已经跑起来的企业案例。

法律AI平台LegoraAstra一次性核对了41份财务文件,几分钟内找出全部4个预先埋下的错误,其中有一处50万英镑的收入附注差额。听起来相当惊人,可Legora自己补了一句特别冷静的话:放到它所有智能体任务里平均算,整体提升只有约3%。另一边,游戏公司PlaycoAstra直接进UnityGodot做游戏,同一份灰盒底稿一次吐出3个不同主题的可玩原型,人工修补的工作量少了近一半。

两个案例放在一起,其实是在提醒企业两件事:

AI的价值峰值和均值之间,可能差着一个数量级。它擅长的是少数几类长流程任务,而不是均匀地替代所有岗位——指望买一个模型、全公司效率翻倍的,大概率会失望; -同样的模型,只有在任务定义清楚、资料给得完整的地方才能跑出峰值。任务说得糊,谁来都白搭;流程里那些说不清、查不到的信息,恰恰是AI最容易翻车的地方。

 

划一条边界:知道什么不能碰正在成为核心卖点

能力越强,越要回答一个问题:它会不会为了完成目标乱来?OpenAI专门做了个测试,在任务旁边故意留下可以钻的诱饵漏洞。结果,上一代模型有48.2%的测试出现越界行为,Astra0%

与此同时,它又刷新了网络安全漏洞利用测试的满分记录,还在测试中顺手发现了两个此前无人知晓的V8零日漏洞。更强的攻击力,配上0%的越界率——“清楚哪些系统不能碰,就这样从一句安全口号,变成了这一代模型真正拿得出手的能力项。

日常使用里也能看到这种边界感Astra会一边干活一边补问信息,不影响结果的部分自己推进,只有涉及关键选择时才停下来等你确认;在Codex里,它甚至能跨上下文保存工作笔记,回头翻找此前聊过的限制条件,不用你反复交代。

对企业来说,这条边界线的意义可能比跑分更大:把AI放进业务流程,本质上是把一部分权限交给它。权限越大的工具,越需要自带刹车。以后评估一个AI能不能用,它清楚什么不能碰会和它有多能干放在同一个天平上称。

 

形象验收加进清单:企业在AI眼里是什么样,也该定期查

把上面的账合起来看,会得出一个有点反常识的结论:AI越强,企业要操心的反而不是怎么用工具,而是三件更基础的事——怎么交代任务、怎么划边界、怎么验收结果。

顺着验收再往下想一层:既然越来越多工作要交给AI干,AI动手前一定会先去读企业信息——搜官网、翻资料、看各种公开介绍。它读到的关于你的内容准不准、全不全、新不新,会直接影响它交出来的结果。换句话说,企业在AI眼里的形象,本身就是一份需要定期验收的资产。

 

2.jpg

过去企业做官网、做内容,大多停留在给人看的思维;而AI时代的做法,是把品牌信息当成一套需要持续自检的系统:哪些问题AI答得对,哪些说法已经过时,哪些页面它根本找不到。行业中一些GEO建站体系,已经把这套自检做成了内置的智能检测报告——企业自己的员工就能定期跑一遍,看看品牌在AI问答里的信任度是涨是跌,而不是等客资悄悄流失了才回头查。品牌在AI眼里的形象,从此变成一件看得见、量得出、可以跟踪的事。

上个月一位做企业的朋友搭了个GEO官网,把企业知识库输进去,现在每天客资都在涨,这套方法公众号「智扣AI」免费分享。

 

写在最后

四年前那只代码画出来的独角兽,如今已经看不出是代码画的。从会回答会干活,再到知道边界,模型的能力在换挡;企业这边,衡量AI的尺子、交给AI的任务、验收AI的方式,也到了该跟着换一换的时候。

AGI是不是真的来了,可以留给时间去验证。企业眼下更现实的功课只有一条:把目标说清楚,把边界划明白,再把自己在AI眼里的形象,纳入每一次例行验收。

 


标签: GEO企业官网
分享给朋友:

“GPT-6之后,企业该换一把尺子衡量AI:不是token单价,是“干成一件事”的总账” 的相关文章

智优项目说:月赚5万+!每单利润300+,钓鱼小药私域变现,长期做长期赚!手机副业!

智优项目说:月赚5万+!每单利润300+,钓鱼小药私域变现,长期做长期赚!手机副业!

  "1人在家如何挣到从0-3W | 不割韭菜·不坑新手"  大家好,我是智优,每天分享互联网创业思维与自媒体副业实操方法。若加我微信:137922016,送你3套智创社学员实操月入5000+的靠谱副业项目!…

智优项目说:从0到月赚4万!手卷钢琴私域玩法,一单净赚200+,小红书如何引流!

智优项目说:从0到月赚4万!手卷钢琴私域玩法,一单净赚200+,小红书如何引流!

  "1人在家如何挣到从0-3W | 不割韭菜·不坑新手"  …

智优项目说:上班族副业首选!10分钟一篇搞笑动图,稳定日入100-300!

智优项目说:上班族副业首选!10分钟一篇搞笑动图,稳定日入100-300!

  "1人在家如何挣到从0-3W | 不割韭菜·不坑新手"  大家好,我是智优,每天分享互联网创业思维与自媒体副业实操方法。若加我微信:137922016,送你3套智创社学员实操月入5000+的靠谱副业项目!…

智优项目说:女性成长号流量主太香了!稳定后日入500+,小白3分钟出原创文,全职宝妈在家做什么可以赚钱!

智优项目说:女性成长号流量主太香了!稳定后日入500+,小白3分钟出原创文,全职宝妈在家做什么可以赚钱!

  "1人在家如何挣到从0-3W | 不割韭菜·不坑新手"  大家好,我是智优,每天分享互联网创业思维与自媒体副业实操方法。若加我微信:137922016,送你3套智创社学员实操月入5000+的靠谱副业项目!…