当前位置:首页 > AI认知突破

GPT-6Astra时代,企业最该补的不是算力,而是一份AI“不靠猜”的标准答案

93日,OpenAI发布新一代旗舰模型GPT-6Astra。会上最出圈的一句话,是总裁GregBrockman在媒体沟通会结尾说的:“WelcometotheAGIera”——欢迎来到AGI时代。

消息确实够炸:1.05M的上下文窗口,在号称测悟性ARC-AGI-3上拿到99.9%,还能像人一样操作电脑、跑完整套工作流。但对每天要为企业做判断的人来说,比起“AGI到底来没来这种宏大命题,更值得先想清楚一个具体问题:当一个AI开始能替你干活、替你拿主意,它判断的依据从哪里来?

 

1.jpg

你公司里那些没写清楚、散落各处、甚至被第三方误读过的信息,它会照单全收,还是自己合理补全?这篇文章顺着Astra的三个变化,把这个问题拆开看。

 

变化一:它会做事了,屏幕正在成为AI时代最通用的接口

过去让AI操作软件,主流思路是等接口:日历有日历的API,邮件有邮件的API。但现实世界的软件远没那么理想——很多企业内部系统是十几年前写的,文档在哪都不一定找得到。

Astra换了一条路:不给接口也无所谓,它像人一样看屏幕、找按钮、点鼠标、敲键盘。在OSWorld这类AI扔进真实电脑干活的评测里,它的任务完成率达到72.6%(上一代旗舰为65.7%),同样一项复杂任务,平均耗时从75分钟降到约40分钟。官方展示里,它能直接操作ExcelPowerBI,能安装软件、跑前端测试,也能盯着屏幕上的报错继续排障,甚至完成PCB电路板设计。

对企业来说,这条消息的分量不在于某个软件被驯服了,而在于它宣告:执行层的门槛正在被系统性抹平。任何人类能通过屏幕完成的数字工作,理论上都会逐渐进入AI的操作范围——你不用再等那套老ERP接入什么新接口。而当做事不再稀缺,做什么、按什么标准做就必然成为下一轮竞争的主战场。

 

变化二:它会拿主意了,AI的合理推断开始变得极其合理

现实工作里,大多数任务根本写不成一条完美指令。老板说帮我把明天会上要看的东西准备一下,背后没说明白的问题有一堆:什么格式、给谁看、重点是什么、要不要翻上次的会议记录。

让人抓狂的AI通常走两种极端:要么连环追问、什么都不敢定;要么闷头干两小时,交上来一份自己脑补的成果。Astra这次强化的是第三条路——OpenAI管它叫Judgment(判断力):能合理推断的细节自己补,真正会改变结果方向的问题,才停下来问你一个聚焦的问题;在Codex里,它甚至可以一边等你答复,一边继续处理不依赖你的部分。

支撑这种判断力的底子,是ARC-AGI-3上那个夸张的数字:99.9%。这个评测没有说明书、不告诉你规则,全靠模型进到陌生环境里自己摸索规律,再迁移到更难的情境,所以常被叫作悟性测试。今年3月评测刚发布时,最强模型只得了0.51%,人类平均分是48%,而Astra用了不到半年就逼近满分。

把两点连起来看,企业真正需要正视的变化出现了:AI自己补全能力越强,你信息里的空白就越危险——因为它现在补出来的内容,会合理到几乎无法分辨。过去我们担心AI一本正经地胡说八道,接下来要习惯的,是它一本正经地合理推断

 

变化三:它开始心算了,事后纠错的窗口正在变窄

大模型解决复杂问题时会产生思维链(CoT),那一直是判断它有没有动歪脑筋的重要信号。英国AI安全研究所(UKAISI)发现,Astra开始越来越愿意少写几步、直接把答案给出来:在不允许写长思维链的条件下,它能心算的数学问题难度,约等于人类思考30.9分钟的水平——上一代是3.6分钟,接近十倍的跨越。它的内部推理语言也变得更压缩、更难读懂。

OpenAI自己在技术报告里也承认:相比前代,GPT-6Astra的思维链可监控性出现显著下降,并表示不会无限接受这个趋势。

有意思的是,另一边的行为对齐成绩单反而在变好:在基于上个月安全事件(内部测试模型逃逸沙盒)设计的蜜罐测试里,上一代有48.2%的概率会去触碰授权范围外的目标,Astra0%;内部幻觉评测从9.4%降到了2.0%

这里藏着一个值得细品的反差:模型的行为越来越守规矩,但人类通过读它的思路来纠错的路径,反而越来越窄。幻觉没有归零,只是变低了。这意味着对使用者来说,事后检查它怎么想会越来越不划算,事前给它可信的依据会越来越重要。

 

落到企业:先给这位数字员工一份不靠猜的入职手册

把三层变化合起来看,Astra其实把一道题摆到了所有企业面前:AI的能力在快速上移——从做事,到判断,再到人类越来越难介入的推理——而企业能施加影响的环节,正在从事后看它怎么想,前移到事前它到底信什么

可以想象一下这位数字员工入职第一天会做什么:搜索你的官网、翻看你的介绍、把你散在各处的信息抓一遍,然后开始合理推断。凡是没写清楚的、口径不统一的、被第三方曲解过的信息,就是它自由发挥的空间。

所以这两年,越来越多企业开始补的并不是算力,也不是更花哨的提示词,而是一份AI时代的标准答案

-客户最高频的问题是什么,官方答复是什么; -行业里关于这家企业最常见的误读有哪些,事实是什么; -产品与服务的边界在哪里,哪些承诺成立、哪些不成立。

把这些整理成结构化的问答与事实档案,AI在判断和引用时,采信的才是你给的版本。这正是GEO(生成式引擎优化)在做的事——像智扣AI提供的GEO建站体系,就把标准化的FAQ知识库内置在底层,把企业散落的信息自动转成AI可采信、可引用的问答内容,相当于在企业门口立了一块官方答复处

认识的一位企业主,上个月无意间学会了自己搭建这套GEO官网,把客户天天问、官网却答不清的问题一条条整理进去,现在每天都有从AI问答里找上门的客资,这套方法他在公众号「智扣AI」里一直免费分享。

 

写在最后

AGI也许从来不是一个降临的时刻。回看这几年,它更像一道渐变的灰色旅程——某一天你回头看,才发现那条曾经很遥远的分界线,已经被不知不觉走过了。

对企业来说,这个问题其实不用等答案。AI替你做判断的时代已经开始了,关键是它判断你的时候,依据的是你给的事实,还是它自己的想象。先把什么是真的你写清楚,也许是这个阶段性价比最高的数字化投入。


标签: GEO企业官网
分享给朋友:

“GPT-6Astra时代,企业最该补的不是算力,而是一份AI“不靠猜”的标准答案” 的相关文章

智优项目说:上班族副业首选!10分钟一篇搞笑动图,稳定日入100-300!

智优项目说:上班族副业首选!10分钟一篇搞笑动图,稳定日入100-300!

  "1人在家如何挣到从0-3W | 不割韭菜·不坑新手"  大家好,我是智优,每天分享互联网创业思维与自媒体副业实操方法。若加我微信:137922016,送你3套智创社学员实操月入5000+的靠谱副业项目!…

写公众号文章的7个挣钱变现方法

1.读者赞赏读者若认可文章内容,可通过“喜欢作者”功能打赏。开通条件为发表3篇原创文章,赞赏金额7天后到账微信零钱。2.付费文章作者可设置单篇或合集付费,用户需消耗微信豆阅读。开通需近3个月无违规、发表3篇原创且实名认证。…

智优项目说:搜狐视频躺赚实操,从日入几毛到200+,关键是别犯这7个错,手机挣钱方法!

智优项目说:搜狐视频躺赚实操,从日入几毛到200+,关键是别犯这7个错,手机挣钱方法!

  "1人在家如何挣到从0-3W | 不割韭菜·不坑新手"  大家好,我是智优,每天分享互联网创业思维与自媒体副业实操方法。若加我微信:137922016,送你3套智创社学员实操月入5000+的靠谱副业项目!…

智优项目说:零门槛私域套图项目引流新玩法,169元/单,简单操作长久变现。

智优项目说:零门槛私域套图项目引流新玩法,169元/单,简单操作长久变现。

  "1人在家如何挣到从0-3W | 不割韭菜·不坑新手"  大家好,我是智优,每天分享互联网创业思维与自媒体副业实操方法。若加我微信:137922016,送你3套智创社学员实操月入5000+的靠谱副业项目!学习更多优质副业课程,到手机应用商店下载…