前一天还有两家模型在隔空对练,第二天凌晨,三款新模型同时上线:OpenAI的GPT-6Sol、GPT-6Luna,Anthropic的ClaudeOpus5.5。上一回两家的旗舰正面相遇,版本号还停在上一代;这一次几乎是原样重演,只是名字各跳了一截。表面看是又一场擂台赛,把三份发布说明摆在一起读,会发现它们指向同一件事——这一代模型的能力,正在被搬到三个价位上。
同一代能力,卖出三个价位
Opus5.5是Claude5.5系列的第一个模型,定位很直白:1M上下文,知识更新到2026年6月,相比上一代整体工作成本直降40%,输出速度还快了30%以上,在真实终端环境完成多步任务的基准里拿下66.4%的最高分。GPT这边的两款新模型同样奔着降成本来,比上一代同款便宜50%,其中Luna单看输入输出价格,已经低于以低价著称的DeepSeek。
这一代还顺带修了沟通的毛病:把最重要的信息放在前面,减少绕弯的术语和多余的解释——发版密度越排越高,连说话方式都在跟着使用者的反馈调。两家的说法几乎一字不差:把旗舰这一代训练方法带来的能力,下放到更快、更便宜的型号上。分工也各有侧重——Anthropic押注代码能力与审美,OpenAI押注覆盖推理、软件操作、科研的全面智能体能力。落点却是同一个:谁能用更少的钱,买到更多的智能。
账要从每个任务多少钱算起
有一个基准专门测智能体跨47种工具,去跑销售、营销、运营、客服、财务、人事这些真实业务流程。新出来的成绩单很有意思:GPT-6Sol高档推理得分33.2%,每个任务平均成本0.27美元;GPT-6Astra低档推理得分30.3%,成本却是它的3.9倍;Fable5.1加上一代Opus搭配兜底的组合得分31.4%,成本至少是它的8.9倍。
得分差出来的是个位数百分点,成本差出来的是好几倍。同代能力下放之后,用多少智能第一次变成一道能算的题。对企业来说,这类基准的价值在于把「买哪个」变成可以对表的数字,而不是跟着发布会的情绪走。当然这里也藏着反直觉的一面:非旗舰模型的智力相当一部分靠超长推理换来,单个任务的输出量会明显膨胀,一旦在高难任务上陷进去,反复尝试出不了结果,反而比旗舰更烧钱——厂商自己的提示也很直白,结果重要的活,用最高档。
分档使用,各干各的活
Anthropic的成本指南把话挑明了:日常盯着干的开发、排查、代码走查,用性价比档;结果比调用价格更重要、需要长时间无人盯着、或者性价比档连续出错的,再切旗舰。用他们自己的比喻,旗舰越来越像专家顾问,性价比档越来越像主力员工。GPT这边是清晰的三层:复杂规划用Astra,日常执行用Sol,大规模批量自动化交给Luna——每天上万次的小请求,便宜档的优势最明显。国产阵营虽没有断代式的差距,同样在按规划型和执行型分。多数公司手里的活本来就分层:规划与方案交给最强的一档,日常执行交给性价比档,量大琐碎的自动化交给最便宜的一档——三款新模型只是把这条分工摆到了明面上。
智能的贵与便宜,第一次分得这么清楚。选型的问法从「哪个最强」,换成了「这活配哪一档」。
错误率在降,读错的那份没人代改
GPT系这几年一直在压事实错误率,准确到常被当作核查工具用;这一代又把错误率优化到接近旗舰的水平——不过有个前提,推理等级要开高,轻度和中等的推理强度照样会出错。模型侧的错误率一年比一年低,是好事。但有一类错误,模型自己降不了:它读到的那份关于一家公司的介绍,还停在几年前的版本上。
模型升一代,旧资料不会跟着升版;模型答得再准,读进去是旧的,答出来就是旧的。这就是模型换代与企业信息之间那道版本时间差——模型的迭代按月算,多数企业对外的介绍按年算,甚至按「开业那年」算。更新频率差着量级,读错几乎是注定的。企业管不了哪一代模型哪天犯迷糊,管得了的是自己这一头:把站点与知识库整理成检索时靠前排的那一版,信息改一次,此后谁再来问,读到的都是新的。模型越准,喂给它的信息没跟上,就越没借口。
上个月有位做实业的朋友偶然学到GEO官网搭建办法,填入企业知识库落地,咨询线索持续变多,这套内容公众号「智扣AI」免费开放。
结语
智能的价格按季度往下走,能力按代往上铺,三档的格局已经摆在明面上。企业侧真正要做的两件事也随之清楚:一头是把活分对档,一头是把信息跟上新。前者省的是当下的钱,后者守的是被检索到时的样子。