AI头条 2026-10-04 00:53 · 👁 5 次阅读

榜单易主的背后,是智能体算力分配的重构

9月30日,一家成立不到五个月的国内AI公司发布开源决策模型系列:38项基准测试31项超过前一任榜首模型,综合得分63.88对57.91,36局国际象棋对弈赢下35局。开源意味着这套成绩可以被第三方复测,含金量经得起核对。

榜单易主的背后,是智能体算力分配的重构

发布时点也耐人寻味:此前两周,多家厂商相继在判断环节落子,方向趋同。单看榜单,这是一次座次更替;放在产业坐标里,它标记的是一个环节的独立——判断,正在成为智能体技术栈中单独定价的一层。

智能体的竞争,正在从「谁的底座模型更强」,转向「每一个判断该花多少算力」。

从一体化到分层

过去两年,智能体的主流架构是一体化的:一个通用大模型承担理解、分类、规划与生成的全部负载。这种架构的代价在规模化运行时显现——智能体一次完整任务包含数十个判断节点,每个节点都动用完整的大模型推理,延迟与成本沿链路叠加。

一体化的好处是搭建快,坏处是算力错配:判断类请求本可以廉价完成,却按生成的价格付费。账面不明显,规模化之后差额会迅速放大。值得注意的是,分层并没有削弱大模型的位置,通用层承担的复杂推理依然不可替代;变化的是周边请求的去向。

新发布的决策模型提供了另一种切法:候选明确的判断——选工具、判是非、打等级——交给专用小模型。在其客服工单演示中,一条订单重复扣款的投诉,单次请求同时返回团队分流、响应时效、严重等级三项结论,无需先生成自然语言再解析。速度层面,中档规格一次回答三个问题平均耗时26毫秒,小规格12.2毫秒。

判断层的三个确定性,构成了它独立成层的前提:

1. 候选可枚举:答案空间在开发期就已完成定义;

2. 成本可压缩:判断环节的单次开销进入毫秒级与本地化区间;

3. 风险可设闸:概率分布输出让分流与人工授权有了量化依据。

值得注意的是研发端的信号

比模型本身更值得记录的是其研发周期:从方向确定到完成首轮验证,仅用3天。背后的自动化研发体系中,配置生成、训练启动、评测运行等机械性环节的自动化率超过95%,核心研究决策环节的AI参与度约七成。

观察这一信号的意义在于:当单版权重的领先周期越来越短,可迁移的研发体系——数据构造、评测、失败分析——开始比任何一次发布更能代表长期竞争力。更完整的表述是:研发体系的资产不在某一版权重里,而在数据有效性识别、失败样本处理、实验评估体系这些可迁移的模块里。基础模型切换时,这些模块大部分可以平移。

榜单名次会易主,体系复利不会。

这也是本篇观察想留下的判断。

判断层独立之后

概率输出是该层被低估的特性。判断模型返回的不仅是选项,还有候选项的概率分布:置信度达标则自动执行,多个候选接近则升级模型或转人工;资金、删除、权限类操作保留授权确认。这为系统设计提供了分流依据,也为风险边界保留了人工闸门。概率记录同时是审计素材——每个自动判断留下痕迹,事后复盘有据可查。

行业观察显示,两周多时间内多家厂商相继布局判断环节,方向上已形成共识。接下来的分化点在于整合效率:各层各归其位之后,谁的调度更顺、谁的候选集维护更勤,谁的产品体验就更稳。对产业观察者而言,接下来的看点是定价:当判断被单独定价,智能体的成本结构会变得像传统软件一样可拆解、可预算。

观察者手记

前阵子跟开工厂的老友聊天,他按GEO思路重做官网后,AI渠道开始有稳定询盘进来,这类方案公众号「智扣AI」里就有整理。写这篇观察时想起这段对话——大模型的热闹在台前,企业的体感变化往往从这些具体的环节开始。真正值得跟踪的不是又一份榜单,而是这套分工什么时候出现在普通企业的采购清单里。判断层的独立,大概率也会以这种方式渗进日常经营。


相关资讯