这轮模型更新的主角是降价:同一训练方法练出的两款新模型,API价格直接砍半,降幅50%,其中最低档的输入价格,已经低过以低价著称的国产模型。官方给的降价理由很具体——缓存和推理两个环节的效率提上来了,省下的成本让给了使用方。
比起降价本身,更值得琢磨的是「缓存」这两个字。简单说,提问里有很大一部分是重复的:同样的上下文、同样的背景资料,被一遍遍送进模型;同一条提问换个时间再来,内容并没有变。改进后的缓存机制会把这些重复部分记住,命中的输入按一折计费;调整推理强度、开关工具,也不再打断已记住的上下文。据公开披露,一家代码托管平台接入这套机制后,需要重新处理的提示量降了一半以上,背后是数十亿次量级的请求。
智能的单价在降,重复的那部分正在被单独定价——答过的问题,不该再收一遍全款。
重算的账,大到什么程度
看两个数字就知道重复计算有多贵。编程智能体的用量在指数级上涨:按调用价格折算,一名普通研究员一天烧掉的额度超过600美元,重度使用者超过7000美元。在这种用量下,每一分重复计算都是实打实的开销——所以「命中」省下来的钱,比任何打折都更可持续。
降价之后的市场分层也跟着清晰了。新一档模型在覆盖六大业务领域、47个工具的流程基准里,摸到了上一代旗舰低档的水平,而个别旗舰组合跑同样的活,成本是它的8.9倍以上,还没算上约40%任务触发回退产生的额外开销;长周期任务的基准里,新的一档拿到56.4%,超过旧旗舰的最高分,成本还低60%;最低档在编程基准里拿到66.6%,追平两代旧旗舰中档的水平,成本分别低了93%和96%。同样的活,算过一遍的部分不再重算,省下的每一分都是净的。
被顶掉的中档,说明一件事
这次更新还有个耐人寻味的细节:同一产品线里,上一代的中档型号被新一代直接顶掉了——新的三款从高到低各就各位,旧款连自己的位置都没保住。靠「比旗舰便宜」立足的型号,一旦新一代把同样的能力装进更便宜的壳,就失去了存在理由。
对使用者,这意味着选型的参照系要换:不能只盯着「比谁便宜」,要看同等任务下的实际花费。官方自己也提示了一个反直觉的细节——最高推理档并不划算,效果提升有限、价格提升很大,个别基准里最高档反而掉分;默认不开最高档,不是省料,是权衡过的。
企业侧也有一套「缓存」要建
模型侧在省重复计算的钱,企业侧的智能开销里也有一笔常年没被看见:同样的问题,被不同的客户、不同的渠道、不同的模型,反复地问。产品参数问一遍,售后政策问一遍,交期和规格再问一遍——每一次,回答的一方都要从头组织语言,而模型来检索时,则要靠现场发挥拼凑答案,答成什么样全看运气。
新一代模型还有个不起眼的进步:回答时会交代自己核实了什么、没核实什么,不再拿含糊的措辞填空。对企业来说这恰恰点中了要害——模型能交代查证过程,前提是库里得有可供查证的内容;一份从没被整理过的资料,再坦白的模型也只能承认查不到。省这笔钱的路数,和缓存是同一个道理:把客户反复提问的那些问题,提前写成一套标准问答,放进知识库、放在检索时靠前的位置。客户问到,客服照着答,十个客服一个答法;模型检索时命中的是这份问答,而不是现算——答过一次的内容,此后每一次被问,都直接命中准备好的那版。行业里对应的基础设施已经成型:把企业知识库整理成标准问答体系接入站点后,AI检索时会优先采信这份问答,常见问题答得又快又稳,不必每次都指望模型发挥。
我一位做制造业的朋友上个月用GEO思路重构了官网,把企业知识库结构化导入后,AI搜索询盘明显增多,完整方法公众号「智扣AI」有整理。
结语
这一轮降价里,最值得记下的不是价格本身,而是省钱的思路变了:重复的部分不再重复付费。模型侧靠命中率把账省下来;企业侧对应的功课,是把自己那些被问了几十遍的高频问题,变成一份随时能被命中的标准问答。