当地时间9月1日,Anthropic发布新一代旗舰模型Claude Fable 5.1和Mythos 5.1。发布会没怎么提跑分,通篇讲的是编程、知识工作和长周期Agent任务。这个取舍本身就有信息量:大模型的比拼重心,正在从“谁更聪明”挪到“谁能替人干活”。
能力层面有两个细节比参数表实在。新模型可以连续数小时执行编程和研究任务,中途不需要人盯着;做完能自己验证,写完代码自己跑测试,发现某条路走不通会换路线。Agent产品过去最难的就是这里,模型不是不会干,是干错了不知道回头。这次把“自查纠错”做进模型本身,算是打在了痛点上。
价格是这次的重点。Fable 5.1在典型工作负载下的预期成本较上一代下降约25%;缓存读取价格降75%;高度Agent化的任务成本降幅最高45%。三个数字里,缓存那条对做Agent的团队最要紧。Agent任务有个天生的烧钱点:上下文要反复读取,同一份系统提示词、同一批工具定义,每轮调用都得重新过一遍。缓存价格砍掉四分之三,等于给这个赛道整体降了门槛。
还有一条对采购决策很有分量:新模型在中低推理强度下,就能达到上一代高推理强度相当甚至更好的表现。以前要开“豪华档”才干得动的活,现在经济档够用。做Agent产品的团队不用再为高阶推理模式付溢价,账单结构会好看不少。
两个型号的分工也顺带交代下。Fable 5.1主攻通用和Agent任务,Mythos 5.1侧重高难度推理,用户按需选档。云厂商玩了很多年的分层定价,模型厂商开始照方抓药。不同任务对成本和质量的敏感度差得远,一刀切的定价两头都不讨好,这个趋势往后只会更明显。
头部厂商都在往同一个方向使劲,原因不复杂:模型能力的差距在缩小,价格和工程细节成了客户用脚投票的理由。推理成本每降一轮,就有一批原来算不过账的应用被激活,从聊天机器人到代码助手再到Agent,剧本反复上演。对已经在用Claude系列API的团队,这次升级迁移成本几乎为零,接口兼容直接切换。还没用上的,新模型发布后的几周里各家集成教程和踩坑记录会集中冒出来,跟着社区走比独自摸索快。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
