A5站长网8月23日消息,TechCrunch头条报道了一家伦敦AI实验室Inherent。这家公司由前谷歌DeepMind员工创立,刚刚发布了一款名为Faraday的AI智能体。它的特别之处在于:底层只用了270亿参数的Qwen 3.6小模型,却在科学论文复现任务中击败了Anthropic Claude Opus 4.8和OpenAI GPT-5.5这些前沿大模型。
这个结果的冲击力不在于分数本身,而在于它挑战了业界的默认假设——模型越大越好。过去两年,头部模型的参数规模从千亿奔向万亿,训练成本水涨船高。但Inherent证明,在特定任务上,一个专门优化的智能体架构加上合适的小模型,可能比裸跑一个巨型模型更有效。

配图来源:Pexels
Faraday瞄准的是“研究复现”这个高价值场景。科学论文复现要求模型理解论文、提取方法、重写代码、运行实验并验证结果。这不是聊天任务,而是长链条的自主执行。Inherent的做法是把任务拆成多个步骤,每个步骤调用最适合的小模型或工具,而不是让一个巨型模型从头写到尾。
这对行业有两个启示。第一,模型竞赛可能从“谁参数多”转向“谁更会搭系统”。未来的AI产品,核心竞争力不一定是自研多大的模型,而是能否把开源模型、工具链、记忆机制和评估流程组合成稳定可用的工作流。第二,中小团队的创业机会变多了。270亿参数的模型可以本地或低成本部署,不需要每年烧几十亿美元买卡。
当然,这不意味着大模型没有价值。在通用对话、跨领域推理、创意生成这些开放任务上,大模型仍然优势明显。Inherent的胜利更像是一个提醒:不是所有问题都需要用核弹打蚊子。找到合适的工具组合,比单纯堆算力更重要。
对国内开发者来说,这个消息格外有意义。Qwen 3.6是阿里开源的模型,说明中国开源模型已经被海外顶尖团队拿去做出世界级应用。与其盲目追求更大参数,不如深耕场景、打磨Agent架构,这可能是一条更务实的突围路径。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
