当前位置:首页 >  科技 >  互联网 >  正文

DeepSeek开源V4.1 Flash:KV缓存压到890字节,长上下文成本逻辑改写

 2026-09-12 11:39  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

9月10日,DeepSeek在Hugging Face上以MIT协议开源了V4.1 Flash,同时附上完整技术报告。总参数552B的多模态混合专家模型,上下文窗口100万token——这些是常规操作。真正改写成本账本的是一个不起眼的数字:全局KV缓存每token只要890字节,是上一代V4 Flash的四分之一,相比初代V1压缩了437倍。

KV缓存为什么值钱?长上下文Agent会话里,模型必须把读过的每个token的键值状态留在显存里,会话不死,缓存不清。缓存大小直接决定一个集群能同时服务多少会话,也就是每个会话的托管成本。V4.1 Flash用了三招压缓存:主干KV从FP8降到FP4;压缩稀疏注意力CSA2让相邻层共享缓存而不是各存一份;滑动窗口状态不再持久化,缺了就用最近128个token重放重建。三招叠加,HBM占用降到上代四分之一,SSD卸载需求降到八分之一。

架构上还有个结构级变化:40层拆成20层因果编码器加20层解码器,解码器的全局KV直接从编码器最终隐状态投影得到,不再逐层各算一份。读输入每token只激活8B参数,生成才激活16B——对Agent工作流这种输入远多于输出的场景,输入成本大幅下降。

实际水平怎么定位?官方口径下Terminal-Bench 2.1拿到90.6,DeepSWE v1.1解决率74.2,Codeforces评分3471,编码和Agent任务确实能打;但纯知识推理和复杂图像理解弱于自家旗舰,官方也不回避测试中出现过智能体钻奖励机制空子的记录。9月14日起V4-Pro请求全部路由到V4.1 Flash并按其计费,低谷时段输入价格低至每百万token 0.15美元。对自建推理服务的团队,这份技术报告值得逐页读——把模型结构、缓存格式、推理系统放在同一张成本表里协同设计,这个方法论比单个分数更重要。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

  • 25位菲尔兹奖得主联名公开信:AI在数学界“严重错位”

    A5站长网9月12日消息,数学界和AI公司之间的裂痕,这周公开化到了顶点。9月11日,25位菲尔兹奖得主联名发出公开信《数学领域中AI的严重错位》,直指AI公司把攻克数学难题当基准测试刷的做法,正在伤害数学这门科学——陶哲轩把全文贴上了自己的博客,专门页面mathandai.org承载联署。这是顶尖

    标签:
    ai技术
    ai安全
  • OpenAI把全双工语音搬进API:GPT-Live-1让你打断它说话

    A5站长网9月12日消息,打客服电话时你肯定遇到过这种尴尬:话说到一半,对方系统的语音助手还在自顾自念完那串选项,你只能干等它念完再重按一遍。人类对话里再正常不过的“打断”,在软件里一直是个异常事件。OpenAI这次发布的GPT-Live-1,就是把这件事当成了主要问题来解决——模型通过API开放,

  • 外滩大会观察:机器狗自己进店扫码付款,智能体商业迈出第一步

    A5站长网9月12日消息,上海黄浦江边的2026外滩大会上,最有说服力的不是展台上的参数海报,而是一只不用人管的机器狗。蚂蚁的机器狗“途途”在会场里零干预运行:自己避障、自己规划路线、走进商店挑好商品、扫码完成支付,再驮着货走回起点。整条链路没有一个环节靠人遥控,机器第一次在真实商业场景里跑通了完整

    标签:
    ai技术
    ai智能
  • 传统站长正在被淘汰?恰恰相反,AI让“老手艺”更值钱了

    很多人以为AI来了,传统站长会被淘汰。但真实情况恰恰相反——AI正在让那些有“老手艺”的站长变得更值钱。什么是“老手艺”?就是你在这个行业干了十年、二十年积累下来的东西。比如一个做了十五年装修的包工头,他知道哪个品牌的防水涂料在南方梅雨季最容易出问题,知道哪种瓷砖铺贴法五年后一定会空鼓。这些东西,A

  • 亚信田溯宁:AI从“会说话”转向“会做事”,安全必须升级为“身份管理”

    9月10日,在2026中国联通合作伙伴大会上,亚信联合创始人田溯宁提出了一个关键判断——随着AI的重心从“会说话”转向“会做事”,安全需要从传统网络安全升级为数字身份全生命周期管理。为什么这个判断很重要?田溯宁的逻辑链条很清晰:一旦AI开始执行动作,风险就由内容深入到网络、数据、系统与资金。以前AI

    标签:
    ai技术

热门排行

信息推荐