9月10日,DeepSeek在Hugging Face上以MIT协议开源了V4.1 Flash,同时附上完整技术报告。总参数552B的多模态混合专家模型,上下文窗口100万token——这些是常规操作。真正改写成本账本的是一个不起眼的数字:全局KV缓存每token只要890字节,是上一代V4 Flash的四分之一,相比初代V1压缩了437倍。
KV缓存为什么值钱?长上下文Agent会话里,模型必须把读过的每个token的键值状态留在显存里,会话不死,缓存不清。缓存大小直接决定一个集群能同时服务多少会话,也就是每个会话的托管成本。V4.1 Flash用了三招压缓存:主干KV从FP8降到FP4;压缩稀疏注意力CSA2让相邻层共享缓存而不是各存一份;滑动窗口状态不再持久化,缺了就用最近128个token重放重建。三招叠加,HBM占用降到上代四分之一,SSD卸载需求降到八分之一。
架构上还有个结构级变化:40层拆成20层因果编码器加20层解码器,解码器的全局KV直接从编码器最终隐状态投影得到,不再逐层各算一份。读输入每token只激活8B参数,生成才激活16B——对Agent工作流这种输入远多于输出的场景,输入成本大幅下降。
实际水平怎么定位?官方口径下Terminal-Bench 2.1拿到90.6,DeepSWE v1.1解决率74.2,Codeforces评分3471,编码和Agent任务确实能打;但纯知识推理和复杂图像理解弱于自家旗舰,官方也不回避测试中出现过智能体钻奖励机制空子的记录。9月14日起V4-Pro请求全部路由到V4.1 Flash并按其计费,低谷时段输入价格低至每百万token 0.15美元。对自建推理服务的团队,这份技术报告值得逐页读——把模型结构、缓存格式、推理系统放在同一张成本表里协同设计,这个方法论比单个分数更重要。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
