9 月 14 日,阿里云宣布 DeepSeek V4.1 Flash 正式上线千问 AI 平台,相关 API 服务与订阅方案同步开放。模型本身是 9 月 10 日发布的。一个开源模型上架到另一家厂商的平台,看起来只是渠道动作,但它说明国产模型的分发逻辑正在变化。
V4.1 Flash 是一个大规模稀疏专家模型,采用了与传统对称结构不同的架构:输入侧和输出侧按不同规模激活参数,而不是简单地各取一半。这样处理的效果是推理成本被大幅摊薄——模型多数计算集中在输出侧,而长上下文场景下最吃资源的缓存部分被显著压缩,显存和存储的压力都跟着下降。配套的是开源许可和分时段定价:开源意味着可以自己部署,分时段定价则把成本压力往低峰期引导。这两条放在一起,目标很清楚——把单位推理成本压下来。
最直接的变化在分发路径。过去开源模型的默认路径是自己在 GitHub 拉权重、自己找云厂商部署、自己处理推理优化。现在多了另一条路:模型方出模型,平台方出算力和服务,用户直接在平台上调用。对中小团队,这省掉了运维和推理优化这两块最费人的工作。竞争焦点也跟着变了。当同一批模型可以在多个平台上调用,平台的差异就不再是「有没有这个模型」,而是推理速度、并发能力、上下文长度限制以及价格策略。模型方与平台方的分工更清楚了。对开源本身,这件事是正向的。模型方不再需要为了商业化而把能力锁在自己手里,开源权重和平台服务可以并行推进——这也是这段时间国内几个开源模型动作频繁的原因。
对使用者来说,最实际的一点,是可切换的供应商多了一个。同一个模型在不同平台上跑,接口和计费不同,但模型行为一致,迁移的验证成本比换模型低得多。做成本优化时,把请求按时间段和任务类型分流,是立刻能见效的一条路。缓存命中率成了省钱的关键。这类模型缓存压缩做得好,重复前缀的复用收益就更明显;把系统提示词、长文档、知识库片段的位置固定下来,命中率上去了,账单会直接反映出来。别只看单次评测。同一个权重在不同平台的推理参数、量化精度可能不同,输出质量会有差异。上线前用自己的一批真实任务跑一次对比,比看榜单靠谱。
国产开源模型和国产平台正在形成互相导流的循环:模型借平台的算力和服务触达用户,平台靠模型的质量吸引开发者。这个循环一旦转起来,中小团队选择模型时看的就不只是榜单排名,还包括它在几个平台上跑得怎么样、约束是什么。选型时给自己留一次切换的成本,比押注某一个平台更实际。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
