AI产业链 / L4-基础大模型 / 国产大模型 · 2026-09-10

📅 2026-09-10🏷 AI产业链 / L4-基础大模型 / 国产大模型

DeepSeek V4.1 Flash 上线:非对称架构 + KV Cache 压缩,V4-Pro 开始有序下线

事件:2026-09-10,DeepSeek 发布 V4.1 Flash —— 全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力。新 API 价格于北京时间 9/10 12:00 生效;9/14 12:00 起,deepseek-v4-pro 的请求全部路由至 V4.1 Flash 并按 Flash 单价计费,直至 V4.1 Pro 上线。

一、架构:非对称 Causal-Encoder-Decoder

  • 总量 552B 参数 MoE,输入/输出不对称:输入激活仅 8B、输出激活 16B
  • 官方称成本显著低于已知同尺寸模型;采用新的预训练方式 + 更大规模 RL 后训练
  • 官方称基准测试超越包括 DeepSeek V4 Pro 在内的一众旗舰模型;多方第三方测试亦显示 V4.1 Flash 在性能、费用、速度、总用时上全面超越 V4 Pro

二、KV Cache 压缩 —— 这一代真正的成本杠杆

维度相对上一代
HBM 需求降至 1/4
SSD 存储需求降至 1/8
相对初代模型累计KV Cache 缩小 437 倍

Agent 使用场景中缓存命中费用占比高,压缩 KV Cache 直接砍掉 Agent 类任务的最大成本项。

三、API 与生态

  • 调用名改为 deepseek-flash;V4 Flash / V4 Flash Vision Exp 已下线,旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 暂时路由到 V4.1 Flash 以兼容
  • 计价延续峰谷机制:闲时为高峰价的一半;第三方跟踪 off-peak 约 $0.15 / $0.60 每百万 input/output tokens,上下文 1M
  • 官方合作伙伴:WorkBuddy(含 CodeBuddy)与 OpenCode 已全面支持 V4.1 Flash
  • 开源:权重开放(MIT 许可),Hugging Face 可获取;国家超算互联网(SCNet)同步上线 API 服务与权重下载;官方称将与开源社区共建推理生态,并开放 2000 GPU + 存储集群级别的大规模部署洽谈

四、投资 / 产业视角

  • 单位经济性拐点:能力追平甚至反超自家 Pro、单价更低、KV Cache 小一个数量级 → Agent 长上下文场景的每任务成本被系统性下压,直接利好多 Agent 编排类应用(L5)
  • 推理侧国产算力窗口:552B 稀疏 MoE(8B/16B 激活)对显存容量与带宽的要求远低于同能力密集模型,国产推理卡的可行性边界在扩大
  • 对闭源中端模型的定价挤压:开源 + 超低价 + 高能力,继续压缩中端闭源定价带;DeepSeek 自家 Pro 被自家 Flash 取代,说明模型代际淘汰的节奏在加快
  • 存储侧的反向逻辑:KV Cache 压缩 437 倍是算法红利。若被行业普遍采纳,将部分对冲"永远缺存储"的线性外推 —— 需持续跟踪下一代模型对 HBM / SSD 的单位需求假设是否被下修

来源:DeepSeek 官方发布;第三方模型库跟踪;国家超算互联网上线报道