Single-Pass mHC
V4 的 mHC 在相邻 Transformer 块之间维持 n 条残差流,需要三个串行 kernel 依次执行,激活内存流量是最优下界的两倍。
Single-Pass mHC 把输入混合使用的系数整体后移一个块,每个块消费上一块产出的系数,依赖链随之消失。 配套的 Mega-mHC kernel 把残差更新、输入混合、系数预测融合成一次遍历。
DeepSeek-V4.1-Flash 是这条新结构线里最小的一款:552B 骨干参数的 MoE,原生多模态,支持 1M token 上下文。 它在 prefill 阶段只激活 8B 参数,decode 阶段激活 16B,把长上下文 Agent 负载的成本压力从计算一路压到了存储和带宽。
552B 说的是模型有多少参数,8B 和 16B 说的是某一阶段里有多少参数参与计算。这两个数字量级差了几十倍,混着看会得出完全不成立的结论。
DeepSeek-V4.1-Flash 在 2026 年 9 月 10 日发布,是全新结构系列里最小的一款。它是一款原生多模态的 MoE 模型,语言骨干 40 层,可以输入图片和文本,自回归输出文本。视觉部分由一个从零训练的 DeepSeek-ViT 加两层 MLP 投影器承担,多模态数据从语言模型预训练一开始就参与进来。
官方给出的参数规模是 552B。技术报告里的完整表述是「552B 骨干参数,另有 196B Engram 参数」。 中文发布稿用的 552B 与 550B 属于「总参数」的简化口径,和报告里的分项口径存在四舍五入的差别。
真正需要分清的是另外两个数字。prefill 阶段每 token 激活 8B,decode 阶段每 token 激活 16B。 这两个数字描述的是不同阶段里参与计算的参数规模,跟 552B 的总参数量没有任何换算关系。 同一个模型在不同阶段激活不同的参数量,来自它的因果编码解码结构。
这套结构的收益主要体现在输入侧。Agent 类负载的输入往往比输出大两个数量级, 而 prefill 每 token 的计算量减半,正好落在这条最粗的成本线上。
解码器的 KV 不再由自己逐层算出来,而是从编码器末层的隐状态投影得到。这样 prefill 只需要跑前一半的层。
Agent 的工作方式决定了 prefill 是高频动作。频繁的工具调用会把长上下文反复送进模型, 一旦 KV Cache 未命中,重新预填充的开销就直接落在成本上。报告把这部分称为 prefill 瓶颈。
CED 的做法参考了 YoCo 的思路并做了改造:把底部 L/2 层当作因果编码器,上面 L/2 层当作解码器。 解码器层的 KV 不从自己的隐状态 Hl 来,而是拿第 L/2 层的隐状态 HL/2 乘一组逐层独立的投影权重得到。换句话讲,上层需要的全局 KV,在编码器结束时就已经准备好了。
代价在滑窗注意力这一侧。SWA 的 KV 仍然是逐层从各自隐状态算出来的,所以解码器侧还需要一次重放。 报告给出的边界是 n_win × L/2 个 token 的额外计算,实测有效感受野远小于理论值, 于是引入了只重放最近 n_win 个 token 的有界重放策略。
两件事叠加的结果:序列长度远大于窗口时,prefill 复杂度从 O(NL) 降到约 O(NL/2), prefill 阶段每 token 激活 8B,decode 阶段激活 16B。
把模型想成一条 40 层的流水线。传统做法里,输入要走完 40 层,输出再走一遍解码器。
CED 让第 21 层往上的 KV 直接从第 20 层的输出推导出来,于是处理输入时只需要跑前 20 层。
输出阶段仍然要跑满 20 层解码器,所以这部分没有省。
非对称结构值不值,取决于负载长什么样。Agent 类任务的输入输出比常常在 100:1 以上。
技术报告开篇的描述是,长时间跨度的 Agent 应用让模型负载越来越偏重输入。 机器之心在报道里给了一个更具体的画面:几万 token 的上下文、工具返回、代码仓库前缀, 换回来的是几十到几百 token 的输出。
这个结构决定了成本落在哪一侧。输入 token 越多,prefill 的次数越多; 输出 token 越少,decode 的轮次越少。如果两个阶段的每 token 计算量一样,成本几乎全部由输入决定。
CED 恰好把输入侧每 token 的激活规模砍到 8B,输出侧保持在 16B。 省下来的部分正好压在占比最大的那一侧,这是非对称设计的实际意义。
反过来说,如果负载是输入输出对等的长文写作,这套结构的收益就会明显变小。 这一点在下面的组件里可以直接拖出来看。
综合技术报告开篇「workloads increasingly input-heavy」与机器之心的负载描述整理。
每 token 的全局 KV Cache 从 V4-Flash 的 3,514 字节降到 890 字节,相对初代 V1 缩小约 437 倍。
报告的出发点是:稀疏注意力已经把长序列的计算成本压下来了,于是持久化存储和数据搬运浮上来成了新的瓶颈。 全局 KV 常驻 HBM,受显存容量约束;需要做前缀复用的那部分持久化 KV 落在 SSD 和主机内存上; 再加上缓存迁移和加载要走的 I/O 与互联带宽。三者叠加,直接限制服务吞吐。
报告把这部分成本拆成三个相乘的维度:条目维度上,GQA 减少 KV 头数,MLA 让各头共享一个小的 latent; 序列维度上,每 m 个 token 压缩成一条记录;层维度上,让一部分层复用其他层的缓存和选择结果。 CSA2 是三个维度一起做,这也是这一代压缩幅度的来源。
精度这一侧,V4 已经对 indexer 的 Q/K 用了 FP4 量化感知训练。这一次把 QAT 扩展到 main KV Cache, 用 OCP 标准的 MXFP4(E2M1,每 16 个通道一个 E4M3 scale),在 RoPE 之后量化。 窗口注意力的 SWA KV 对量化更敏感,仍然保留 FP8。
需要提醒的是对外公布的两个倍数:缓存相关的 HBM 需求降至 1/4,SSD 需求降至 1/8。 这是缓存资源的口径,不能读成整个模型的部署显存也降到了四分之一。
相比 V4 的 FP8 主 KV Cache,存储占用几乎再减半,HBM 与卸载到 SSD 时同样适用。
跨层复用解决的是缓存存储,分层稀疏索引器解决的是索引计算。CSA2 把这两件事拆开做。
CSA2 的每个层静态分配三种模式之一。三种模式都自己算 query 和 SWA KV, 区别在于 main KV、indexer K 和 Top-K 索引从哪里来。
Full 模式自己算 main KV,从中投影出 indexer K,跑完整索引器产出新的 Top-K, 走完整条 CSA2 路径。Reindex 模式复用上游的 main KV 与 indexer K, 但用自己的 indexer Q 重新打分,所以选择可以逐层变化。Reuse 模式连打分都省了, 直接用上游算好的 Top-K,只做注意力。
层维度上的复用只解决了索引计算的次数,剩下的索引器仍然要对全部因果可见位置打分。 分层稀疏索引器把这一层也干掉:解码器的第一个 Full 层在扫描全量位置时, 顺便给每个块取块内最大分,把得分最高的那些块收集成一个共享候选池, 后面 Reindex 模式的层只在这个池子里打分。
候选池大小固定之后,后续索引器每次查询要评的位置数与上下文长度无关,从线性变成常数。 代价是最早那个 Full 层仍然要扫一遍全量范围。
这套机制是训练感知的:候选限制在训练和推理时施加方式完全一致, 所以在后训练阶段就引入,让深层索引器在自己推理时会遇到的同一个搜索域下被优化。
这四项各自解决一个问题:残差流的访存、静态知识的存放、解码的吞吐、以及 KV Cache 的精度。
V4 的 mHC 在相邻 Transformer 块之间维持 n 条残差流,需要三个串行 kernel 依次执行,激活内存流量是最优下界的两倍。
Single-Pass mHC 把输入混合使用的系数整体后移一个块,每个块消费上一块产出的系数,依赖链随之消失。 配套的 Mega-mHC kernel 把残差更新、输入混合、系数预测融合成一次遍历。
把记忆从计算里解耦出来,用稀疏访问的条件记忆表承载静态知识。196B 参数均分到两个模块。
每个模块用 N-gram 阶数 {2, 3, 4},8 个哈希头,每阶嵌入维度 2048,每个头索引约 16M 条目的哈希表。 嵌入表与投影都用 FP8。两个模块放在第 1 层和第 14 层,用来平衡各训练流水阶段的显存占用。
推理时寻址完全确定,可以从主机内存后台 RDMA 预取,第一个模块的预取与第一个 Transformer 块的计算重叠。
半自回归草稿生成加置信度调度验证。草稿器是 3 个 Transformer 块,滑窗 128 token, 一次前向并行算出 5 个草稿位置的 base logits。
轻量 Markov 头建模草稿 token 之间的依赖,置信头预测逐位置的接受概率, 调度器再结合实测的引擎吞吐曲线,为每个请求动态选择验证长度。
和 V3 的 MTP 不同,DSpark 在预训练之后单独训练,骨干冻结; 后训练阶段与骨干一起训,但不把 DSpark 目标的梯度回传给骨干。
把量化感知训练从 indexer 的 Q/K 扩展到主 KV Cache。这里 FP4 的作用是减少存储,不涉及矩阵乘加速。
格式选 OCP 标准的 MXFP4,在 RoPE 之后量化,注意力之前先反量化, 这样不需要该格式的原生矩阵乘支持,硬件兼容面更宽。
省略了 NVFP4 的第二级全局 scale。报告算过动态范围:RMSNorm 后 512 通道 KV latent 的 L2 范数上界约 22.6, 训练中观测到的最大幅值约 10,而这个格式能表示的幅值上限是 2688,余量充足。
移除之后必然产生未命中,兜底方案是一段只重放 128 个 token 的近似重建。
V4 部署里 SWA KV 占了持久化缓存近一半容量,但它的复用只发生在会话内一个分钟级窗口里, 会话结束或进入下一轮就失效,跟持久化缓存的长留存策略并不匹配。
V4.1 的调整有两条:SWA KV 移出持久化缓存,改放各机器 10% 主机 DRAM 组成的分布式内存池, TTL 只有几分钟,过期立即回收;全局 KV 保留在持久化缓存里,保证至少 72 小时存活。
移除之后未命中变多,靠下面这条兜底策略把「灾难性失效」变成可控的降级。
SWA 依赖逐层累积,要精确重建 L 层的 SWA KV 得重放 L × n_win 个 token,生产成本过高。
有界重放只重放最近 n_win 个 token,把 SWA 截断到这段重放片段,接受一个近似状态。 实测对回答质量的影响可以忽略。
解码器侧同样施加这一策略,让 CED 下的 prefill 能止步于编码器,整体 prefill 计算量几乎减半。 报告还提到,为了多说一层保险,后训练阶段会模拟同样的重放做训练感知适配。
部署采用 Encoder–Prefill–Decode 解耦,视觉编码、预填充、解码三段各自独立扩缩容,并在执行上重叠。
经过内核融合,CSA2 处于 Reuse 模式的那些层在 prefill 阶段只需要 15 个 kernel, decode 阶段只需要 11 个。架构本身概念很多,落地后的 kernel 流程反而很短。
报告还提到把长效的全局 KV 存储与短效的编码器 SWA KV 在主机内存里分开管理。
45T token 多模态语料预训练,稀疏注意力从零开始训,没有稠密注意力预热阶段。
文本与多模态的 token 比例约为 7 : 1。视觉编码器单独训练,对比学习阶段用了约 470 亿图文对, 自回归微调阶段接了 4B 的 MoE 语言模型训了 2360 亿 token。
从 64K 序列长度起训稀疏注意力,不经过稠密注意力预热; 到 34T token 处把序列长度扩到 1M。批大小全程固定为 1.006 亿 token。
监督微调、强化学习、在线策略蒸馏,报告明确写了这一代没有引入算法创新, 沿用 V4 开发时的既有做法,实质变化集中在数据管线:大规模任务合成与环境构建。
对应强度值 50 / 75 / 100。从 25 提到 100, 八个推理密集基准的平均 Pass@1 从 67.1% 升到 76.3%,代价是输出 token 约增加 2.5 倍。
相对 V4 Pro,DeepSWE v1.1 从 62.7 升到 74.2,Terminal-Bench 3.0 从 11.8 升到 30.0,Automation-Bench 从 43.2 升到 54.8,CyberGym 从 83.3 升到 88.1。
只看提升最大的四项容易得出片面结论。技术报告和报道都明确写了没有全面领先的项目,下面这些数据同样来自技术报告 Table 3。
也低于 Opus-5 的 93.4、GPT-5.6 Sol 的 94.1、Kimi-K3 的 92.9。这一项没有跟上 Agent 类任务的进步幅度。
34.4 分的 GPT-5.6 Sol 也比它高。30.0 相对 V4 Pro 的 11.8 是大幅提升,但在这项上并未领先全部竞品。
报告在结论里把这一项归为「需要专家级领域知识的科学类 Agent 任务」,并承认与巨型模型存在差距。
纯文本子集为 39.1。加上工具后这一项能到 63.9,说明差距主要集中在不借助外部工具的纯知识问答上。
新价格自 2026 年 9 月 10 日 12:00 生效,继续采用峰谷定价,闲时价格为高峰时段价格的一半。
| 时段 | 输入 · 缓存命中 | 输入 · 缓存未命中 | 输出 |
|---|---|---|---|
| 空闲时段 | 0.02 元 | 1 元 | 4 元 |
| 高峰时段 | 0.04 元 | 2 元 | 8 元 |
单位:人民币元 / 百万 token。高峰时段为工作日北京时间 9:00—12:00、14:00—18:00,其余时间(含周末休息日)均为空闲时段。
北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前, 发往 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。
DeepSeek Harness 升到 v0.1.5,模型针对标准模式、程序化工具调用(PTC)模式和极简模式都做了专项训练。
使用 V4.1 Flash 时,新版 Harness 支持在保留已有 KV Cache 的情况下更新系统提示词。
官方合作伙伴腾讯 WorkBuddy、腾讯 CodeBuddy 与 OpenCode 已全量接入。
页面里的架构参数、基准分数、定价都来自下面这几份材料。图像与图表全部为本站自绘,未使用报道中的截图。
架构章节、模型配置、KV Cache 与持久化缓存、预训练设置、Table 1 与 Table 3 的基准数值均来自技术报告。
定价表、峰谷时段、模型名与路由安排、Harness 更新来自官方发布稿; KV Cache 历代数值与假设账单来自官方发布稿与赛博禅心; Agent 负载描述与部分基准解读来自机器之心。