技术解读 · 2026-09-10

把每 token 的 KV Cache
压到 890 字节

DeepSeek-V4.1-Flash 是这条新结构线里最小的一款:552B 骨干参数的 MoE,原生多模态,支持 1M token 上下文。 它在 prefill 阶段只激活 8B 参数,decode 阶段激活 16B,把长上下文 Agent 负载的成本压力从计算一路压到了存储和带宽。

552B骨干参数
另有 196B Engram 参数
8Bprefill
每 token 激活的参数量
16Bdecode
每 token 激活的参数量
890字节 / token
全局 KV Cache,约为 V4-Flash 的 1/4
1Mtoken
支持的上下文长度
45Ttoken
多模态预训练语料规模
页面里有六个可交互的示意图,从非对称结构到成本计算器都可以自己拖着玩。所有数字都能在文末来源里找到出处,口径有疑问的地方都单独标注了。
01 · 定位

先分清两个口径,再谈省了多少

552B 说的是模型有多少参数,8B 和 16B 说的是某一阶段里有多少参数参与计算。这两个数字量级差了几十倍,混着看会得出完全不成立的结论。

DeepSeek-V4.1-Flash 在 2026 年 9 月 10 日发布,是全新结构系列里最小的一款。它是一款原生多模态的 MoE 模型,语言骨干 40 层,可以输入图片和文本,自回归输出文本。视觉部分由一个从零训练的 DeepSeek-ViT 加两层 MLP 投影器承担,多模态数据从语言模型预训练一开始就参与进来。

官方给出的参数规模是 552B。技术报告里的完整表述是「552B 骨干参数,另有 196B Engram 参数」。 中文发布稿用的 552B 与 550B 属于「总参数」的简化口径,和报告里的分项口径存在四舍五入的差别。

真正需要分清的是另外两个数字。prefill 阶段每 token 激活 8B,decode 阶段每 token 激活 16B。 这两个数字描述的是不同阶段里参与计算的参数规模,跟 552B 的总参数量没有任何换算关系。 同一个模型在不同阶段激活不同的参数量,来自它的因果编码解码结构。

这套结构的收益主要体现在输入侧。Agent 类负载的输入往往比输出大两个数量级, 而 prefill 每 token 的计算量减半,正好落在这条最粗的成本线上。

关键配置

骨干总参数552B
Engram 参数196B
prefill 每 token 激活8B
decode 每 token 激活16B
骨干层数40 (编码器 20 + 解码器 20)
MoE 专家1 共享 + 384 路由,每 token 激活 6
专家中间维度2304
注意力 Top-K512
滑窗窗口 n_win128
query 头数 / 头维度64 / 512
indexer 头数 / 头维度32 / 128
候选池上限2,048 块 × 8 位置 = 16,384
上下文长度1M
视觉编码器32 层,隐藏维 1024,patch 14
最高输入分辨率≈ 1344 × 1344
02 · Causal Encoder-Decoder

一半的层,只在输入阶段省下来

解码器的 KV 不再由自己逐层算出来,而是从编码器末层的隐状态投影得到。这样 prefill 只需要跑前一半的层。

Agent 的工作方式决定了 prefill 是高频动作。频繁的工具调用会把长上下文反复送进模型, 一旦 KV Cache 未命中,重新预填充的开销就直接落在成本上。报告把这部分称为 prefill 瓶颈。

CED 的做法参考了 YoCo 的思路并做了改造:把底部 L/2 层当作因果编码器,上面 L/2 层当作解码器。 解码器层的 KV 不从自己的隐状态 Hl 来,而是拿第 L/2 层的隐状态 HL/2 乘一组逐层独立的投影权重得到。换句话讲,上层需要的全局 KV,在编码器结束时就已经准备好了。

代价在滑窗注意力这一侧。SWA 的 KV 仍然是逐层从各自隐状态算出来的,所以解码器侧还需要一次重放。 报告给出的边界是 n_win × L/2 个 token 的额外计算,实测有效感受野远小于理论值, 于是引入了只重放最近 n_win 个 token 的有界重放策略。

两件事叠加的结果:序列长度远大于窗口时,prefill 复杂度从 O(NL) 降到约 O(NL/2), prefill 阶段每 token 激活 8B,decode 阶段激活 16B。

换个说法

把模型想成一条 40 层的流水线。传统做法里,输入要走完 40 层,输出再走一遍解码器。

CED 让第 21 层往上的 KV 直接从第 20 层的输出推导出来,于是处理输入时只需要跑前 20 层。

输出阶段仍然要跑满 20 层解码器,所以这部分没有省。

prefill 复杂度 ≈ O(NL/2) n_win = 128
交互示意 01 · CED 非对称结构
切换 prefill / decode 看不同阶段哪些层在工作,再切到「对照:无投影」看没有跨层 KV 投影时 prefill 必须跑满 40 层的情形。 8B 与 16B 取自技术报告摘要与 §4.2.1。
03 · 负载形态

几万 token 进,几百 token 出

非对称结构值不值,取决于负载长什么样。Agent 类任务的输入输出比常常在 100:1 以上。

技术报告开篇的描述是,长时间跨度的 Agent 应用让模型负载越来越偏重输入。 机器之心在报道里给了一个更具体的画面:几万 token 的上下文、工具返回、代码仓库前缀, 换回来的是几十到几百 token 的输出。

这个结构决定了成本落在哪一侧。输入 token 越多,prefill 的次数越多; 输出 token 越少,decode 的轮次越少。如果两个阶段的每 token 计算量一样,成本几乎全部由输入决定。

CED 恰好把输入侧每 token 的激活规模砍到 8B,输出侧保持在 16B。 省下来的部分正好压在占比最大的那一侧,这是非对称设计的实际意义。

反过来说,如果负载是输入输出对等的长文写作,这套结构的收益就会明显变小。 这一点在下面的组件里可以直接拖出来看。

输入与输出,两条不同的成本路径

输入 tokenprefill ,每 token 8B
输出 tokendecode ,每 token 16B
prefill 前向次数1 次(输入整体一次过)
decode 前向次数= 输出 token 数

综合技术报告开篇「workloads increasingly input-heavy」与机器之心的负载描述整理。

交互示意 02 · Agent 负载的 token 结构
拖动滑杆或切换预设,看输入输出比怎么变化。下面对比条只按每 token 的激活参数量加权, 用于展示收益方向,不含注意力计算与 KV 读取开销。
04 · KV Cache 压缩

缓存的体积已经不再是主要瓶颈

每 token 的全局 KV Cache 从 V4-Flash 的 3,514 字节降到 890 字节,相对初代 V1 缩小约 437 倍。

报告的出发点是:稀疏注意力已经把长序列的计算成本压下来了,于是持久化存储和数据搬运浮上来成了新的瓶颈。 全局 KV 常驻 HBM,受显存容量约束;需要做前缀复用的那部分持久化 KV 落在 SSD 和主机内存上; 再加上缓存迁移和加载要走的 I/O 与互联带宽。三者叠加,直接限制服务吞吐。

报告把这部分成本拆成三个相乘的维度:条目维度上,GQA 减少 KV 头数,MLA 让各头共享一个小的 latent; 序列维度上,每 m 个 token 压缩成一条记录;层维度上,让一部分层复用其他层的缓存和选择结果。 CSA2 是三个维度一起做,这也是这一代压缩幅度的来源。

精度这一侧,V4 已经对 indexer 的 Q/K 用了 FP4 量化感知训练。这一次把 QAT 扩展到 main KV Cache, 用 OCP 标准的 MXFP4(E2M1,每 16 个通道一个 E4M3 scale),在 RoPE 之后量化。 窗口注意力的 SWA KV 对量化更敏感,仍然保留 FP8。

需要提醒的是对外公布的两个倍数:缓存相关的 HBM 需求降至 1/4,SSD 需求降至 1/8。 这是缓存资源的口径,不能读成整个模型的部署显存也降到了四分之一。

三个相乘的压缩维度

条目维度GQA 减头数、MLA 共享 latent
序列维度每 m 个 token 压成一条记录
层维度跨层复用 KV 与 Top-K 索引

精度方案

main KV CacheMXFP4 (E2M1)
量化位置RoPE 之后
SWA KV CacheFP8
scale 粒度 16 个通道一个 E4M3

相比 V4 的 FP8 主 KV Cache,存储占用几乎再减半,HBM 与卸载到 SSD 时同样适用。

交互示意 03 · KV Cache 历代压缩
横轴是对数刻度,四代之间相差两个数量级。逐代倍数为 8.1×、13.7×、3.9×,V1 到 V4.1-Flash 合计约 437 倍。
05 · Compressed Sparse Attention 2

让后续索引器的搜索范围与上下文长度脱钩

跨层复用解决的是缓存存储,分层稀疏索引器解决的是索引计算。CSA2 把这两件事拆开做。

CSA2 的每个层静态分配三种模式之一。三种模式都自己算 query 和 SWA KV, 区别在于 main KV、indexer K 和 Top-K 索引从哪里来。

Full 模式自己算 main KV,从中投影出 indexer K,跑完整索引器产出新的 Top-K, 走完整条 CSA2 路径。Reindex 模式复用上游的 main KV 与 indexer K, 但用自己的 indexer Q 重新打分,所以选择可以逐层变化。Reuse 模式连打分都省了, 直接用上游算好的 Top-K,只做注意力。

层维度上的复用只解决了索引计算的次数,剩下的索引器仍然要对全部因果可见位置打分。 分层稀疏索引器把这一层也干掉:解码器的第一个 Full 层在扫描全量位置时, 顺便给每个块取块内最大分,把得分最高的那些块收集成一个共享候选池, 后面 Reindex 模式的层只在这个池子里打分。

候选池大小固定之后,后续索引器每次查询要评的位置数与上下文长度无关,从线性变成常数。 代价是最早那个 Full 层仍然要扫一遍全量范围。

这套机制是训练感知的:候选限制在训练和推理时施加方式完全一致, 所以在后训练阶段就引入,让深层索引器在自己推理时会遇到的同一个搜索域下被优化。

三种模式各自算哪些东西

Fullmain KV、indexer K、Top-K 索引全部自算
Reindex复用 main KV 与 indexer K,重算 Top-K
Reuse复用 main KV 与 Top-K,不评索引分

40 层的模式分配

编码器前 2 层纯滑窗注意力
编码器其余 18 层CSA2 m = 2 ,3 组 × 6 层
解码器 20 层CSA2 m = 1 ,5 组 × 4 层
每组结构第 1 层产出,其余 3 到 5 层复用
交互示意 04 · CSA2 稀疏注意力
06 · 架构扩展

四处配合的改动

这四项各自解决一个问题:残差流的访存、静态知识的存放、解码的吞吐、以及 KV Cache 的精度。

Single-Pass mHC

单趟残差流混合

V4 的 mHC 在相邻 Transformer 块之间维持 n 条残差流,需要三个串行 kernel 依次执行,激活内存流量是最优下界的两倍。

Single-Pass mHC 把输入混合使用的系数整体后移一个块,每个块消费上一块产出的系数,依赖链随之消失。 配套的 Mega-mHC kernel 把残差更新、输入混合、系数预测融合成一次遍历。

激活内存流量减半

Engram

条件记忆模块

把记忆从计算里解耦出来,用稀疏访问的条件记忆表承载静态知识。196B 参数均分到两个模块。

每个模块用 N-gram 阶数 {2, 3, 4},8 个哈希头,每阶嵌入维度 2048,每个头索引约 16M 条目的哈希表。 嵌入表与投影都用 FP8。两个模块放在第 1 层和第 14 层,用来平衡各训练流水阶段的显存占用。

推理时寻址完全确定,可以从主机内存后台 RDMA 预取,第一个模块的预取与第一个 Transformer 块的计算重叠。

196B 条件记忆参数

DSpark

投机解码

半自回归草稿生成加置信度调度验证。草稿器是 3 个 Transformer 块,滑窗 128 token, 一次前向并行算出 5 个草稿位置的 base logits。

轻量 Markov 头建模草稿 token 之间的依赖,置信头预测逐位置的接受概率, 调度器再结合实测的引擎吞吐曲线,为每个请求动态选择验证长度。

和 V3 的 MTP 不同,DSpark 在预训练之后单独训练,骨干冻结; 后训练阶段与骨干一起训,但不把 DSpark 目标的梯度回传给骨干。

单次前向 5 个并行草稿位

FP4 Main KV Cache

主 KV Cache 四位量化

把量化感知训练从 indexer 的 Q/K 扩展到主 KV Cache。这里 FP4 的作用是减少存储,不涉及矩阵乘加速。

格式选 OCP 标准的 MXFP4,在 RoPE 之后量化,注意力之前先反量化, 这样不需要该格式的原生矩阵乘支持,硬件兼容面更宽。

省略了 NVFP4 的第二级全局 scale。报告算过动态范围:RMSNorm 后 512 通道 KV latent 的 L2 范数上界约 22.6, 训练中观测到的最大幅值约 10,而这个格式能表示的幅值上限是 2688,余量充足。

相比 V4 的 FP8 主 KV,存储几乎再减半
07 · 部署优化

把 SWA KV 请出持久化缓存

移除之后必然产生未命中,兜底方案是一段只重放 128 个 token 的近似重建。

持久化 KV Cache 管理

V4 部署里 SWA KV 占了持久化缓存近一半容量,但它的复用只发生在会话内一个分钟级窗口里, 会话结束或进入下一轮就失效,跟持久化缓存的长留存策略并不匹配。

V4.1 的调整有两条:SWA KV 移出持久化缓存,改放各机器 10% 主机 DRAM 组成的分布式内存池, TTL 只有几分钟,过期立即回收;全局 KV 保留在持久化缓存里,保证至少 72 小时存活。

移除之后未命中变多,靠下面这条兜底策略把「灾难性失效」变成可控的降级。

全局 KV 保底 72 小时

SWA Bounded Replay

SWA 依赖逐层累积,要精确重建 L 层的 SWA KV 得重放 L × n_win 个 token,生产成本过高。

有界重放只重放最近 n_win 个 token,把 SWA 截断到这段重放片段,接受一个近似状态。 实测对回答质量的影响可以忽略。

解码器侧同样施加这一策略,让 CED 下的 prefill 能止步于编码器,整体 prefill 计算量几乎减半。 报告还提到,为了多说一层保险,后训练阶段会模拟同样的重放做训练感知适配。

重放窗口 n_win = 128

EPD 解耦与 kernel 融合

部署采用 Encoder–Prefill–Decode 解耦,视觉编码、预填充、解码三段各自独立扩缩容,并在执行上重叠。

经过内核融合,CSA2 处于 Reuse 模式的那些层在 prefill 阶段只需要 15 个 kernel, decode 阶段只需要 11 个。架构本身概念很多,落地后的 kernel 流程反而很短。

报告还提到把长效的全局 KV 存储与短效的编码器 SWA KV 在主机内存里分开管理。

prefill 15 / decode 11 个 kernel
08 · 训练

后训练没有算法创新,改动全在数据

45T token 多模态语料预训练,稀疏注意力从零开始训,没有稠密注意力预热阶段。

预训练语料
45Ttoken

文本与多模态的 token 比例约为 7 : 1。视觉编码器单独训练,对比学习阶段用了约 470 亿图文对, 自回归微调阶段接了 4B 的 MoE 语言模型训了 2360 亿 token。

序列长度
64K → 1M

从 64K 序列长度起训稀疏注意力,不经过稠密注意力预热; 到 34T token 处把序列长度扩到 1M。批大小全程固定为 1.006 亿 token。

后训练流程
SFT → RL → OPD

监督微调、强化学习、在线策略蒸馏,报告明确写了这一代没有引入算法创新, 沿用 V4 开发时的既有做法,实质变化集中在数据管线:大规模任务合成与环境构建。

推理强度
low / high / max

对应强度值 50 / 75 / 100。从 25 提到 100, 八个推理密集基准的平均 Pass@1 从 67.1% 升到 76.3%,代价是输出 token 约增加 2.5 倍。

报告自己点出的一处成本取舍
推理强度的收益是前重后轻的:60 到 80 这个区间已经能拿到接近最高档的准确率, 而最后升到 100 会把 Agent 轨迹拉长 1.6 到 1.8 倍,只换来边际改进。 报告的建议是把最高档留给最难的题目,日常 Agent 任务用中等强度更划算。
09 · 基准表现

Agent 类任务是这一代的主要提升点

相对 V4 Pro,DeepSWE v1.1 从 62.7 升到 74.2,Terminal-Bench 3.0 从 11.8 升到 30.0,Automation-Bench 从 43.2 升到 54.8,CyberGym 从 83.3 升到 88.1。

诚实的边界

这几项仍然落后

只看提升最大的四项容易得出片面结论。技术报告和报道都明确写了没有全面领先的项目,下面这些数据同样来自技术报告 Table 3。

GPQA Diamond
90.9 低于 DeepSeek-V4-Pro 92.4

也低于 Opus-5 的 93.4、GPT-5.6 Sol 的 94.1、Kimi-K3 的 92.9。这一项没有跟上 Agent 类任务的进步幅度。

技术报告 Table 3 · Pass@1
Terminal-Bench 3.0
30.0 低于 Opus-5 43.3

34.4 分的 GPT-5.6 Sol 也比它高。30.0 相对 V4 Pro 的 11.8 是大幅提升,但在这项上并未领先全部竞品。

技术报告 Table 3 · Pass@1
Terminal-Bench 4.0
31.2 低于 Opus-5 51.8

报告在结论里把这一项归为「需要专家级领域知识的科学类 Agent 任务」,并承认与巨型模型存在差距。

技术报告 Table 3 · Pass@1
Humanity's Last Exam(无工具)
36.8 低于 Opus-5 56.3

纯文本子集为 39.1。加上工具后这一项能到 63.9,说明差距主要集中在不借助外部工具的纯知识问答上。

技术报告 Table 3 · Pass@1
怎么读这张表
V4.1 Flash 在 DeepSWE v1.1、CyberGym、Automation-Bench 三项上拿到了表中最高分, 其中 DeepSWE 只以 0.2 分领先 Opus-5 的 74.0。更准确的说法是: 它在多项 Agent 测试上超过了上一代 Pro,部分成绩达到所列前沿模型中的最高水平。 视觉 Agent 类任务上它超过 Kimi-K3,但相对领先的闭源方案仍有可测量的差距。 报告中所有数值都在 Max 推理强度下测得。
10 · 定价与可用性

缓存命中与未命中,单价差 50 倍

新价格自 2026 年 9 月 10 日 12:00 生效,继续采用峰谷定价,闲时价格为高峰时段价格的一半。

DeepSeek-V4.1-Flash API 定价
时段 输入 · 缓存命中 输入 · 缓存未命中 输出
空闲时段 0.02 元 1 元 4 元
高峰时段 0.04 元 2 元 8 元

单位:人民币元 / 百万 token。高峰时段为工作日北京时间 9:00—12:00、14:00—18:00,其余时间(含周末休息日)均为空闲时段。

别把缓存单价当成全部 token 的价格
同样是 100 万输入 token,闲时缓存未命中收 1 元,命中缓存收 2 分钱,两者相差 50 倍。 不过任务总费用还要加上未命中的输入和输出,缓存命中价只是账单里的一部分。 下面这个计算器会把三部分都算进去。

怎么调用

新模型名deepseek-flash
旧模型名deepseek-v4-flashdeepseek-v4-flash-vision-exp
旧名处理暂时路由到 V4.1 Flash
V4 Pro 路由2026-09-14 12:00
配套运行环境DeepSeek Harness v0.1.5

北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前, 发往 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。

一起更新的还有这些

DeepSeek Harness 升到 v0.1.5,模型针对标准模式、程序化工具调用(PTC)模式和极简模式都做了专项训练。

使用 V4.1 Flash 时,新版 Harness 支持在保留已有 KV Cache 的情况下更新系统提示词。

官方合作伙伴腾讯 WorkBuddy、腾讯 CodeBuddy 与 OpenCode 已全量接入。

npx @deepseek-ai/dsh web
交互示意 05 · 成本计算器
默认值用的是官方发布稿与赛博禅心文中给出的假设账单:1 亿缓存命中输入 + 100 万未命中输入 + 10 万输出, 闲时 3.4 元、高峰 6.8 元,可以拿来核对计算器是否按官方单价算。
11 · 来源

每个数字的出处

页面里的架构参数、基准分数、定价都来自下面这几份材料。图像与图表全部为本站自绘,未使用报道中的截图。

一手材料

架构章节、模型配置、KV Cache 与持久化缓存、预训练设置、Table 1 与 Table 3 的基准数值均来自技术报告。

发布报道与定价

定价表、峰谷时段、模型名与路由安排、Harness 更新来自官方发布稿; KV Cache 历代数值与假设账单来自官方发布稿与赛博禅心; Agent 负载描述与部分基准解读来自机器之心。