DeepSeek V4.1 Flash 发布:API 价格下调,OpenCode Go 限时提供 4 倍用量

信息核查日期:2026-09-11。本文事实以 DeepSeek 官方更新日志、发布说明与价格页,OpenCode 官网与 Go 文档、官方 X 账号,以及 Hugging Face 模型卡为一手依据;社区讨论单独标注为「用户观点」。
DeepSeek 于 2026 年 9 月 10 日正式发布 DeepSeek V4.1 Flash。新模型是 552B 参数的多模态 MoE,采用全新的 Causal Encoder-Decoder(CED)非对称结构、CSA2 稀疏注意力与 FP4 KV Cache,官方称其在性能、费用、速度和总用时等指标上超过 V4 Pro,并计划有序下线 V4 Pro。
对开发者来说,这次更新有三点最重要:
- 模型名变更:API 新模型名为
deepseek-flash;旧名deepseek-v4-flash、deepseek-v4-flash-vision-exp已随模型下线,请求会被暂时兼容路由到 V4.1 Flash。 - V4 Pro 进入迁移阶段:北京时间 9 月 14 日 12:00 之后,
deepseek-v4-pro的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 的单价计费,直到未来的 V4.1 Pro 上线。 - 价格与并发:API 价格同步下调,并发限制从 V4 Pro 的 500 提升到 2500。
OpenCode Go 在发布首日就接入了该模型,并限时 72 小时把 V4.1 Flash 的用量限制提升到 4 倍——官网用量表上,5 小时预估请求数从 6,500 划掉后改为 26,000。用量表仍将该模型的月度额度列为 $15,应该是促销过后额度。

一个 552B 的「小」模型:非对称结构
V4.1 Flash 是 DeepSeek 全新模型结构系列中最小尺寸的模型,原生支持图像与文本输入。根据官方发布说明与 Hugging Face 模型卡,它的做法不是继续堆规模,而是重排计算路径:
- 参数量:552B 主干参数的 MoE,每层 1 个共享专家 + 384 个路由专家,每个 token 激活 6 个路由专家,支持最长 1M token 上下文。
- CED 非对称结构:整体是 40 层 Transformer,切分为 20 层因果编码器 + 20 层解码器。解码器的全局 KV Cache 不再由每个解码层自己的隐状态推导,而是从编码器最后一层的隐状态投影得到——因此每个 token 在 prefill 阶段只激活约 8B 参数,decode 阶段激活约 16B。对输入密集的 Agent 任务,这一步直接压低了成本。
- CSA2(Compressed Sparse Attention 2):每个注意力层被静态分配 Full / Reindex / Reuse 三种模式之一,跨层共享主 KV 与 indexer K,并复用 Top-K 稀疏注意力索引;解码器中的分层稀疏索引器把后续索引层限制在首个 Full 层构造的候选池内,使深层索引开销不随上下文长度增长。
- FP4 KV Cache:主 KV 采用 FP4(E2M1,每 16 通道一个 E4M3 scale)缓存,把全局 KV Cache 压到 890 字节/token,约为 DeepSeek-V4-Flash 的 1/4。
- SWA Bounded Replay:只回放最近 n win 个 token 来重建缺失的 SWA KV 状态,无需把 SWA KV 持久化到 SSD,持久化 KV 占用约为 V4-Flash 的 1/8。官方还给出了更长时间跨度的对比:相对初代模型,KV Cache 规模已缩小约 437 倍。
- 其他组件:Single-Pass mHC(改进的残差流混合 + Mega-mHC 内核)、Engram 条件记忆(196B 参数,按 token 查表稀疏访问)、DSpark 投机解码(半自回归草稿生成 + 置信度调度验证);视觉侧为自研 DeepSeek-ViT 编码器(2D-RoPE + 3×3 pixel-unshuffle 下采样)加两层 MLP 投影。
- 训练:从零开始的多模态预训练,语料 45T token,稀疏注意力在 64K 序列长度上训练,并在 34T token 处把上下文扩展到 1M;后训练沿用 SFT → RL → on-policy distillation 的标准流程,改动集中在数据管线(大规模自动化合成 Agent 任务与环境)。模型支持 1–100 的连续可调推理强度。
对 Agent 类工作负载来说,缓存压缩比跑分更实际。一个连续读取网页、分析文件、调用工具的任务会产生极长上下文,官方资料也把「降低 Agent 类任务的使用成本」直接写进了 V4.1 Flash 的卖点。
跑分:绝大多数 Agent 项目领先,但并非每一项
官方公布的基准中,与上一代旗舰重叠的部分如下:
| 基准测试 | V4.1 Flash | V4-Pro-0813 |
|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 87.9 |
| DeepSWE v1.1 | 74.2 | 62.7 |
| NL2Repo-Bench | 65.4 | 61.5 |
| CyberGym | 88.1 | 83.3 |
| HLE(无工具) | 36.8 | 42.7 |
| HLE(带工具) | 63.9 | 60.0 |
在 Agentic 与终端任务上,V4.1 Flash 对 V4 Pro 是明确的代际提升;但 HLE 无工具项上,V4.1 Flash 的 36.8 仍低于 V4 Pro 的 42.7,带上工具后才反超(63.9 对 60.0)。此处需要说明:官方更新日志中括号里的 39.1 是 HLE 纯文本子集的成绩,与完整的 36.8 不是同一项,不宜并列比较。也就是说,「全面超越」出自官方口径,读者仍应按自己的任务类型挑指标看。
其余公开数据还包括:GPQA Diamond 90.9、Codeforces 评分 3471、MathArena Apex 65.6、Terminal-Bench 3.0 为 30.0、Terminal-Bench 4.0 为 31.2、ProgramBench 20.3、Automation-Bench 54.8、Agents' Last Exam 31.8、SEC-Bench Pro 62.8、ExploitGym 15.3,以及多模态相关的 Chartography(带工具)78.9、BabyVision(带工具)89.6、ZeroBench-main(带工具)49.0。
模型以 MIT 协议开源,权重与技术报告发布在 Hugging Face 的 deepseek-ai/DeepSeek-V4.1-Flash;官方同时表示,欢迎具备大规模部署资源(2k 卡 GPU、存储集群)的团队联系合作。
开发者需要注意的迁移变化
调用方式的变更比模型本身更影响现有项目:
- 新模型名:
deepseek-flash。DeepSeek 价格页目前只列出deepseek-flash与deepseek-v4-pro两个模型名,更早的deepseek-chat/deepseek-reasoner已在 2026 年 7 月的迁移中停止作为当前模型的入口。 - 旧名兼容路由:
deepseek-v4-flash与deepseek-v4-flash-vision-exp目前仍可调用,但对应的模型已下线,请求会由 V4.1 Flash 提供服务并按 Flash 价格计费。 - V4 Pro 迁移:北京时间 2026 年 9 月 14 日 12:00 之后、V4.1 Pro 上线之前,请求
deepseek-v4-pro将被全部路由到 V4.1 Flash,并按 V4.1 Flash 价格计费。 - 规格:上下文 1M、最大输出 384K 保持不变;并发限制由 V4 Pro 的 500 提升到 2500;支持非思考与思考模式、JSON 输出、Tool Calls、Responses API、Anthropic API、对话前缀续写,图像理解仅 V4.1 Flash 支持。
- 价格(元 / 百万 tokens,自 9 月 10 日 12:00 起生效):
| 价格(元 / 百万 tokens) | deepseek-flash | deepseek-v4-pro |
|---|---|---|
| 输入(缓存命中)· 闲时 / 高峰 | 0.02 / 0.04 | 0.15 / 0.30 |
| 输入(缓存未命中)· 闲时 / 高峰 | 1 / 2 | 4.5 / 9.0 |
| 输出 · 闲时 / 高峰 | 4 / 8 | 13.5 / 27.0 |
价格与额度核查时间:2026 年 9 月 11 日。峰谷定价继续沿用,高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00,其余时间(含周末)为闲时,闲时价格为高峰的一半。实际价格与模型路由请以官方价格页和账户后台为准。
OpenCode Go:day 0 上线,限时 72 小时 4 倍用量
DeepSeek 官方发布说明称,腾讯旗下 WorkBuddy、CodeBuddy 和 OpenCode 已全量接入 V4.1 Flash。订阅制编码服务 OpenCode Go 的动作最快,其官方 X 账号的表述是:
day 0 support we've bumped it up to 4x usage for the next 72 hours. DeepSeek Flash v4.1 is now available in OpenCode Go.
对应到官网用量表,DeepSeek V4.1 Flash 一行的数字被划掉后重新写成:
- 每 5 小时预估请求数:
6,500→ 26,000 - 月度额度:
$15→ $60
OpenCode Go 的额度体系是:每个模型设定一个月度美元额度,其中 5 小时窗口 = 月度额度的 20%,周窗口 = 50%,月窗口 = 100%。按 $60 的月度额度换算,5 小时可用 $12、每周可用 $30——这也是社区里有人报告「我的周额度显示 $30」的原因。
在 Go 文档的费率表中,V4.1 Flash 的 token 单价为:闲时输入 $0.15 / 输出 $0.60,高峰输入 $0.30 / 输出 $1.20,缓存读 $0.003 / $0.006(每百万 tokens),与 DeepSeek 官方 API 的峰谷节奏一致;Go 的额度按同一套美元口径扣减。
不只是模型:Harness 与内核工具同步更新
这次发布并非只有权重。DeepSeek Harness 在 9 月 10 日更新到 v0.1.5-rc.2(预发布),其 v0.1.5 系列的变更说明中提到:DeepSeek 模型适配器新增 DeepSeek-V41-Flash(deepseek-flash),支持文本、图片以及会话历史中的系统提示词更新,新会话默认使用该模型;同时支持动态修改系统提示词而不使 KV Cache 失效(需模型显式声明支持)。实验性的 Agent Teams 包已可经 npm 安装,但不默认启用,需用户显式添加 profile。
此外,DeepSeek 开源了稀疏注意力(DSA)与采样器用的 TopK 内核 DeepSelect,官方仓库称相比原生 torch.topk 有 2–20 倍提速,该内核用于 DeepSeek V3.2、V4 与 V4.1 系列模型。
从「用最小尺寸的模型承接旗舰服务」到「把 KV Cache 压到 890 字节/token」,DeepSeek 这次的落点在生产成本而不是参数规模。在 V4.1 Pro 上线之前,V4.1 Flash 就是它对外交付的主要答案。
主要来源
一手来源:
- DeepSeek API 更新日志(2026-09-10,含全部基准数据与路由规则):https://api-docs.deepseek.com/zh-cn/updates
- DeepSeek 官方发布说明《V4.1 Flash:更强、更快、更普惠》:https://api-docs.deepseek.com/zh-cn/news/news260910
- DeepSeek 模型与价格页:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
- Hugging Face 模型卡
deepseek-ai/DeepSeek-V4.1-Flash(CED、CSA2、FP4、SWA Bounded Replay、890 字节/token、训练数据):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash - DeepSeek Harness 版本发布记录:https://github.com/deepseek-ai/deepseek-harness/releases
- DeepSeek DeepSelect 官方仓库:https://github.com/deepseek-ai/DeepSelect
- OpenCode Go 官网(含 4× usage 标记与用量表):https://opencode.ai/go
- OpenCode Go 文档(用量限制、费率、隐私与 ZDR 条款):https://opencode.ai/docs/go/
- OpenCode 官方 X 帖文(「4x usage for the next 72 hours」):https://x.com/opencode/status/2097922404861243781