DeepSeek V4.1 Flash 发布:API 价格下调,OpenCode Go 限时提供 4 倍用量

DeepSeek V4.1 Flash 发布:API 价格下调,OpenCode Go 限时提供 4 倍用量

信息核查日期:2026-09-11。本文事实以 DeepSeek 官方更新日志、发布说明与价格页,OpenCode 官网与 Go 文档、官方 X 账号,以及 Hugging Face 模型卡为一手依据;社区讨论单独标注为「用户观点」。

DeepSeek 于 2026 年 9 月 10 日正式发布 DeepSeek V4.1 Flash。新模型是 552B 参数的多模态 MoE,采用全新的 Causal Encoder-Decoder(CED)非对称结构、CSA2 稀疏注意力与 FP4 KV Cache,官方称其在性能、费用、速度和总用时等指标上超过 V4 Pro,并计划有序下线 V4 Pro

对开发者来说,这次更新有三点最重要:

OpenCode Go 在发布首日就接入了该模型,并限时 72 小时把 V4.1 Flash 的用量限制提升到 4 倍——官网用量表上,5 小时预估请求数从 6,500 划掉后改为 26,000。用量表仍将该模型的月度额度列为 $15,应该是促销过后额度。

OpenCode Go V4.1 Flash 的用量限制提升到 4 倍

一个 552B 的「小」模型:非对称结构

V4.1 Flash 是 DeepSeek 全新模型结构系列中最小尺寸的模型,原生支持图像与文本输入。根据官方发布说明与 Hugging Face 模型卡,它的做法不是继续堆规模,而是重排计算路径:

对 Agent 类工作负载来说,缓存压缩比跑分更实际。一个连续读取网页、分析文件、调用工具的任务会产生极长上下文,官方资料也把「降低 Agent 类任务的使用成本」直接写进了 V4.1 Flash 的卖点。

跑分:绝大多数 Agent 项目领先,但并非每一项

官方公布的基准中,与上一代旗舰重叠的部分如下:

基准测试 V4.1 Flash V4-Pro-0813
Terminal-Bench 2.1 90.6 87.9
DeepSWE v1.1 74.2 62.7
NL2Repo-Bench 65.4 61.5
CyberGym 88.1 83.3
HLE(无工具) 36.8 42.7
HLE(带工具) 63.9 60.0

在 Agentic 与终端任务上,V4.1 Flash 对 V4 Pro 是明确的代际提升;但 HLE 无工具项上,V4.1 Flash 的 36.8 仍低于 V4 Pro 的 42.7,带上工具后才反超(63.9 对 60.0)。此处需要说明:官方更新日志中括号里的 39.1 是 HLE 纯文本子集的成绩,与完整的 36.8 不是同一项,不宜并列比较。也就是说,「全面超越」出自官方口径,读者仍应按自己的任务类型挑指标看。

其余公开数据还包括:GPQA Diamond 90.9、Codeforces 评分 3471、MathArena Apex 65.6、Terminal-Bench 3.0 为 30.0、Terminal-Bench 4.0 为 31.2、ProgramBench 20.3、Automation-Bench 54.8、Agents' Last Exam 31.8、SEC-Bench Pro 62.8、ExploitGym 15.3,以及多模态相关的 Chartography(带工具)78.9、BabyVision(带工具)89.6、ZeroBench-main(带工具)49.0。

模型以 MIT 协议开源,权重与技术报告发布在 Hugging Face 的 deepseek-ai/DeepSeek-V4.1-Flash;官方同时表示,欢迎具备大规模部署资源(2k 卡 GPU、存储集群)的团队联系合作。

开发者需要注意的迁移变化

调用方式的变更比模型本身更影响现有项目:

价格(元 / 百万 tokens) deepseek-flash deepseek-v4-pro
输入(缓存命中)· 闲时 / 高峰 0.02 / 0.04 0.15 / 0.30
输入(缓存未命中)· 闲时 / 高峰 1 / 2 4.5 / 9.0
输出 · 闲时 / 高峰 4 / 8 13.5 / 27.0

价格与额度核查时间:2026 年 9 月 11 日。峰谷定价继续沿用,高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00,其余时间(含周末)为闲时,闲时价格为高峰的一半。实际价格与模型路由请以官方价格页和账户后台为准。

OpenCode Go:day 0 上线,限时 72 小时 4 倍用量

DeepSeek 官方发布说明称,腾讯旗下 WorkBuddy、CodeBuddy 和 OpenCode 已全量接入 V4.1 Flash。订阅制编码服务 OpenCode Go 的动作最快,其官方 X 账号的表述是:

day 0 support we've bumped it up to 4x usage for the next 72 hours. DeepSeek Flash v4.1 is now available in OpenCode Go.

对应到官网用量表,DeepSeek V4.1 Flash 一行的数字被划掉后重新写成:

OpenCode Go 的额度体系是:每个模型设定一个月度美元额度,其中 5 小时窗口 = 月度额度的 20%,周窗口 = 50%,月窗口 = 100%。按 $60 的月度额度换算,5 小时可用 $12、每周可用 $30——这也是社区里有人报告「我的周额度显示 $30」的原因。

在 Go 文档的费率表中,V4.1 Flash 的 token 单价为:闲时输入 $0.15 / 输出 $0.60,高峰输入 $0.30 / 输出 $1.20,缓存读 $0.003 / $0.006(每百万 tokens),与 DeepSeek 官方 API 的峰谷节奏一致;Go 的额度按同一套美元口径扣减。

不只是模型:Harness 与内核工具同步更新

这次发布并非只有权重。DeepSeek Harness 在 9 月 10 日更新到 v0.1.5-rc.2(预发布),其 v0.1.5 系列的变更说明中提到:DeepSeek 模型适配器新增 DeepSeek-V41-Flash(deepseek-flash,支持文本、图片以及会话历史中的系统提示词更新,新会话默认使用该模型;同时支持动态修改系统提示词而不使 KV Cache 失效(需模型显式声明支持)。实验性的 Agent Teams 包已可经 npm 安装,但不默认启用,需用户显式添加 profile。

此外,DeepSeek 开源了稀疏注意力(DSA)与采样器用的 TopK 内核 DeepSelect,官方仓库称相比原生 torch.topk 有 2–20 倍提速,该内核用于 DeepSeek V3.2、V4 与 V4.1 系列模型。

从「用最小尺寸的模型承接旗舰服务」到「把 KV Cache 压到 890 字节/token」,DeepSeek 这次的落点在生产成本而不是参数规模。在 V4.1 Pro 上线之前,V4.1 Flash 就是它对外交付的主要答案。


主要来源

一手来源:

🚀 推荐稳定梯子
高速专线,解锁 ChatGPT / Claude 等海外服务
前往 JustMySocks