最近大火的 Flash 模型对比

数据采集于 2026-09-06,Flash 系列近期更新频繁,部分模型在数周内连续发布新版本;价格、供应商状态和榜单数据变化较快,本文数据仅代表采集时点,生产接入前请以各模型页最新为准。


一、结论先行

2026 年 8 月底到 9 月初,Flash 这条产品线从"便宜小模型"变成了前沿战场:

一句话:长程编程 / 复杂 Agent 且预算宽裕,优先测 Gemini 3.8 Flash;编程 + Agent 追求性价比,对比 GLM-5.3-Flash 与 DeepSeek-V4-Flash;中文办公与文档任务,测 Qwen3.8-Flash。 注意这些是方向性建议,具体取舍还需看供应商质量、工具调用错误率和实测任务成本。

场景 首选方向 OpenRouter 模型 ID
长程编程 / 复杂 Agent Gemini 3.8 Flash google/gemini-3.8-flash
编程 + Agent 高性价比 GLM-5.3-Flash z-ai/glm-5.3-flash
纯文本低价批量文本 / Agent DeepSeek-V4-Flash deepseek/deepseek-v4-flash-0731
图像+文本都想要的最低成本 DeepSeek V4 Flash Vision Exp deepseek/deepseek-v4-flash-vision-exp
中文办公、文档、长视频理解 Qwen3.8-Flash qwen/qwen3.8-flash
少花 token 的低延迟主力 Gemini 3.7 Flash(3.8 的效率版) google/gemini-3.7-flash

二、背景:为什么突然全是 Flash?

过去 6 周,Google 以 43 天连发三个版本更新 Gemini Flash:7 月 21 日 3.6 Flash → 8 月 13 日 3.7 Flash → 9 月 2 日 3.8 Flash。官方明确 3.8 建立在 3.7 之上、3.7 建立在 3.6 之上——不是代际"换代",而是同一条主线上滚动打补丁的"更新"

同一时间,行业在 2026 年夏天集体转向"算力焦虑":OpenAI、Google、Anthropic 陆续上调价格或收紧免费额度;DeepSeek 8 月中旬实行峰谷分时计费。就在市场认定"涨价成定局"时:

Flash 由此从"性价比小模型"进化成"用架构效率换成本、用算力换成功率"的前沿主力——成本竞争从"每百万 token 多少钱"转向"每块钱能完成多少任务"。


三、主角逐个看

1. Google Gemini 3.8 Flash(2026-09-02 发布)★ 本次主角

Gemini 3.8 Flash 官方发布公告(Introducing Gemini 3.8 Flash and 3.8 Flash Cyber,blog.google)

2. Google Gemini 3.7 Flash(2026-08-13 发布)

3. Z.ai GLM-5.3-Flash(智谱,2026-08-26 发布)

GLM-5.3-Flash 官方发布博客(含 ox-alpha 登顶 OpenRouter 数据图,z.ai)

4. Alibaba Qwen3.8-Flash(通义千问,2026-08-26 发布)

Qwen3.8-Flash-Next 官方发布博客(qwen.ai)

5. DeepSeek-V4-Flash-0731(2026-07-31 公测转正)+ Vision Exp(08-21)

DeepSeek


四、核心参数与价格总表

价格口径:OpenRouter 挂牌价(采集时,USD/百万 token),官方 API 与第三方促销价在正文单列。促销截止:GLM 五折 2026-09-09 16:00 UTC;Gemini 3.8 首发价 2026-12-31 截止

模型 厂商 发布时间 上下文 输入模态 OR 输入价 OR 输出价 缓存读 权重公开
Gemini 3.8 Flash Google 2026-09-02 1M 文/图/视频/音频/文件 $0.75(Flex 半价 $0.375) $3.75(Flex $1.875) $0.075
Gemini 3.7 Flash Google 2026-08-13 1M 同上 $0.75 $3.75 $0.075
GLM-5.3-Flash 智谱 2026-08-26 1M 文/图/视频 $0.075(限时五折,原 $0.15) $0.25(原 $0.50) $0.015 是(许可证以仓库为准)
Qwen3.8-Flash 阿里 2026-08-26 1M 文/图/视频 $0.15(国内约 1 元) $0.47(国内约 3 元) $0.016 Next 预览版公开;生产 API 不公开
DeepSeek-V4-Flash-0731 DeepSeek 2026-07-31 1M 级 纯文本 $0.05~$0.44(按供应商/峰谷) $0.16~$1.32 官方 $0.007 起
DeepSeek-V4-Flash-Vision-Exp DeepSeek 2026-08-21 1M 级 文/图 $0.22~$0.44 $0.66~$1.32 实验版

记住两个关键数字:Gemini 3.8 的 $0.75/$3.75 是首发价,2027-01-01 起恢复 $1.50/$7.50;GLM 的五折只到 9 月 9 日。


五、速度与稳定性:OpenRouter 通道实测对比

数据来源:OpenRouter 模型页 P50 统计(真实流量中位数,统计窗口随页面变化);Artificial Analysis 走 Google 官方 API 的测速为补充(版本与采集时均已标注)。

模型 OR 最快吞吐(宿主) OR 最低延迟 P50(宿主) OR 可用率 AA 官方 API 测速
Gemini 3.8 Flash 约 202 t/s(AI Studio Priority) 约 1.38s(Vertex Priority) 100%(路由后 ~99.5%) 采集时 ~334 t/s(AA,high 档,Google API;页面会更新,复核时约 281)
GLM-5.3-Flash 约 164 t/s(Baseten) 约 0.44s(Modal) ~99%+ 未收录
Qwen3.8-Flash 约 40~56 t/s(唯一宿主 Alibaba) 约 1.1~2.7s 100% 未收录
DeepSeek-V4-Flash-0731 约 142 t/s(Wafer) 约 0.42s(Makora) ~99.5%

值得注意:


六、算账:比"每百万 token"更重要的"每任务成本"

2026 年夏天模型行业最大的变化是:Token 单价正在失去参考意义。


七、数据口径与限制


八、FAQs

1. OpenRouter 上最便宜的 Flash 模型是哪个? 按采集时挂牌输入价看,inclusionAI Ling 3.0 Flash(约 $0.021)和 DeepSeek-V4-Flash 第三方通道(约 $0.05 起)最低;但便宜不等于划算——同模型不同宿主质量差可达 20 个点(GPQA),选前看宿主实测分。

2. Gemini 3.8 Flash 和 GLM-5.3-Flash 怎么选? 预算宽裕、要最强长程编程/Agent 且能接受更高任务成本 → 3.8 Flash;追求极致性价比、能接受厂商自报基准下的差距 → GLM-5.3-Flash(当前五折,9 月 9 日截止)。

3. 为什么 DeepSeek-V4-Flash 不同供应商价格差这么多? 官方 API 有峰谷分时(高峰 $0.44/$1.32,非高峰 $0.22/$0.66);第三方托管各自定价与促销,可低至约 $0.05/$0.16 起。价格差异大,质量差异也大,用 AutoExacto 路由或只钉高质量宿主。

4. Qwen3.8-Flash 真的开源吗? 生产 API 版不公开权重;公开的是架构预览版 Qwen3.8-Flash-Next(Qwen4 early preview)。要本地跑就用 Next 权重,要在线 API 用 qwen3.8-flash

5. OpenRouter 供应商速度和模型速度是一回事吗? 不是。模型速度(如 AA 测速)是理想条件上限;OpenRouter 供应商吞吐/延迟是真实流量中位数,受宿主硬件与负载影响(同一模型不同宿主吞吐可从 6 t/s 到 164 t/s)。


九、数据来源

本文为信息整理与横向对比,数据随版本迭代快速变化,请以上述原始来源最新页面为准。

配图:各厂商官网/官方博客首屏截图(2026-09-07 于局域网开发机截取,browserless/Chrome 1440×900),版权归各厂商。

🚀 推荐稳定梯子
高速专线,解锁 ChatGPT / Claude 等海外服务
前往 JustMySocks