最近大火的 Flash 模型对比
数据采集于 2026-09-06,Flash 系列近期更新频繁,部分模型在数周内连续发布新版本;价格、供应商状态和榜单数据变化较快,本文数据仅代表采集时点,生产接入前请以各模型页最新为准。
一、结论先行
2026 年 8 月底到 9 月初,Flash 这条产品线从"便宜小模型"变成了前沿战场:
- 9 月 2 日 Google 发布 Gemini 3.8 Flash——官方定位"最智能的 Flash 主力模型",DeepSWE v1.1 长程编程 73.7%,距 Opus 5 的 74.0% 只差 0.3 个点,价格与 3.7 持平($0.75/$3.75 每百万 token,官方公告)。
- 8 月 26 日同一天,智谱发布 GLM-5.3-Flash、阿里发布 Qwen3.8-Flash(开放权重预览版为 Qwen3.8-Flash-Next)——两家国产 Flash 挂牌输入价约 $0.075~0.16 每百万 token,约为 Gemini Flash 的 1/10~1/5。
- 7 月 31 日 DeepSeek-V4-Flash-0731 进入公测,8 月 21 日补了 Vision 实验版;第三方渠道最便宜约 $0.05 上下(随供应商与促销变化)。
一句话:长程编程 / 复杂 Agent 且预算宽裕,优先测 Gemini 3.8 Flash;编程 + Agent 追求性价比,对比 GLM-5.3-Flash 与 DeepSeek-V4-Flash;中文办公与文档任务,测 Qwen3.8-Flash。 注意这些是方向性建议,具体取舍还需看供应商质量、工具调用错误率和实测任务成本。
| 场景 | 首选方向 | OpenRouter 模型 ID |
|---|---|---|
| 长程编程 / 复杂 Agent | Gemini 3.8 Flash | google/gemini-3.8-flash |
| 编程 + Agent 高性价比 | GLM-5.3-Flash | z-ai/glm-5.3-flash |
| 纯文本低价批量文本 / Agent | DeepSeek-V4-Flash | deepseek/deepseek-v4-flash-0731 |
| 图像+文本都想要的最低成本 | DeepSeek V4 Flash Vision Exp | deepseek/deepseek-v4-flash-vision-exp |
| 中文办公、文档、长视频理解 | Qwen3.8-Flash | qwen/qwen3.8-flash |
| 少花 token 的低延迟主力 | Gemini 3.7 Flash(3.8 的效率版) | google/gemini-3.7-flash |
二、背景:为什么突然全是 Flash?
过去 6 周,Google 以 43 天连发三个版本更新 Gemini Flash:7 月 21 日 3.6 Flash → 8 月 13 日 3.7 Flash → 9 月 2 日 3.8 Flash。官方明确 3.8 建立在 3.7 之上、3.7 建立在 3.6 之上——不是代际"换代",而是同一条主线上滚动打补丁的"更新"。
同一时间,行业在 2026 年夏天集体转向"算力焦虑":OpenAI、Google、Anthropic 陆续上调价格或收紧免费额度;DeepSeek 8 月中旬实行峰谷分时计费。就在市场认定"涨价成定局"时:
- 阿里打出低价牌:Qwen3.8-Flash 国内接入价约 1 元 / 3 元每百万 token,定价处于 DeepSeek-V4-Flash 高峰价的较低档;
- 智谱提出"同样智力、约 1/40 价格":GLM-5.3-Flash 定价约为自家 GLM-5.2 的 1/10;
- 谷歌从 3.6 起把 Gemini Flash 从 3.5 时代的 $1.50/$9.00 砍半到 $0.75/$3.75,连续三代不涨价。
Flash 由此从"性价比小模型"进化成"用架构效率换成本、用算力换成功率"的前沿主力——成本竞争从"每百万 token 多少钱"转向"每块钱能完成多少任务"。
三、主角逐个看
1. Google Gemini 3.8 Flash(2026-09-02 发布)★ 本次主角

- 规格:上下文 100 万 token,最大输出 65,536;支持文本/图像/视频/文件/音频输入,文本输出;是推理模型(分 low/medium/high 档)。
- 价格:OpenRouter 挂牌 $0.75/$3.75 每百万 token(缓存读 $0.075)。这是首发优惠价,Google 官方 注明 2027 年 1 月 1 日起恢复 $1.50/$7.50。OpenRouter 上 AI Studio Flex / Vertex Flex 通道另打五折,可低至 $0.375/$1.875(适合可容忍排队/低优先级的中转)。
- 性能(官方公告 + 独立评测):
- DeepSWE v1.1(长程软件工程):73.7%,较 3.7 的 65.3% 涨 8.4 个百分点,距 Opus 5 的 74.0% 差 0.3 个点;
- Terminal-Bench 2.1:89.4%,反超 Opus 5(89.1%);
- Vals Finance Agent v2:61.4% > Opus 5 的 58.6%;Harvey 法律 Agent:10.0% > 6.7%;HLE-Verified:54.9%。
- 更难的项目仍有明显差距:Terminal-Bench 4.0 仅 19.1%(Opus 5 约 51.8%)、OSWorld 2.0 59.0%(Opus 5 约 75.4%)。结论:在部分旗舰任务上越级,但并非全面旗舰。
- 代价:"work harder"。Google 明说 3.8 会更勤奋——更多推理步、更多工具调用、更多 token。AT 初测 high 档单任务成本约 $0.58,比 3.7 的约 $0.40 高约 40%;Token 单价没涨,但"把事做完"变贵。效率优先场景官方建议继续用 3.7 Flash。
- Cyber 版:同日发布的 3.8 Flash Cyber 是网络安全专项版(走 Fairwind 计划定向开放,普通用户用不到),其专项训练反过来喂给了通用版,是 3.8 Coding/Reasoning 提升的来源之一。注意 CWE-Bench 上 Cyber 版为 47.2%,低于对比模型 GPT-5.6 Sol 的 47.8%[2],不是"超过"。
2. Google Gemini 3.7 Flash(2026-08-13 发布)
- 3.8 的直接前代,官方公告 中的介绍价同为 $0.75/$3.75、约 100 万上下文。DeepSWE 65.3%、FrontierCode 1.1 Main 43.6%。
- 在 3.8 high 档"高推理开销、输出量较大"的属性下,3.7 是少花 token 办同样事的保守选择:单任务 token 消耗低约 30%,Google 承诺继续完整支持。预算敏感、任务明确、不想为额外推理付费的可以钉在 3.7。
3. Z.ai GLM-5.3-Flash(智谱,2026-08-26 发布)

- 规格:GLM-5 系列首个原生多模态模型(文本/图像/视频输入);总参数 320B、激活 18B;混合线性 + 稀疏注意力(官方称注意力计算较 GLM-5.3 降约 3 倍、KV 缓存缩约 4.4 倍);权重已公开,具体许可证与商业使用限制以仓库 LICENSE 文件为准;原生约 100 万上下文(OpenRouter 模型页 显示 1M)。
- 价格:官方标价 $0.15/$0.50 每百万 token;OpenRouter 限时五折至 2026-09-09 16:00 UTC → $0.075/$0.25,缓存读 $0.015(促销期缓存写入免费)。国内智谱开放平台 0.8/2.8 元打五折后 0.4/1.4 元。
- 性能:Z.ai 官方博客引用的 Artificial Analysis v4.1.1 数据为 57 分、单任务约 $0.045(历史版本分,勿与当前 v4.2 直接比较;同版本下 Gemini 3.8 high 采集时约 59 分/$0.58);官方自报 DeepSWE v1.1 63.4、Toolathlon Verified 78.4、NL2Repo 56.3(三项重叠基准均领先 Qwen3.8-Flash-Next 的 58.7/73.5/48.1)、Terminal Bench 2.1 84.3——以上是厂商自报。
- OpenRouter 特点:托管供应商多达 20+ 家(Z.ai、DeepInfra、Fireworks、Baseten、SiliconFlow、Together、Cloudflare、CoreWeave、Modal 等),是四家里通道最丰富者。但不同宿主质量差异明显:Baseten 延迟约 0.5s / 164 tps,Z.ai 自营反而约 4.5s / 27 tps(自营正在打折引流);GPQA Diamond 从部分宿主的约 50% 到另一批宿主的约 90% 都有,接入前看各宿主 AutoExacto 实测分。
4. Alibaba Qwen3.8-Flash(通义千问,2026-08-26 发布)

- 规格:注意区分——Qwen3.8-Flash 是生产 API 模型,其开放权重的是架构预览版 Qwen3.8-Flash-Next(Qwen4 架构的 early preview),两者不能等同。预览版 125B 主干 + 51B n-gram 嵌入表、每 token 激活约 6B;预览版原生 262K 上下文可经 YaRN 扩到 1M,生产 API 版默认 100 万;多模态(文本/图像/视频输入)。训练成本约为 Qwen3.7-Plus 的 1/9。
- 价格:国内接入约 1 元 / 3 元每百万 token;国际 QwenCloud $0.16/$0.47;OpenRouter $0.15/$0.47、缓存读 $0.016(缓存写入需显式创建)。OpenRouter 加权实际输入价约 $0.03——因为缓存命中率约 90%+。
- 性能(厂商自报):多模态、编程、智能体多项超过 Claude Opus 4.6 与 DeepSeek-V4-Flash:SWE-bench Pro 62.5(领先 Opus 4.6 达 9.1 分)、CoWorkBench 73.9(Opus 4.6 Max 68.2)、JobBench 55.7、SWE-bench Multilingual 81.0。目前尚无独立智测分(AA 尚未收录 v4.2 结果),以上全为官方自报,投产前用自己的任务集跑一遍。
- OpenRouter 特点:目前只有 Alibaba Cloud Int. 一个供应商;吞吐偏慢(采集时约 40 t/s,复核时约 56 t/s),工具调用错误率约 5%、结构化输出错误率约 8%(随统计窗口波动)。适合中文、办公长程 Agent、图表/文档/长视频理解类任务,但单供应商风险要在生产接入前评估。
5. DeepSeek-V4-Flash-0731(2026-07-31 公测转正)+ Vision Exp(08-21)

- 规格:稀疏 MoE,284B 总参数 / 13B 激活;0731 为纯文本版(V4-Flash 正式版,架构未变、靠后训练把 Agent 能力拉高);8 月 21 日补 Vision Exp(加图像输入)。上下文 100 万级。
- 官方 API 定价(峰谷分时,USD/百万 token),见 DeepSeek 定价页:
- 非高峰:缓存命中 $0.007(输入)/ 缓存未命中 $0.22 / 输出 $0.66;
- 高峰(工作日 9:00–12:00、14:00–18:00 北京时间):缓存命中 $0.014 / 未命中 $0.44 / 输出 $1.32。
- OpenRouter 供应商价(与官方价分开看):模型页 供应商挂牌与促销差异极大——第三方最低约 $0.05/$0.16 起(采集时 Relace 曾低至 $0.045/$0.09),DeepSeek 自营通道约 $0.22/$0.66。同一模型价格能差 5 倍以上,是 OpenRouter 上最典型的"挑供应商"场景。
- 性能:OpenRouter AutoExacto 实测主流供应商 GPQA Diamond 约 88~90%、TAU-Bench Airline 约 75~81%,第一方 DeepSeek 通道领先(约 90%/81%);但个别低价宿主质量明显掉队(如 Sail Research GPQA 约 70.8%)。吞吐头部:Wafer 约 142 t/s、StreamLake 约 132、CoreWeave 约 128。
四、核心参数与价格总表
价格口径:OpenRouter 挂牌价(采集时,USD/百万 token),官方 API 与第三方促销价在正文单列。促销截止:GLM 五折 2026-09-09 16:00 UTC;Gemini 3.8 首发价 2026-12-31 截止。
| 模型 | 厂商 | 发布时间 | 上下文 | 输入模态 | OR 输入价 | OR 输出价 | 缓存读 | 权重公开 |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.8 Flash | 2026-09-02 | 1M | 文/图/视频/音频/文件 | $0.75(Flex 半价 $0.375) | $3.75(Flex $1.875) | $0.075 | 否 | |
| Gemini 3.7 Flash | 2026-08-13 | 1M | 同上 | $0.75 | $3.75 | $0.075 | 否 | |
| GLM-5.3-Flash | 智谱 | 2026-08-26 | 1M | 文/图/视频 | $0.075(限时五折,原 $0.15) | $0.25(原 $0.50) | $0.015 | 是(许可证以仓库为准) |
| Qwen3.8-Flash | 阿里 | 2026-08-26 | 1M | 文/图/视频 | $0.15(国内约 1 元) | $0.47(国内约 3 元) | $0.016 | Next 预览版公开;生产 API 不公开 |
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31 | 1M 级 | 纯文本 | $0.05~$0.44(按供应商/峰谷) | $0.16~$1.32 | 官方 $0.007 起 | 是 |
| DeepSeek-V4-Flash-Vision-Exp | DeepSeek | 2026-08-21 | 1M 级 | 文/图 | $0.22~$0.44 | $0.66~$1.32 | — | 实验版 |
记住两个关键数字:Gemini 3.8 的 $0.75/$3.75 是首发价,2027-01-01 起恢复 $1.50/$7.50;GLM 的五折只到 9 月 9 日。
五、速度与稳定性:OpenRouter 通道实测对比
数据来源:OpenRouter 模型页 P50 统计(真实流量中位数,统计窗口随页面变化);Artificial Analysis 走 Google 官方 API 的测速为补充(版本与采集时均已标注)。
| 模型 | OR 最快吞吐(宿主) | OR 最低延迟 P50(宿主) | OR 可用率 | AA 官方 API 测速 |
|---|---|---|---|---|
| Gemini 3.8 Flash | 约 202 t/s(AI Studio Priority) | 约 1.38s(Vertex Priority) | 100%(路由后 ~99.5%) | 采集时 ~334 t/s(AA,high 档,Google API;页面会更新,复核时约 281) |
| GLM-5.3-Flash | 约 164 t/s(Baseten) | 约 0.44s(Modal) | ~99%+ | 未收录 |
| Qwen3.8-Flash | 约 40~56 t/s(唯一宿主 Alibaba) | 约 1.1~2.7s | 100% | 未收录 |
| DeepSeek-V4-Flash-0731 | 约 142 t/s(Wafer) | 约 0.42s(Makora) | ~99.5% | — |
值得注意:
- Gemini 3.8 Flash 是全场最快的推理模型之一,但它是"高推理开销、输出量较高"的类型:AA 实测它在 Intelligence Index 任务上平均生成 1.4 亿 token,而全场中位数约 7900 万;high 档首 token 延迟约 10.8s 偏慢(推理更长)。快和慢要分开看:吐字极快,但思考久、说得多。
- Qwen3.8-Flash 目前单宿主、吞吐偏低,工具调用错误率约 5%——生产接入前建议先压测。
- DeepSeek / GLM 是"挑宿主"重灾区:同一模型不同供应商质量差异明显(GPQA 从约 50%~90% 都有),建议用 OpenRouter 的 AutoExacto/质量优先路由,或手动钉住实测质量高的宿主。
六、算账:比"每百万 token"更重要的"每任务成本"
2026 年夏天模型行业最大的变化是:Token 单价正在失去参考意义。
- Google 没给 3.8 Flash 涨价,但独立评测显示它单任务成本比 3.7 高约 40%——因为更勤奋(输出 token 更多、Agent 交互轮次更多);官方自己也承认 3.8 "works harder"。[2]
- GLM-5.3-Flash 在 Z.ai 引用的 AA v4.1.1 上单任务约 $0.045、57 分(同版本 Gemini 3.8 high 采集时约 $0.58/59 分)——单价便宜约 13 倍、分值只差 2 分,这就是它"性价比"口碑的来源。跨版本(vs 当前 v4.2 的 47 分)直接比无意义。
- Qwen3.8-Flash 在 OpenRouter 的加权实际输入价约 $0.03(挂牌 $0.15),全靠约 90%+ 的缓存命中率——Agent/长会话负载请一定开缓存,真实单价可差一个数量级。
七、数据口径与限制
- 本文价格优先采用 OpenRouter 模型页挂牌价,官方 API 价格单列(如 DeepSeek 峰谷定价)。
- 速度、延迟、可用率采用 OpenRouter 页面统计窗口,默认非作者本地实测;相同指标随时间与统计窗口波动。
- Artificial Analysis 数据按页面显示的指数版本记录,不跨版本直接比较(v4.1.1 的 57/59 分与 v4.2 的 47 分不可横比)。
- 厂商基准成绩标注为厂商自报;第三方成绩标注评测机构与版本。
- 促销价格、供应商状态可能随时变化,生产接入前应重新核对模型页。
- 免责声明:本文不构成对任何 OpenRouter 供应商、中转服务或 API 销售商的推荐。供应商价格、可用率、隐私政策和服务条款可能变化,生产使用前请自行核验。 另:OpenRouter 在部分网络环境下可能存在访问、延迟或丢包问题,实际体验以本地线路为准。
八、FAQs
1. OpenRouter 上最便宜的 Flash 模型是哪个? 按采集时挂牌输入价看,inclusionAI Ling 3.0 Flash(约 $0.021)和 DeepSeek-V4-Flash 第三方通道(约 $0.05 起)最低;但便宜不等于划算——同模型不同宿主质量差可达 20 个点(GPQA),选前看宿主实测分。
2. Gemini 3.8 Flash 和 GLM-5.3-Flash 怎么选? 预算宽裕、要最强长程编程/Agent 且能接受更高任务成本 → 3.8 Flash;追求极致性价比、能接受厂商自报基准下的差距 → GLM-5.3-Flash(当前五折,9 月 9 日截止)。
3. 为什么 DeepSeek-V4-Flash 不同供应商价格差这么多? 官方 API 有峰谷分时(高峰 $0.44/$1.32,非高峰 $0.22/$0.66);第三方托管各自定价与促销,可低至约 $0.05/$0.16 起。价格差异大,质量差异也大,用 AutoExacto 路由或只钉高质量宿主。
4. Qwen3.8-Flash 真的开源吗?
生产 API 版不公开权重;公开的是架构预览版 Qwen3.8-Flash-Next(Qwen4 early preview)。要本地跑就用 Next 权重,要在线 API 用 qwen3.8-flash。
5. OpenRouter 供应商速度和模型速度是一回事吗? 不是。模型速度(如 AA 测速)是理想条件上限;OpenRouter 供应商吞吐/延迟是真实流量中位数,受宿主硬件与负载影响(同一模型不同宿主吞吐可从 6 t/s 到 164 t/s)。
九、数据来源
- OpenRouter:Gemini 3.8 Flash 模型页
- Google Blog:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
- Google Blog:Introducing Gemini 3.7 Flash
- Z.ai:GLM-5.3-Flash 官方发布博客
- Qwen:Qwen3.8-Flash-Next 官方博客
- DeepSeek:API 定价页
- DeepSeek:更新日志
- OpenRouter:GLM-5.3-Flash 模型页
- OpenRouter:Qwen3.8-Flash 模型页
- OpenRouter:DeepSeek-V4-Flash-0731 模型页
- Artificial Analysis:Gemini 3.8 Flash
- 补充:钛媒体《Gemini 3.8 Flash 上线》、知乎专栏《Qwen3.8-Flash 1元/百万Tokens》、DataCamp GLM vs Qwen 对比(背景与转述参考)
本文为信息整理与横向对比,数据随版本迭代快速变化,请以上述原始来源最新页面为准。
配图:各厂商官网/官方博客首屏截图(2026-09-07 于局域网开发机截取,browserless/Chrome 1440×900),版权归各厂商。