大模型排行榜:2026年主流大语言模型综合能力排名
摘要: 本文基于 OpenAI、Anthropic、Google、xAI、Meta 等官方文档,以及 Artificial Analysis、Arena、BenchLM、LLM-Stats 等第三方公开榜单,整理截至 2026 年 9 月 7 日 的模型能力与 API 价格快照。涵盖 GPT-6 Astra、Claude Fable 5.1 / Opus 5、Gemini 3.8 Flash、GLM-5.3、Qwen3.8、Kimi K3、DeepSeek-V4 等最新热门模型,帮助用户按场景选择最适合的 AI 工具。

📌 阅读提示(重要):不同公开榜单在测试任务、推理档位、工具调用和模型变体上存在差异,本文不是单一"统一总榜",而是多个榜单 + 价格的数据快照。若追求某一维度(编程 / Agent / 推理 / 中文),请直接看对应分榜,并以官方价格页复核价格。
快速选择(编辑建议,非客观测评结论)
| 如果你需要 | 优先看 |
|---|---|
| 复杂 Agent / 深度任务 | Claude Fable 5.1、GPT-6 Astra(灰度)、Claude Opus 5 |
| 编程与终端操作 | GPT-5.6 Sol、Claude Opus 5、Kimi K3、DeepSeek-V4-Pro |
| 低价高吞吐 API | DeepSeek-V4-Flash、GPT-5.6 Luna、Gemini 3.8 Flash |
| 本地 / 自托管部署 | Qwen3.8-27B、GLM-5.3、Kimi K3(注意各许可证差异) |
| 中文与国产合规 | DeepSeek、Qwen、GLM、Kimi |
目录
- 数据口径与评测方法
- 2026年9月多榜单排名快照
- 前沿专有模型一览
- 各厂商详解:OpenAI / Anthropic / Google / xAI · Meta
- 国产与开放权重模型专项排名
- 开放权重模型对比与许可证
- API 价格横向对比
- 模型选型建议
- 数据来源与更新记录
数据口径与评测方法
数据口径(先读这条)
- 排名均为 2026-09-07 快照,不同榜单结果并不完全一致,请勿视为统一客观分数。
- 价格:除特别说明外,均为厂商 API 标准价,单位为 美元 / 百万 tokens;不含批量(Batch)、缓存命中、工具调用和区域差异价格。多家厂商近期调价(见下文),请以官方价格页实时为准。
- "开源"与"开放权重":本文统一用 "开放权重"(open-weight),仅指权重可下载;是否可商用取决于具体许可证(MIT / Apache 2.0 / 各厂商自定义 License),见 开放权重对比表。
评测维度与参考榜单
| 维度 | 说明 | 参考榜 |
|---|---|---|
| 通用能力 | 日常对话、知识问答 | Artificial Analysis Intelligence Index、Arena Text |
| 代码能力 | 代码生成、调试、终端操作 | Arena WebDev、Terminal-Bench、SWE-Bench(第三方) |
| 中文理解 | 中文语义、文化背景 | 国产模型专项、社区测评 |
| 数学推理 | 数学、逻辑、问题求解 | GPQA Diamond、ARC-AGI |
| 长文本 | 长文档理解、摘要 | 厂商 1M 上下文实测 |
| Agent 能力 | 自主任务、工具调用 | Arena Agent、AA Coding Agent Index |
2026年9月多榜单排名快照
各榜单第一名并不相同,这是正常现象——按需看对应分榜。
Artificial Analysis 智能指数(综合智能参考)
依据各模型官方披露 + 第三方测评的跨基准综合指数,顶部阵营(相差极小,选型看价格与速度):
| 模型 | 厂商 | 类型 | 要点 |
|---|---|---|---|
| Claude Fable 5.1 | Anthropic | 专有 | 9月1日发布,多个综合指数榜首之一 |
| GPT-6 Astra | OpenAI | 专有 | 9月3日发布,灰度中,官方宣称"新一代旗舰" |
| Claude Opus 5 | Anthropic | 专有 | 7月发布,$5/$25,长程 Agent 主力 |
| GPT-5.6 Sol | OpenAI | 专有 | 7月发布,编码 / 终端 SOTA(官方) |
| Claude Fable 5 | Anthropic | 专有 | 6月发布,$10/$50 旗舰 |
| Kimi K3 | 月之暗面 | 开放权重 | 开放权重中智能指数靠前,原生多模态 |
| GLM-5.3 | 智谱 | 开放权重 | 长周期编码强劲,支持 1M 评估 |
| Qwen3.8 (2.4T) | 阿里 | 开放权重 | 万亿级参数开放权重 |
Arena Text 榜(真人盲评偏好,Elo)
来自 Arena 文本竞技场(不同变体、置信区间):
| 位置 | 模型 | Elo(≈) |
|---|---|---|
| 前列 | Claude Fable 5 | 1507 |
| 前列 | Claude Fable 5.1 (max) | 1504 |
| 前列 | Claude Opus 5 (high) | 1493 |
| 前列 | Meta Muse Spark 1.2 (xHigh) | 1499 |
| 前列 | Gemini 3.8 Flash (high) | 1494 |
具体 Elo、置信区间与样本量以 Arena 实时榜为准:https://arena.ai/leaderboard
Arena Agent / WebDev(编码与智能体参考)
- WebDev / 编程:GPT-6 Astra、Claude Fable 5.1、Claude Opus 5、Qwen3.8 等位于前列;Kimi K3 在部分前端 / 编码分项表现突出——具体名次请以对应分榜为准(https://arena.ai/leaderboard/code/webdev)。
- Agent:AA Coding Agent Index 中 GPT-5.6 Sol(max)实现 SOTA(官方)37,Claude Opus 5 / Fable 5.1 紧随。
前沿专有模型一览
| 模型 | 厂商 | 定位 | 亮点 |
|---|---|---|---|
| Claude Fable 5.1 | Anthropic | 旗舰 | 多榜单顶部,Agent 与知识工作 |
| GPT-6 Astra | OpenAI | 旗舰(灰度) | 9/3 发布,"新一代智能" |
| Claude Opus 5 | Anthropic | 主力 | $5/$25,深度推理 + 长程 Agent |
| GPT-5.6 Sol | OpenAI | 编码主力 | 编码 / 终端 SOTA,效率高 |
| Gemini 3.8 Flash | 最新均衡 | 多模态 + 低价,迭代极快 | |
| Grok 4.6 | xAI | 实时 / 编码 | $2/$6,输出价低 |
| Claude Sonnet 5 | Anthropic | 性价比 | $2/$10,Agent 入门 |
| Muse Spark 1.3/1.2 | Meta | 专有前沿 | 新推出 Muse 系列,Elo 靠前 |
Google 当前广泛可用智能最强仍是 Gemini 3.1 Pro($2/$12,GPQA Diamond 94.3%);其 Flash 系列自 3.5→3.8 高频迭代,多模态与代码持续增强,但新一代 Pro 旗舰尚未大规模放量。
各厂商详解
OpenAI
GPT-6 Astra(9月3日发布,旗舰,灰度)
| 属性 | 详情 |
|---|---|
| 价格 | $10.00 / $50.00(输入/输出,每百万 token) |
| 上下文 | 1.05M tokens |
| 说明 | 官方定位"新一代智能、最智能对齐的模型";面向 Pro / Enterprise / Business Premium 分阶段灰度,API 可用范围以实际控制台为准 |
GPT-5.6 家族(7月9日发布;7/30 与 8/21 多次调价)
- Sol(旗舰):编码与终端 SOTA。输入 $5 / 输出 $30(8/21 起 API 与充值价下调逾 20%,以官方为准)。1M 上下文。
- Terra(均衡):日常生产力默认档。输入约 $2 / 输出约 $12(7/30 下调 20%)。
- Luna(轻量高性价比):输入约 $0.2 / 输出约 $1.2(7/30 下调 80%)。高吞吐智能编码。
官方发布页:https://openai.com/index/gpt-5-6 / GPT-6 Astra:https://openai.com/index/gpt-6-astra
Anthropic
Claude Fable 5.1(9月1日发布,旗舰)
| 属性 | 详情 |
|---|---|
| 价格 | $10.00 / $50.00 |
| 上下文 | 1M tokens |
| 说明 | 当前多个公开综合智能指数榜首之一;知识截止 2026-06;不同推理档位(高 / fallback 默认)性能与成本差异明显,困难任务建议开高、日常用低档控制成本 |
Claude Opus 5(7月24日发布,主力)
| 属性 | 详情 |
|---|---|
| 价格 | $5.00 / $25.00 |
| 上下文 | 1M tokens;最大输出 128K |
| 说明 | 相比 Opus 4.8 在深度推理与长程 Agent 上是明显提升,默认开启思考,是"前沿主力"推荐 |
Claude Sonnet 5(6月发布,性价比档)
| 属性 | 详情 |
|---|---|
| 价格 | $2.00 / $10.00(Anthropic 已取消 9 月涨价计划) |
| 上下文 | 1M tokens |
Claude Mythos 5.1(受限顶级)
与 Fable 同期,属受限访问 / 特定计划档,不对常规 API 用户开放,不宜与常规型号并列比较。
官方:https://www.anthropic.com/claude-fable-and-mythos-5-1 / 价格:https://docs.anthropic.com/en/docs/about-claude/pricing
Google Gemini
| 模型 | 输入/输出价格 | 上下文 | 说明 |
|---|---|---|---|
| Gemini 3.1 Pro | $2 / $12 | 1M | 当前智能最强 Pro,科学推理与长上下文 |
| Gemini 3.8 Flash | $0.75 / $3.75 | 1M | 最新 Flash,多模态 + 代码更强 |
| Gemini 3.7 Flash | $0.75 / $3.75 | 1M | 8/13 发布,较 3.6 更强 |
| Gemini 3.6 / 3.5 Flash | $0.75-$1.5 / $3.75-$9 | 1M | 前代迭代 |
xAI Grok 与 Meta Muse Spark
- Grok 4.6(8/12):输入 $2 / 输出 $6,500K 上下文,实时信息 + 编码,输出价低。
- Meta Muse Spark 1.3 / 1.2:Meta 新推出的专有前沿系列,Arena Text Elo 靠前(约 1492-1499);开源侧保留 Llama 4(Maverick 400B / Scout 109B,10M 上下文,注意 EU 多模态许可限制)。
国产与开放权重模型专项排名
2026 年最大变化:部分国产开放权重模型在部分榜单与任务上已接近甚至超过部分海外专有前沿,且价格显著更低、卷起价格战。以下为"能力 + 价格"综合排序(编辑判断,非统一客观分)。
| 排名 | 模型 | 厂商 | 类型 | 关键点 |
|---|---|---|---|---|
| 1 | DeepSeek-V4-Pro / Flash | 深度求索 | MIT 开放权重 | SWE-Bench 高分(第三方 ofox/vals.ai 测 96.4%),性价比之王 |
| 2 | Kimi K3 | 月之暗面 | Kimi K3 License | 2.8T/104B,原生多模态,开放权重中智能指数领先 |
| 3 | GLM-5.3 / 5.3-Flash | 智谱 | GLM-5.3 License | 753B,长周期编码;5.3-Flash 320B-A18B 原生多模态 |
| 4 | Qwen3.8 Max / Flash-Next | 阿里 | 分型号许可 | 2.4T-A95B(Max License);Flash-Next 基于 Qwen4 架构预览 |
| 5 | MiniMax M3 | MiniMax | 开放权重 | 智能体编程定位 |
| 6 | 腾讯混元 Hy4 / Hy3 | 腾讯 | 开源 | 长上下文检索 + Agent 搜索 |
各厂商要点
- 深度求索 DeepSeek:V4-Flash-0731(304B)/ V4-Pro-0813(1.7T),均 MIT,1M 上下文;价格区分高峰 / 非高峰与缓存档。
- 智谱 GLM:GLM-5.3(753B,GLM-5.3 License,1M 评估)/ GLM-5.3-Flash(320B-A18B 原生多模态,价格极低)。
- 阿里 Qwen:Qwen3.8 需按型号区分——27B 为 Apache 2.0(原生 262K,可扩至 1M);2.4T-A95B 为 Qwen3.8-Max License(对大型 / MaaS 业务有条件限制)。另有 Qwen3.8-Flash-Next(Qwen4 架构预览)。
- 月之暗面 Kimi:Kimi K3(2.8T/104B,Kimi K3 License,native 文本/图像/视频输入,1M 上下文)。
- 国产价格战(8月,36氪/智东西):Qwen3.8-Flash-Next 输入 ¥1/输出 ¥3 每百万 token、GLM-5.3-Flash、DeepSeek-V4-Flash(约 $0.14 输入)相继把入门价打到极低。
开放权重模型对比与许可证
数据来源:各官方模型卡 / Hugging Face 仓库(Wavect 2026-09-02 复核)。"开放权重"≠可无条件商用,务必核对许可证。
| 模型 | 规模(总/激活) | 上下文 | 许可证 |
|---|---|---|---|
| DeepSeek V4 Pro-0813 | 1.7T | 1M | MIT |
| DeepSeek V4 Flash-0731 | 304B | 1M | MIT |
| Qwen3.8-27B | 27B(稠密) | 262K 原生,可扩 1M | Apache 2.0 |
| Qwen3.8-2.4T-A95B | 2.4T / 95B | 1M(扩展配置) | Qwen3.8-Max License |
| Kimi K3 | 2.8T / 104B | 1M | Kimi K3 License |
| GLM-5.3 | 753B | 1M(评估) | GLM-5.3 License |
| Llama 4 Scout / Maverick | 109B/17B;400B/17B | 10M / 1M | Llama 4 Community License(含 EU 多模态开发者限制) |
| Thinking Machines "Inkling" | 975B | — | Apache 2.0(美实验室开放权重领跑) |
License 细节与部署要求:https://wavect.io/blog/open-weight-llm-comparison-2026
API 价格横向对比
价格口径:厂商 API 标准价,美元/百万 token,2026-09-07 快照;近期多家调价(OpenAI 7/30、8/21;Google 促销等),请以官方价格页实时为准。同型号高峰/非高峰、缓存、Batch 价格依厂商而异。
| 厂商 | 模型 | 定位 | 输入 | 输出 | 上下文 |
|---|---|---|---|---|---|
| OpenAI | GPT-6 Astra | 旗舰(灰度) | $10.00 | $50.00 | 1.05M |
| GPT-5.6 Sol | 编码旗舰 | $5.00 | $30.00* | 1M | |
| GPT-5.6 Terra | 均衡 | ~$2.00 | ~$12.00* | 1M | |
| GPT-5.6 Luna | 高性价比 | ~$0.20 | ~$1.20* | 1M | |
| Anthropic | Fable 5.1 | 旗舰 | $10.00 | $50.00 | 1M |
| Opus 5 | 主力 | $5.00 | $25.00 | 1M | |
| Sonnet 5 | 均衡 | $2.00 | $10.00 | 1M | |
| Gemini 3.1 Pro | 旗舰 | $2.00 | $12.00 | 1M | |
| Gemini 3.8 Flash | 最新档 | $0.75 | $3.75 | 1M | |
| xAI | Grok 4.6 | 实时/编码 | $2.00 | $6.00 | 500K |
| 智谱 | GLM-5.3 | 前沿开放权重 | $1.40 | $4.40 | 1M |
| 阿里 | Qwen3.8 Max | 前沿开放权重 | ~$2.00 | ~$6.00 | 1M |
| 月之暗面 | Kimi K3 | 开放权重天花板之一 | $3.00 | $15.00 | 1M |
| DeepSeek | V4-Pro | 高值开放权重 | $0.66* | $1.98* | 1M |
| V4-Flash | 最便宜 | ~$0.14* | ~$0.28* | 1M | |
| Meta | Muse Spark 1.2 | 专有前沿 | $1.25 | $4.25 | 1M |
* 标注为近期调价 / 非峰时价格或近似口径,具体以官方价格页为准。
成本洞察(趋势,非精确承诺):
- Claude / GPT 前沿能力约在 $5-$10 输入档;DeepSeek-V4 等开放权重以低一个数量级的价格提供接近前沿的表现(具体比例随输入/输出/缓存/时段变化)。
- GLM-5.3、Qwen3.8、Kimi K3 以 $0.6-$3 输入价进入全球智能榜前列。
- Batch 与 Prompt Caching 折扣因厂商而异,不能一概而论,请逐家核对。
模型选型建议
按场景推荐(编辑建议)
| 场景 | 推荐 |
|---|---|
| 日常对话 & 写作 | Claude Sonnet 5、GPT-5.6 Terra、DeepSeek-V4-Pro / GLM-5.3 |
| 编程 & 代码生成 | GPT-5.6 Sol、Claude Opus 5、Kimi K3、DeepSeek-V4-Pro |
| 数学 & 科学推理 | GPT-6 Astra(灰度)、Claude Opus 5、Gemini 3.1 Pro |
| 长文档 / 多模态 | Gemini 3.8 Flash、Qwen3.8(1M 上下文)、Kimi K3 |
| 智能体 & 自动化 | Claude Fable 5.1 / Opus 5、GLM-5.3(Agentic) |
| 高吞吐 & 成本敏感 | DeepSeek-V4-Flash、GPT-5.6 Luna、Gemini 3.8 Flash |
| 本地 / 自托管 | Qwen3.8-27B、GLM-5.3、Kimi K3(核对许可证) |
选型判断(2026-09)
- 闭源天花板:Claude Fable 5.1 与刚发布的 GPT-6 Astra 在智能指数上贴身;日常够用选 Opus 5 / GPT-5.6 Sol 更划算。
- 开放权重已接近前沿:GLM-5.3、Qwen3.8、Kimi K3、DeepSeek-V4 进入全球前列,本地部署 / 国产合规场景可重点考虑——但要逐型号核对许可证与商用限制。
- 价格持续下探:DeepSeek-V4-Flash、GLM-5.3-Flash、Qwen3.8-Flash-Next 相继压低入门价,纯性价比场景不必上旗舰。
- 先定路线再定型号:先确认"能否用开放权重 / 国产 API(合规、部署、成本)"→ 再定"是否要付费闭源天花板"→ 最后按速度 / 上下文 / 任务专长挑具体型号。
数据来源与更新记录
- 首次发布:2026-04-11 本次更新:2026-09-07(大模型格局与价格全面刷新)
- 价格与能力复核日期:2026-09-07;建议下月复核
主要来源(官方 + 第三方):
- OpenAI:GPT-6 Astra(https://openai.com/index/gpt-6-astra)、GPT-5.6(https://openai.com/index/gpt-5-6)
- Anthropic:Claude Fable 5.1 / Mythos 5.1(https://www.anthropic.com/claude-fable-and-mythos-5-1)、Claude 价格(https://docs.anthropic.com/en/docs/about-claude/pricing)
- Google Gemini 模型页面;xAI Grok API(https://x.ai/api)
- DeepSeek V4 发布公告(https://api-docs.deepseek.com/news/news260813)与价格文档
- 开放权重许可证对比:Wavect(https://wavect.io/blog/open-weight-llm-comparison-2026)
- 第三方榜单:Artificial Analysis、Arena(https://arena.ai/leaderboard)、BenchLM(https://benchlm.ai)、LLM-Stats(https://llm-stats.com)、ofox、Swfte、Vellum
- 国产价格报道:36氪 / 智东西(2026-08)
关键词:大模型排行榜、LLM排名、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5、Gemini 3.8、GLM-5.3、Qwen3.8、Kimi K3、DeepSeek-V4、开放权重、国产大模型、API价格