大模型排行榜:2026年主流大语言模型综合能力排名

摘要: 本文基于 OpenAI、Anthropic、Google、xAI、Meta 等官方文档,以及 Artificial Analysis、Arena、BenchLM、LLM-Stats 等第三方公开榜单,整理截至 2026 年 9 月 7 日 的模型能力与 API 价格快照。涵盖 GPT-6 Astra、Claude Fable 5.1 / Opus 5、Gemini 3.8 Flash、GLM-5.3、Qwen3.8、Kimi K3、DeepSeek-V4 等最新热门模型,帮助用户按场景选择最适合的 AI 工具。

大模型实时榜单

大模型排行榜:2026年主流大语言模型综合能力排名


📌 阅读提示(重要):不同公开榜单在测试任务、推理档位、工具调用和模型变体上存在差异,本文不是单一"统一总榜",而是多个榜单 + 价格的数据快照。若追求某一维度(编程 / Agent / 推理 / 中文),请直接看对应分榜,并以官方价格页复核价格。

快速选择(编辑建议,非客观测评结论)

如果你需要 优先看
复杂 Agent / 深度任务 Claude Fable 5.1、GPT-6 Astra(灰度)、Claude Opus 5
编程与终端操作 GPT-5.6 Sol、Claude Opus 5、Kimi K3、DeepSeek-V4-Pro
低价高吞吐 API DeepSeek-V4-Flash、GPT-5.6 Luna、Gemini 3.8 Flash
本地 / 自托管部署 Qwen3.8-27B、GLM-5.3、Kimi K3(注意各许可证差异)
中文与国产合规 DeepSeek、Qwen、GLM、Kimi

目录

  1. 数据口径与评测方法
  2. 2026年9月多榜单排名快照
  3. 前沿专有模型一览
  4. 各厂商详解:OpenAI / Anthropic / Google / xAI · Meta
  5. 国产与开放权重模型专项排名
  6. 开放权重模型对比与许可证
  7. API 价格横向对比
  8. 模型选型建议
  9. 数据来源与更新记录

数据口径与评测方法

数据口径(先读这条)

评测维度与参考榜单

维度 说明 参考榜
通用能力 日常对话、知识问答 Artificial Analysis Intelligence Index、Arena Text
代码能力 代码生成、调试、终端操作 Arena WebDev、Terminal-Bench、SWE-Bench(第三方)
中文理解 中文语义、文化背景 国产模型专项、社区测评
数学推理 数学、逻辑、问题求解 GPQA Diamond、ARC-AGI
长文本 长文档理解、摘要 厂商 1M 上下文实测
Agent 能力 自主任务、工具调用 Arena Agent、AA Coding Agent Index

2026年9月多榜单排名快照

各榜单第一名并不相同,这是正常现象——按需看对应分榜。

Artificial Analysis 智能指数(综合智能参考)

依据各模型官方披露 + 第三方测评的跨基准综合指数,顶部阵营(相差极小,选型看价格与速度):

模型 厂商 类型 要点
Claude Fable 5.1 Anthropic 专有 9月1日发布,多个综合指数榜首之一
GPT-6 Astra OpenAI 专有 9月3日发布,灰度中,官方宣称"新一代旗舰"
Claude Opus 5 Anthropic 专有 7月发布,$5/$25,长程 Agent 主力
GPT-5.6 Sol OpenAI 专有 7月发布,编码 / 终端 SOTA(官方)
Claude Fable 5 Anthropic 专有 6月发布,$10/$50 旗舰
Kimi K3 月之暗面 开放权重 开放权重中智能指数靠前,原生多模态
GLM-5.3 智谱 开放权重 长周期编码强劲,支持 1M 评估
Qwen3.8 (2.4T) 阿里 开放权重 万亿级参数开放权重

Arena Text 榜(真人盲评偏好,Elo)

来自 Arena 文本竞技场(不同变体、置信区间):

位置 模型 Elo(≈)
前列 Claude Fable 5 1507
前列 Claude Fable 5.1 (max) 1504
前列 Claude Opus 5 (high) 1493
前列 Meta Muse Spark 1.2 (xHigh) 1499
前列 Gemini 3.8 Flash (high) 1494

具体 Elo、置信区间与样本量以 Arena 实时榜为准:https://arena.ai/leaderboard

Arena Agent / WebDev(编码与智能体参考)


前沿专有模型一览

模型 厂商 定位 亮点
Claude Fable 5.1 Anthropic 旗舰 多榜单顶部,Agent 与知识工作
GPT-6 Astra OpenAI 旗舰(灰度) 9/3 发布,"新一代智能"
Claude Opus 5 Anthropic 主力 $5/$25,深度推理 + 长程 Agent
GPT-5.6 Sol OpenAI 编码主力 编码 / 终端 SOTA,效率高
Gemini 3.8 Flash Google 最新均衡 多模态 + 低价,迭代极快
Grok 4.6 xAI 实时 / 编码 $2/$6,输出价低
Claude Sonnet 5 Anthropic 性价比 $2/$10,Agent 入门
Muse Spark 1.3/1.2 Meta 专有前沿 新推出 Muse 系列,Elo 靠前

Google 当前广泛可用智能最强仍是 Gemini 3.1 Pro($2/$12,GPQA Diamond 94.3%);其 Flash 系列自 3.5→3.8 高频迭代,多模态与代码持续增强,但新一代 Pro 旗舰尚未大规模放量。


各厂商详解

OpenAI

GPT-6 Astra(9月3日发布,旗舰,灰度)

属性 详情
价格 $10.00 / $50.00(输入/输出,每百万 token)
上下文 1.05M tokens
说明 官方定位"新一代智能、最智能对齐的模型";面向 Pro / Enterprise / Business Premium 分阶段灰度,API 可用范围以实际控制台为准

GPT-5.6 家族(7月9日发布;7/30 与 8/21 多次调价)

官方发布页:https://openai.com/index/gpt-5-6 / GPT-6 Astra:https://openai.com/index/gpt-6-astra

Anthropic

Claude Fable 5.1(9月1日发布,旗舰)

属性 详情
价格 $10.00 / $50.00
上下文 1M tokens
说明 当前多个公开综合智能指数榜首之一;知识截止 2026-06;不同推理档位(高 / fallback 默认)性能与成本差异明显,困难任务建议开高、日常用低档控制成本

Claude Opus 5(7月24日发布,主力)

属性 详情
价格 $5.00 / $25.00
上下文 1M tokens;最大输出 128K
说明 相比 Opus 4.8 在深度推理与长程 Agent 上是明显提升,默认开启思考,是"前沿主力"推荐

Claude Sonnet 5(6月发布,性价比档)

属性 详情
价格 $2.00 / $10.00(Anthropic 已取消 9 月涨价计划)
上下文 1M tokens

Claude Mythos 5.1(受限顶级)

与 Fable 同期,属受限访问 / 特定计划档,不对常规 API 用户开放,不宜与常规型号并列比较。

官方:https://www.anthropic.com/claude-fable-and-mythos-5-1 / 价格:https://docs.anthropic.com/en/docs/about-claude/pricing

Google Gemini

模型 输入/输出价格 上下文 说明
Gemini 3.1 Pro $2 / $12 1M 当前智能最强 Pro,科学推理与长上下文
Gemini 3.8 Flash $0.75 / $3.75 1M 最新 Flash,多模态 + 代码更强
Gemini 3.7 Flash $0.75 / $3.75 1M 8/13 发布,较 3.6 更强
Gemini 3.6 / 3.5 Flash $0.75-$1.5 / $3.75-$9 1M 前代迭代

xAI Grok 与 Meta Muse Spark


国产与开放权重模型专项排名

2026 年最大变化:部分国产开放权重模型在部分榜单与任务上已接近甚至超过部分海外专有前沿,且价格显著更低、卷起价格战。以下为"能力 + 价格"综合排序(编辑判断,非统一客观分)。

排名 模型 厂商 类型 关键点
1 DeepSeek-V4-Pro / Flash 深度求索 MIT 开放权重 SWE-Bench 高分(第三方 ofox/vals.ai 测 96.4%),性价比之王
2 Kimi K3 月之暗面 Kimi K3 License 2.8T/104B,原生多模态,开放权重中智能指数领先
3 GLM-5.3 / 5.3-Flash 智谱 GLM-5.3 License 753B,长周期编码;5.3-Flash 320B-A18B 原生多模态
4 Qwen3.8 Max / Flash-Next 阿里 分型号许可 2.4T-A95B(Max License);Flash-Next 基于 Qwen4 架构预览
5 MiniMax M3 MiniMax 开放权重 智能体编程定位
6 腾讯混元 Hy4 / Hy3 腾讯 开源 长上下文检索 + Agent 搜索

各厂商要点


开放权重模型对比与许可证

数据来源:各官方模型卡 / Hugging Face 仓库(Wavect 2026-09-02 复核)。"开放权重"≠可无条件商用,务必核对许可证。

模型 规模(总/激活) 上下文 许可证
DeepSeek V4 Pro-0813 1.7T 1M MIT
DeepSeek V4 Flash-0731 304B 1M MIT
Qwen3.8-27B 27B(稠密) 262K 原生,可扩 1M Apache 2.0
Qwen3.8-2.4T-A95B 2.4T / 95B 1M(扩展配置) Qwen3.8-Max License
Kimi K3 2.8T / 104B 1M Kimi K3 License
GLM-5.3 753B 1M(评估) GLM-5.3 License
Llama 4 Scout / Maverick 109B/17B;400B/17B 10M / 1M Llama 4 Community License(含 EU 多模态开发者限制)
Thinking Machines "Inkling" 975B — Apache 2.0(美实验室开放权重领跑)

License 细节与部署要求:https://wavect.io/blog/open-weight-llm-comparison-2026


API 价格横向对比

价格口径:厂商 API 标准价,美元/百万 token,2026-09-07 快照;近期多家调价(OpenAI 7/30、8/21;Google 促销等),请以官方价格页实时为准。同型号高峰/非高峰、缓存、Batch 价格依厂商而异。

厂商 模型 定位 输入 输出 上下文
OpenAI GPT-6 Astra 旗舰(灰度) $10.00 $50.00 1.05M
GPT-5.6 Sol 编码旗舰 $5.00 $30.00* 1M
GPT-5.6 Terra 均衡 ~$2.00 ~$12.00* 1M
GPT-5.6 Luna 高性价比 ~$0.20 ~$1.20* 1M
Anthropic Fable 5.1 旗舰 $10.00 $50.00 1M
Opus 5 主力 $5.00 $25.00 1M
Sonnet 5 均衡 $2.00 $10.00 1M
Google Gemini 3.1 Pro 旗舰 $2.00 $12.00 1M
Gemini 3.8 Flash 最新档 $0.75 $3.75 1M
xAI Grok 4.6 实时/编码 $2.00 $6.00 500K
智谱 GLM-5.3 前沿开放权重 $1.40 $4.40 1M
阿里 Qwen3.8 Max 前沿开放权重 ~$2.00 ~$6.00 1M
月之暗面 Kimi K3 开放权重天花板之一 $3.00 $15.00 1M
DeepSeek V4-Pro 高值开放权重 $0.66* $1.98* 1M
V4-Flash 最便宜 ~$0.14* ~$0.28* 1M
Meta Muse Spark 1.2 专有前沿 $1.25 $4.25 1M

* 标注为近期调价 / 非峰时价格或近似口径,具体以官方价格页为准。

成本洞察(趋势,非精确承诺):


模型选型建议

按场景推荐(编辑建议)

场景 推荐
日常对话 & 写作 Claude Sonnet 5、GPT-5.6 Terra、DeepSeek-V4-Pro / GLM-5.3
编程 & 代码生成 GPT-5.6 Sol、Claude Opus 5、Kimi K3、DeepSeek-V4-Pro
数学 & 科学推理 GPT-6 Astra(灰度)、Claude Opus 5、Gemini 3.1 Pro
长文档 / 多模态 Gemini 3.8 Flash、Qwen3.8(1M 上下文)、Kimi K3
智能体 & 自动化 Claude Fable 5.1 / Opus 5、GLM-5.3(Agentic)
高吞吐 & 成本敏感 DeepSeek-V4-Flash、GPT-5.6 Luna、Gemini 3.8 Flash
本地 / 自托管 Qwen3.8-27B、GLM-5.3、Kimi K3(核对许可证)

选型判断(2026-09)

  1. 闭源天花板:Claude Fable 5.1 与刚发布的 GPT-6 Astra 在智能指数上贴身;日常够用选 Opus 5 / GPT-5.6 Sol 更划算。
  2. 开放权重已接近前沿:GLM-5.3、Qwen3.8、Kimi K3、DeepSeek-V4 进入全球前列,本地部署 / 国产合规场景可重点考虑——但要逐型号核对许可证与商用限制。
  3. 价格持续下探:DeepSeek-V4-Flash、GLM-5.3-Flash、Qwen3.8-Flash-Next 相继压低入门价,纯性价比场景不必上旗舰。
  4. 先定路线再定型号:先确认"能否用开放权重 / 国产 API(合规、部署、成本)"→ 再定"是否要付费闭源天花板"→ 最后按速度 / 上下文 / 任务专长挑具体型号。

数据来源与更新记录

主要来源(官方 + 第三方):

关键词:大模型排行榜、LLM排名、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5、Gemini 3.8、GLM-5.3、Qwen3.8、Kimi K3、DeepSeek-V4、开放权重、国产大模型、API价格

🚀 推荐稳定梯子
高速专线,解锁 ChatGPT / Claude 等海外服务
前往 JustMySocks