写在前面:为什么需要一张「地图」

过去三年,AI 模型几乎每周都在换名字、加版本号、刷榜、降价、开源或闭源。大家打开社交媒体,看到的往往是:

  • 「某某模型登顶」
  • 「参数量再创新高」
  • 「开源碾压闭源 / 闭源碾压开源」
  • 一张截图里的排行榜,旁边配一句「终局已定」

这些信息并不全是假的,但它们通常缺一张地图。没有地图,很容易把「某次评测第一」理解成「全面最强」,把「参数更大」理解成「一定更聪明」,把「开源」理解成「一定落后」。

这篇文章的目标很明确:

  1. 一张行业总览地图:先知道有哪些层、哪些赛道、哪些玩家;
  2. 做一次冷静科普:从 ChatGPT 爆发讲到现在,过往从简,当下讲清结构;
  3. 建立一点对榜单的清醒感:知道榜单是什么、测什么、别被洗脑。

本文不做个人推荐,也不给「该买哪家」的决策树。重点是:把乱成一团的名字,收成一张能继续更新认知的骨架。

在这里插入图片描述


先破两个常见误解

误解一:「参数越大越好」

参数量(Parameter Count)曾经是最容易传播的指标:70B、405B、万亿级……听起来像手机里的「跑分」。

但到了 2025–2026,这个指标已经明显失效,原因至少有四条:

  1. 有效参数 ≠ 总参数

  2. 训练数据、训练方法、后训练(post-training)往往比参数量更决定体验

  3. 推理时算力(test-time compute)改变了游戏规则

  4. 产品形态在重新分配能力

一句话:参数量是成本与架构的线索,不是智商排名。

误解二:「开源一定落后闭源」

更准确的说法应拆成三层:

概念 含义 常见例子
闭源 API 模型 只能调用,看不到权重 GPT、Claude、Gemini 主流产品线
开放权重(open weights) 可下载权重,许可可能有限制 Llama、部分 Qwen、部分 Mistral
更接近「开源」的发布 权重 + 较宽松许可 + 可复现训练信息不等 DeepSeek 部分代际、部分 Apache/MIT 模型

事实是:从 2024 年底到 2026 年中,开放权重模型多次逼近甚至在局部赛道追平闭源前沿——尤其是性价比、可自托管、可二次微调、可做私有化部署这些维度。闭源仍然常在「最难任务的绝对上限、产品化工具链、安全策略与企业 SLA」上占优,但这不是「开源永远落后」的简单叙事。

更清醒的表述是:

闭源与开放权重在不同目标函数上竞争:绝对能力、成本、可控性、合规、生态。
榜单上接近,不代表产品上可互换;产品上可互换,不代表合规与运维成本相同。


一、总览地图:先把坐标系立起来

读 AI 模型,建议同时用四张「坐标系」,而不是只记名字。

1. 按「在买什么」分层

┌─────────────────────────────────────────────┐
│  应用层:Chat 产品 / IDE 插件 / Agent 产品   │
├─────────────────────────────────────────────┤
│  能力层:推理、工具调用、多模态、长上下文     │
├─────────────────────────────────────────────┤
│  模型层:底座 LLM / 专用模型 / 生成模型       │
├─────────────────────────────────────────────┤
│  基础设施:芯片、集群、推理引擎、路由与缓存   │
└─────────────────────────────────────────────┘

多数人争论的是「模型层谁第一」,真正影响体验的,往往是应用层 + 工具链 + 价格/延迟策略

2. 按「能力赛道」分图

赛道 你在问的问题 典型玩家(全球,示意)
通用对话 / 旗舰 LLM 写、聊、总结、办公、综合问答 OpenAI、Anthropic、Google、xAI、各大开放权重厂商
推理 / 深度思考 数学、科学、复杂规划 各家 reasoning / thinking 模式
代码与软件工程 Agent 改仓库、修 bug、长期编码 Anthropic、OpenAI、Google、DeepSeek、Kimi、Qwen 等
多模态理解 看图、看视频、听音频、读长文档 Gemini 系尤为强调原生多模态;各家亦跟进
图像生成 文生图、图生图、风格与可控性 Midjourney、Flux、Ideogram、各家图像模型
视频生成 文生视频、图生视频、镜头控制 Veo、Runway、Kling、Sora 等
语音 TTS / ASR / 实时对话 OpenAI、Google、ElevenLabs 等生态
嵌入与检索 搜索、RAG、语义匹配 各家 embedding 模型 + 向量库
小模型 / 端侧 本地、隐私、离线、低成本 Gemma、Phi、Qwen 小尺寸、Llama 小尺寸等

3. 按「公司角色」分图

大致可分成几类(有重叠):

  • 闭源前沿实验室:OpenAI、Anthropic、Google DeepMind、xAI
  • 开放权重推动者:Meta(Llama)、Mistral、DeepSeek、阿里(Qwen)、月之暗面(Kimi)、智谱(GLM)等
  • 云与分发平台:把别人的模型托管起来卖推理(各大云、聚合 API)
  • 垂直/工具公司:IDE Agent、搜索增强、视频剪辑工作流等——它们不一定训练最强底座,但决定用户每天摸到什么

4. 按「时间阶段」分图

阶段 大致时间 关键词
爆发期 2022 末–2023 ChatGPT、GPT-4、第一波竞品
扩容与对齐期 2023–2024 中 更长上下文、多模态、指令跟随、开源追赶
推理浪潮 2024 末–2025 o1 / R1 / thinking,测试时算力
收敛与产品化 2025–2026 前沿分差缩小;拼成本、Agent、可靠性、工具生态

斯坦福 AI Index 等公开观察也指向同一趋势:
顶尖模型在人类偏好 Arena 上的分差显著收窄,竞争重心转向成本、延迟、可靠性与垂直场景。


二、简史:从 GPT-3.5 / ChatGPT 到现在

过往不必逐代背诵,抓住「每一波真正改变大众认知的事」即可。

2022 年末–2023:对话把 AI 变成日常产品

  • ChatGPT(基于 GPT-3.5) 让「和大模型聊天」一夜成为全球习惯。
  • GPT-4(2023) 把能力上限明显抬高,同时催生了插件、浏览、代码解释器等「模型 + 工具」雏形。
  • Google、Anthropic、Meta 等加速跟进;Llama 2 等开放权重模型让「自己部署」成为开发者日常话题。
  • Midjourney、Stable Diffusion 等则在图像生成赛道同步爆发,证明「生成式 AI」不只是聊天。

这一阶段的公众叙事是:突然变聪明了,而且人人可用。

2023–2024:比谁更全能——上下文、多模态、生态

竞争主线变成:

  • 更长的上下文(从几 K 到 100K+)
  • 更好的指令跟随与拒答策略
  • 视觉输入成为标配
  • API 生态、企业版、价格战开始成形
  • 开源侧出现 Mixtral、Llama 3、Qwen2 等一波「够用且可本地」的选择

这一阶段的公众叙事是:模型在变「产品」,而不只是 Demo。

2024 末–2025:推理模型改变「聪明」的定义

以 OpenAI o1 为代表的推理模型公开后,行业共识发生偏移:

  • 不再只追求「秒回」;
  • 允许模型在内部多步思考(chain-of-thought / reasoning tokens);
  • 数学、编程竞赛、科学问答等难题分数快速上升;
  • DeepSeek-R1 等开放权重推理模型证明:这条路并非闭源专属。

几乎同一时期,Agent / 编程助手从演示走向日用:模型开始更频繁地读文件、跑命令、改仓库、调用工具。能力评测也从「答题」转向 SWE-bench 这类「修真实软件问题」。

这一阶段的公众叙事是:会想、会干活,比会聊天更值钱。

2025–2026:前沿扎堆,赛道分化,榜单更碎

到 2026 年中,一个很醒目的现象是:

  • 头部闭源模型在综合人类偏好上彼此接近
  • 「谁全面第一」越来越难回答,也越来越不重要;
  • 真正拉开差距的是:编码 Agent、原生多模态、超长上下文、价格、速度、开放权重可下载性、企业合规
  • 图像与视频生成继续高速迭代,和工作流(关键帧→图生视频→后期)绑定更紧。

这一阶段的公众叙事应调整为:

别找唯一冠军。找「关心的赛道上,谁在优化什么」。


三、主要玩家

下面按全球主流玩家做演进史式梳理。只记「家族与定位」,具体小版本号会继续变。

OpenAI:从 ChatGPT 到「通用 Agent 操作系统」

演进主线(极简):

  1. GPT-3.5 / ChatGPT → 大众入口
  2. GPT-4 / 4o → 多模态与日用体验
  3. o1 / o3 系列 → 独立推理产品线
  4. GPT-5 世代 → 把「对话能力」与「可调节推理」逐步统一进同一产品家族
  5. 2026 年前后的旗舰代际(如公开讨论中的 GPT-5.x 系列)→ 更强调工具面、Agent、分层价位(旗舰 / 主力 / 高吞吐)

看 OpenAI,关键不只看「最强一档」,而要看:

  • 同一家族里是否有清晰的能力/价格阶梯;
  • Responses / 工具调用 / 代码执行 / 计算机使用等运行时能力
  • ChatGPT 消费端与 API 企业端是否同一套语义。

OpenAI 长期优势往往在:生态广度、默认心智占有率、把新能力产品化的速度。它不一定在每一个细分榜单永远第一,但很难被忽视。

Anthropic:从「更稳的对话」到「编码与严肃工作」

Claude 系列常见分层逻辑是:

  • Opus:最强档,偏向难推理、难编码、长程任务
  • Sonnet:主力工作马,平衡质量与成本
  • Haiku:轻量高吞吐

演进上,Anthropic 早期以写作质量、拒答与安全风格被记住;2025 前后则在软件工程 Agent叙事上非常突出——模型能力与「能在终端里干活的产品形态」绑定。

到 2026 年,外界讨论里还出现了更多品牌名(例如公开评测中常见的 Fable / Mythos 等代际称呼)。对读者更重要的是:

Anthropic 经常提醒一件事:目录上的「旗舰名」不一定等于「该默认调用的模型」。定价、数据保留策略、安全路由、实际评测,都会让「名义最强」和「实用最强」分开。

Google DeepMind:原生多模态与长上下文的强势叙事

Gemini 系列的演进关键词通常是:

  • 与搜索、Workspace、Android、云(Vertex)深度绑定;
  • 原生多模态(文本 / 图像 / 音频 / 视频同请求处理)作为差异化;
  • 长上下文(百万 token 量级成为卖点)服务「整库文档 / 长视频理解」;
  • Flash / Pro 等分层:有时「Flash」反而成为性价比与速度上的主力。

Google 的故事不太适合用「纯聊天谁第一」概括,更适合用:

当任务天然带着多媒体与海量上下文时,Gemini 系经常进入候选第一梯队。

xAI:快速逼近前沿集群的后来者

Grok 系列从「有个性的聊天机器人」逐步走到与前沿模型同台竞争。2026 年公开讨论中,Grok 在部分 Agent / 终端任务 相关指数上表现抢眼,并强调与 X(社交信息流)检索等产品差异。

主要在于:能力是否进入前沿扎堆区;API / 消费端可用性是否一致;上下文长度相关的计价悬崖

Meta:开放权重生态的「基础设施型」玩家

Llama 系列的意义,常常超过「榜单第几」:

  • 降低研究与创业的起点;
  • 催生无数微调、蒸馏、本地部署方案;
  • Llama 4 世代进一步强调多模态与超长上下文(公开材料中 Scout 等变体以极端上下文著称)。

注意术语:业界越来越谨慎地区分 open sourceopen weights。Llama 的许可通常带有使用条件,不等于 OSI 意义上的完全开源。

中国与亚洲的重要开放力量

以下并非完整名单,而是「地图上必须有点」的代表:

厂商 常见系列 常被提到的角色
DeepSeek V3 / R1 / V4 等 高性价比、强推理/编码、权重可获取(具体许可看代际)
阿里(Qwen) Qwen2 / Qwen3 / 3.x 开放权重非常活跃;编码与多语言;另有 Max 等 API 档
月之暗面 Kimi 系列 长上下文起家,后续在编码等赛道强势表现
智谱 GLM 系列 开放权重与国内生态
快手等 Kling 等 视频生成赛道的全球竞争者
其他 MiniMax、百川、零一等 不同时期在开放或 API 市场占位

欧洲及其他:Mistral 等

Mistral 常被视为欧洲开放权重代表:强调许可友好、部署效率、数据驻留叙事。它未必永远占据「最强开放模型」标题,但在「可商用、可落地、区域合规」地图上很重要。


四、分赛道深挖

下表列的是各赛道当前公开讨论中的主流/最新代表(约 2026 年 8 月),不是永久排名。同公司常有旗舰 / 主力 / 高吞吐多档,表中尽量写清。

1. 通用对话与旗舰 LLM

这是大众最熟悉的赛道:聊天、写作、翻译、总结、头脑风暴。

2026 年的现实:

  • 顶尖闭源模型综合体验接近,差异更多体现在文风、拒答、工具整合、记忆与产品包装;
  • 「旗舰」常被拆成多档:最强、默认可调用、便宜高吞吐;
  • 长上下文成为标配宣传点,但有效利用长上下文(检索质量、注意力、费用)比「支持多长」更关键。

当前代表性模型(闭源 / API 为主):

公司 最新/主力代表 备注
OpenAI GPT-5.6 Sol / Terra / Luna 旗舰—主力—高吞吐三档;综合对话与工具面很强
Anthropic Claude Fable 5、Claude Opus 5、Claude Sonnet 5 Fable 为名义旗舰;Opus 常被当作难任务实用最强;Sonnet 是工作马
Google DeepMind Gemini 3.7 Flash、Gemini 3.1 / 3.5 Pro Flash 常成速度与性价比主力;Pro 偏深度多模态/长上下文
xAI Grok 4.6 进入前沿扎堆区;强调实时检索与 Agent 能力
DeepSeek DeepSeek V4 Pro / V4 Flash API 极强性价比;同时有开放权重
阿里(通义) Qwen3.8 Max(API) 闭源 Max 档与开放权重编号版并存
月之暗面 Kimi K3 长上下文起家,综合与编码都很强
Mistral Mistral Large 3 等 欧洲代表;许可与数据驻留叙事突出

2. 推理模型(Reasoning / Thinking)

推理模型的核心不是「更会说话」,而是:

在答题前,愿意花更多计算做多步搜索、验算、自我纠正。

简要演进:

  • 2024:o1 等让公众看见「慢思考」的价值;
  • 2025:o3、各家 thinking 模式、DeepSeek-R1 等把推理能力扩散到开放权重与更多产品;
  • 2025–2026:推理能力逐渐「嵌回」通用旗舰,用户侧常见为「低/中/高思考力度」开关,而不是永远单独一个 App。

代价也很真实:

  • 更贵(输出里可能含大量推理 token);
  • 更慢(首个可见答案延迟上升);
  • 对简单任务可能「想太多」。

因此,推理不是默认全开的功能,而是难题开关

当前代表性模型 / 模式:

公司 最新/主力代表 备注
OpenAI GPT-5.6(可调推理力度);历史线 o1 → o3 / o4-mini 推理已并入旗舰家族,不再只靠独立 o 系列 App
Anthropic Claude Opus 5 / Fable 5(adaptive thinking) 高思考档偏难推理与长程任务
Google DeepMind Gemini「Deep Think」/ High 推理档(如 3.x Pro / Flash High) 与长上下文、多模态任务常一起用
xAI Grok 4.6(low / medium / high / xhigh) 推理档位常开,延迟与成本需一并看
DeepSeek DeepSeek V4 Pro(low / high / max);历史里程碑 R1 开放权重侧推理浪潮的关键推手
阿里(通义) Qwen3.x Thinking / Qwen3.8 思维模式 开源与 API 均常见 thinking 变体
月之暗面 Kimi K3(推理/Agent 向) 在难题与 Agent 评测中存在感强

3. 代码、工具调用与 Agent

如果说 2023 的关键词是 Chat,2025–2026 的关键词之一就是 Agentic coding(能动起来的编码)

关注点从 HumanEval 这类「写函数」转向:

  • 在真实仓库里定位问题;
  • 多文件修改;
  • 跑测试、读报错、迭代修复;
  • 长时间保持任务目标。

对应评测常见:SWE-bench(及 Verified / Pro 等变体)、Terminal-Bench、各类 Live coding / Frontend Arena。

这个赛道的关键认知:

成绩高度依赖「模型 + 脚手架(harness)」。
同一模型配不同 Agent 框架,分数可以差一截。
所以厂商演示、第三方榜、你自己的 IDE 插件,三者不必一致。

当前代表性模型(模型层,不含具体 IDE 产品名):

公司 最新/主力代表 备注
Anthropic Claude Opus 5、Claude Fable 5、Claude Sonnet 5 软件工程 / 长程修仓叙事很强
OpenAI GPT-5.6 Sol(及工具/Responses 面) Agent 链路、终端与工具调用综合突出
xAI Grok 4.6 部分 Agentic / Terminal 指数上表现抢眼
Google DeepMind Gemini 3.7 Flash / 3.x Pro 文档型 Agent、工具与搜索接地常见
DeepSeek DeepSeek V4 Pro 开放权重 + 编码/Agent 性价比常被点名
月之暗面 Kimi K3(含 Coding 向讨论) 开放权重编码赛道热门
阿里(通义) Qwen3.8 / Qwen3.6 编码向变体 开源编码与 Agent 任务活跃
智谱 GLM-5.x 开放权重编码候选之一

4. 多模态理解(看、听、读长材料)

这里要区分两类能力:

  1. 理解型多模态:输入图像/音频/视频,输出文本分析;
  2. 生成型多模态:输出图像、视频、语音(见后文)。

Google Gemini 系长期把「原生多模态 + 长上下文」当作主叙事;OpenAI、Anthropic 等也在视觉理解与文档理解上持续加码。实际使用中,瓶颈经常不是「能不能看图」,而是:

  • 图表数字是否读准;
  • 长 PDF 是否真的「读完」而不是局部抽样;
  • 视频时序事件是否稳定。

当前代表性模型:

公司 最新/主力代表 备注
Google DeepMind Gemini 3.7 Flash、Gemini 3.1 / 3.5 Pro 原生多模态 + 超长上下文的标杆叙事
OpenAI GPT-5.6 系列(视觉输入) 图文理解与工具链结合紧
Anthropic Claude Opus 5 / Fable 5 / Sonnet 5(读图) 文档、图表、长材料理解强
xAI Grok 4.6(图文) 多模态输入 + 实时信息产品差异
阿里(通义) Qwen3.5 / 3.8 VL 等 开放权重视觉—语言活跃
月之暗面 Kimi K3(文/图/视频理解向) 长材料与多模态理解并存
Meta Llama 4(Scout / Maverick 等) 原生多模态开放权重

5. 图像生成

图像赛道相对独立,用户心智也更接近「创意工具」而非「智商榜」。

当前代表性模型:

公司 最新/主力代表 备注
OpenAI GPT Image 2(/ 2.0) 综合遵循、文字渲染、多轮编辑讨论多
Midjourney Midjourney V8.x(如 V8.1 / V8.2) 美学与风格辨识度标杆;偏平台封闭
Black Forest Labs FLUX.2(Pro / Flex / Max / Dev / Klein) API + 部分开放权重;写实与可控强
Google Imagen 4;Gemini 图像能力(如 Nano Banana 等产品名) 产品照片、干净合成常见
Ideogram Ideogram 4.0 海报/排版文字见长
Recraft Recraft V4.x 设计向、矢量/品牌风格
Stability AI Stable Diffusion 3.5 等 开源工作流与本地生态
字节等 Seedream 4.x 等 多语文字与商业设计向讨论多

6. 视频生成

视频比图像难一个数量级:要处理时间一致性、运动物理、镜头语言,越来越多模型还要处理同步音频

专业工作流越来越不像「一句提示出片」,而像:

关键帧(图像模型)→ 图生视频 → 镜头延长/编辑 → 超分与调色 → 对口型/配音

当前代表性模型:

公司 最新/主力代表 备注
Google DeepMind Veo 3.1(及 Veo 3) 画质、物理、原生音频常被点名
Runway Gen-4 / Gen-4.5 创作者控制、镜头与制作工作流
快手 Kling 3.0(及 Omni 等) 时长、运动、口型等存在感强
OpenAI Sora 2 世界一致性/叙事影响大;产品可用性以官方为准
Luma Dream Machine / Ray 系 图生视频与快速迭代常见
Pika Pika 2.x 短视频与社交向
腾讯等 Hunyuan Video 等 开放/可部署视频权重生态之一
阿里等 Wan 等 开源视频工作流常见选项
MiniMax 等 Hailuo 等 运动与人像向讨论多

7. 语音

语音赛道可拆成:

  • ASR:语音转文字;
  • TTS:文字转语音;
  • 实时语音对话:低延迟双工(边听边说)。

它经常作为大模型产品的「接口层」存在:模型可以一般聪明,但语音体验差,产品仍会输。反之,语音体验好,能显著放大一个中等模型的日活。

当前代表性模型 / 服务:

公司 最新/主力代表 类型 备注
OpenAI GPT Realtime / ChatGPT Voice;OpenAI TTS;Whisper 实时对话 / TTS / ASR 消费端语音入口心智强
Google Chirp / Cloud STT;Gemini Live;Cloud TTS ASR / 实时 / TTS 与 Gemini、安卓生态绑定
ElevenLabs ElevenLabs TTS / 多语语音模型 TTS 为主 音色与配音工业常用
Cartesia、PlayHT 等 各家新一代 TTS TTS 低延迟语音合成赛道
Anthropic 等 产品内语音能力(随代际变化) 实时/接口 多作为助手入口而非独立 TTS 品牌
开源侧 Whisper 系、FunASR、CosyVoice 等 ASR / TTS 本地与私有化常见

8. 嵌入(Embedding)与检索

做 RAG(检索增强生成)、语义搜索、推荐时,用的往往不是旗舰聊天模型,而是:

  • embedding 模型(把文本/图变成向量);
  • 重排序(rerank)模型;
  • 向量数据库与分块策略。

这个赛道很少上热搜,却决定很多「企业知识库机器人」的上限。聊天模型再强,检索不准,一样一本正经地胡说。

当前代表性模型:

公司 最新/主力代表 备注
OpenAI text-embedding-3-large / 3-small 通用 RAG 默认选项之一
Cohere embed-v4 / embed 系列;Rerank 系列 检索 + 重排产品线完整
Voyage AI voyage-3 / voyage-code 等 高质量检索与代码嵌入常见
Google gemini-embedding / text-embedding 系列 与 Google 云检索栈搭配
智源 / BAAI 等 bge-m3、bge-reranker 等 开源多语检索事实标准之一
Jina AI jina-embeddings-v3 等 长文本与多语嵌入
阿里等 GTE / Qwen 嵌入系列 中文与开源检索常用
NVIDIA 等 NV-Embed 等 开源高分嵌入之一

9. 开放权重:并重视角下的「另一条主线」

开放权重不是闭源的廉价复制,而是另一套工业:

  • 可复现与可研究
  • 可自托管与私有化
  • 可蒸馏、可微调、可做领域模型
  • 可用竞争把 API 价格打下来

2025–2026 的开放权重前沿,常见讨论对象包括:DeepSeek、Qwen、Llama、Kimi、Mistral、GLM 等家族。竞争非常激烈,且某一周的第一名几乎没有长期意义。

读开放权重时,需要额外看三列:

  1. 许可(MIT / Apache / 自定义限制);
  2. 是否真能在自己的硬件上跑(显存、量化、推理引擎);
  3. 官方 API 与「可下载权重」是不是同一个 checkpoint。

当前代表性模型(可下载权重向):

公司 最新/主力代表 备注
DeepSeek DeepSeek V4 Pro / V4 Flash(MIT 等) 前沿级开放权重 + 极致性价比叙事
阿里(通义) Qwen3.8(含 27B 等)、Qwen3.8-Max 权重变体 开放最活跃家族之一;注意 Max 许可
月之暗面 Kimi K3(开放权重) 前沿编码/Agent;体量巨大,自托管门槛高
Meta Llama 4 Scout / Maverick 生态广;超长上下文(Scout);社区许可有条件
Mistral Mistral Large 3、Small 4 等 欧洲开放权重;偏友好许可
智谱 GLM-5 / GLM-5.x MIT 等宽松许可常被点名
Google Gemma 4 系列 端侧到中尺寸本地很强
OpenAI gpt-oss 等开放权重尝试(若仍在流通) 闭源巨头偶发开放线,需核验代际
Microsoft Phi-4 / Phi-4-Mini 等 小模型效率路线

10. 小模型与端侧(简短)

端侧 / 小模型的目标通常不是登顶 Arena,而是:

  • 隐私与离线;
  • 手机 / PC 本地;
  • 极低成本的高并发;
  • 作为大模型前面的路由、草稿、分类器。

当前代表性模型:

公司 最新/主力代表 备注
Google Gemma 4(E2B–31B 等档) 笔记本/消费级 GPU 友好
Microsoft Phi-4-Mini 等 极紧显存下的长上下文余量
Meta Llama 3.2 / Llama 4 小尺寸变体 端侧与边缘部署常见
阿里(通义) Qwen3 / 3.8 小尺寸稠密档(如数 B–27B) 本地编码与通用很强
Apple 等 端侧基础模型(随系统代际) 系统内建、隐私向
Black Forest Labs FLUX.2 Klein(4B/9B) 图像侧的「端侧/消费级」对照

Gemma、Phi、各类 1B–14B 级模型、以及更小的专用头,都属于这张地图的边缘但必要区域:不是最炫,但很脏很累的活往往靠它们。


五、榜单科普:它们是什么,测什么,怎么读

大多数人不是不知道「有榜单」,而是不知道榜单之间不可互换。下面按「最常碰到的类型」做客观罗列

1. 人类偏好类:LMArena(原 LMSYS Chatbot Arena)

它是什么:
匿名两两对比,真人投票「哪边回复更好」,用 Elo 等机制排名。

它测什么:
真实对话场景下的综合观感——文风、有用性、礼貌、一定程度的正确性,但不是严格学科考试。

它适合回答:
「大家聊起来更喜欢谁?」

它不保证:
数学证明一定对、代码一定能合并进生产、长代理任务一定能完成。

2. 综合能力指数类:Artificial Analysis 等

它是什么:
第三方把多个基准、速度、价格等放到同一套框架里,给出 Intelligence Index、Agentic Index 等。

它测什么:
试图回答「综合智能 / 性价比 / 速度」这种更工程化的问题。

注意:
不同指数权重不同;「Max 思考」与「默认思考」也不是同一产品。

3. 知识与考试类:MMLU / MMLU-Pro 等

它是什么:
多学科选择题式知识评测。MMLU 曾是王者指标;后来出现更难的 MMLU-Pro。

现状:
很多前沿模型在经典 MMLU 上已高度饱和,区分度下降,于是社区转向更难、更新的集合。

4. 专家推理类:GPQA(含 Diamond)等

它是什么:
高难度科学问答,强调专家级推理,降低「靠背题」的轻松得分。

它适合回答:
「硬科学问题上的推理是否扎实?」

5. 数学竞赛类:AIME、MATH、各类竞赛集

它测什么:
符号化、多步数学解题。

读法提醒:
推理模型 + 更多测试时算力,会显著抬分;看分数时要看清采样次数、工具是否允许、是否 consensus。

6. 代码类:HumanEval → LiveCodeBench → SWE-bench

这是一条「越来越像真工作」的进化线:

榜单/基准 大致在测
HumanEval 等 短函数生成
LiveCodeBench 更新题面、降低污染的竞赛/编程题
SWE-bench 系列 真实 GitHub issue / 补丁级修复
Frontend / Code Arena 等 前端或特定域的人类偏好与任务完成

如果你关心「能不能帮我改项目」,SWE-bench 类通常比 HumanEval 更相关——但仍不等于你的代码库。

7. 「人类最后一场考试」类:HLE 等超难综合集

当旧基准被刷满,社区会引入更难、更新、更综合的题集(名称与版本持续变化)。它们的意义主要是:重新制造区分度,而不是给普通用户日常选型。

8. 开放模型专用榜:Hugging Face Open LLM Leaderboard 等

它是什么:
主要服务可下载开放权重模型的可比评测,强调公开、可复现、反污染。

它适合回答:
「在可自托管模型里,谁相对更强?」

闭源 API 模型有时不在同一套规则下直接横比,不必强行一锅炖。

9. 聚合站与新媒体榜:BenchLM、各类「Best LLM 2026」

它们的价值是:把分散基准、价格、上下文、许可汇总成一张表
它们的风险是:更新频率高、口径不一、标题党容易把快照写成终局。

10. 生成式媒体榜:图像 / 视频的人类偏好与 VBench 等

图像视频领域同样有人类偏好对战、自动化质量基准。和 LLM 一样:好看、可控、可商用、可进入工作流,往往比单一分数更重要。


六、主流榜单前几名解读(约 2026 年 8 月快照)

上一章讲的是「榜单是什么」;这一章看「现在顶上坐着谁」,以及为什么不同榜的前几名并不相同

先立三条读法:

  1. 名次是快照,不是终局。 Arena 可能周更,厂商一发版、一调价、一改路由,表就会动。
  2. 前几名分差往往很小。 Elo 差十几分、指数差 1–2 分,统计上经常落在噪声附近,不必把「第 1 / 第 2」当成质变。
  3. 换一块表,冠军就可能换人。 这不是榜单「假」,而是它们在测不同东西。

下表综合公开第三方汇总与主流评测站点约 2026 年 8 月 的常见说法;精确小数与当日排序请以官网为准。


1. 人类偏好总榜:LMArena / Arena(原 LMSYS Chatbot Arena)

它在回答: 真人盲测里,聊天回复「更讨喜、更有用」的是谁。

2026 年 8 月,综合文本偏好榜常见前列形态:

大致位次 模型 公司 怎么读
顶尖档 Claude Fable 5 / Claude Opus 5 / Opus 4.8 等 Anthropic Anthropic 在人类偏好上常占一整条「高原」
顶尖档 GPT-5.5 Pro / GPT-5.6 系列 OpenAI 与 Claude 同属前沿扎堆区,分差通常很窄
顶尖档 Gemini 3.1 Pro 等 Google 综合文本常进第一梯队;科学/长上下文子榜更常出彩
紧随 Grok、Qwen Max、Kimi 等 xAI / 阿里 / 月之暗面 已进入「可与闭源前沿同台」的讨论区

解读要点:

  • 这张榜测的是对话观感
  • 2026 年的主旋律不是「一家甩开十条街」,而是 Anthropic / OpenAI / Google(再加几家)挤在很窄的 Elo 带里
  • 同一家族多代同时上榜很常见(Opus 4.8 与 Opus 5、GPT-5.5 与 5.6),说明迭代变密,也说明旧旗舰未必立刻退场

子榜提醒:
综合文本第 1,不等于编码第 1。公开讨论里,Frontend / Code Arena 等编码子榜上,月之暗面 Kimi K3(开放权重) 曾冲到编码向前列。


2. 综合能力指数:Artificial Analysis Intelligence Index

它在回答: 在同一套第三方框架下,把多类基准(推理、知识、编码等)压成一个「智能指数」,谁更高。

约 2026 年 8 月,公开讨论中的常见前列:

大致位次 模型 公司 指数量级(示意) 怎么读
1 Claude Opus 5(Max / 高思考档) Anthropic ~63 综合指数上常居榜首
2 Claude Fable 5 Anthropic ~62 名义旗舰;与 Opus 分差极小,且可能含策略/回退设定
3 GPT-5.6 Sol(高思考档) OpenAI ~61 非 Anthropic 阵营最强挑战者之一
4 Kimi K3 月之暗面 ~60 开放权重逼近闭源前沿的强信号
5–6 Qwen3.8 Max、Grok 4.x 等 阿里 / xAI ~56–58 性价比与产品差异开始进入「前排叙事」

解读要点:

  • 顶部分数 61–63 这种间距,更像「同一重量级」,不像「代差」。
  • 名义最贵 / 名义旗舰 ≠ 指数第一:Fable 定价与品牌往往更「旗舰」,但指数上 Opus 5 反而更常领先
  • Kimi K3 能进前四附近,说明开放权重已不只是「便宜替代」,而是能在综合指数里占位。

和 Arena 对照:
Arena 偏「聊起来舒不舒服」;AA Index 偏「一堆硬题加权后强不强」。两者前列重叠(都是 Claude / GPT),但具体第几、谁压谁经常不一致——这是正常的。


3. 软件工程:SWE-bench Verified vs SWE-bench Pro

它在回答: 模型(通常还要加 Agent 脚手架)能不能在真实软件问题上给出可验证修复。

SWE-bench Verified(相对更「老」、更高分、更易饱和)

约 2026 年 8 月,公开汇总里常见前列形态:

大致位次 模型 公司 分数量级(示意)
前列胶着 DeepSeek V4 Pro、GPT-5.6 Sol、Claude Opus 5 DeepSeek / OpenAI / Anthropic ~95%–96%+
紧随 Grok 4.6、Claude Fable / Mythos、Kimi K3 等 xAI / Anthropic / 月之暗面 ~93%–96%

解读: Verified 顶部已经挤成一团。差 0.2–1 个百分点,很难单独拿来宣布「编码之王」;更说明前沿模型在「标准软件修复题」上整体变强,区分度在下降。

SWE-bench Pro(更难、区分度通常更好)

约同期公开讨论中的常见形态:

大致位次 模型 公司 分数量级(示意)
1–3 Claude Mythos 5、Claude Fable 5、Claude Opus 5 Anthropic ~79%–80%+
其后 GPT-5.x、Kimi、DeepSeek 等 各家 低于 Claude 顶档

解读要点:

  • Verified 上 DeepSeek/GPT 能贴脸,Pro 上 Anthropic 常更整洁地占住前排
  • 分数高度依赖 scaffold(脚手架):官方演示、第三方统一 harness、本地的 IDE Agent,三者不必同序。
  • Mythos 一类若属受限访问,榜上第一不等于人人可调用的第一。

4. 图像:Artificial Analysis Text-to-Image Arena 等

它在回答: 盲测里,文生图结果「更好看/更符合提示」的是谁。

约 2026 年 8 月,Image Arena 常见前列:

大致位次 模型 公司 怎么读
1 GPT Image 2(high) OpenAI 综合盲测常处明显领先档
2–3 Reve 2.1;Nano Banana 2(Gemini 图像) Reve / Google 紧追第一梯队
前列 GPT Image 1.5、MAI-Image 等 OpenAI / Microsoft 证明图像赛道已多强并存
开放权重前列 Ideogram 4.0、FLUX.2 [dev] 等 Ideogram / Black Forest Labs 「可下载/可自托管」另一条线
美学心智 Midjourney V8.x Midjourney Arena 名次未必最高,但创作者心智仍极强

解读要点:

  • 图像榜的「第一」更偏综合偏好 + 提示遵循;Midjourney 仍可能是很多人的「最好看」,两者不矛盾。
  • FLUX / Ideogram 的价值经常在 API、开放权重、商用工作流,不必用总榜名次否定它们。

七、结语:地图的用法

AI 模型层出不穷,并不意味着需要追每一条新闻。更有效的姿态是:

  • 赛道看世界,而不是用单一冠军看世界;
  • 演进理解一家公司,而不是用一个型号理解一家公司;
  • 多种榜单交叉验证,而不是用一张截图下结论;
  • 把「开源 vs 闭源」「参数大小」从信仰降级为工程约束

行业还会继续快迭代。型号会过时,坐标轴 provably 更耐用:公司、赛道、开放度、工具链、成本、证据类型。把这六项盯住,你就已经比大多数「每周换信仰」的讨论,清醒得多。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐