分不清每周出来的新模型和榜单?一文总结所有AI 模型地图:公司、赛道、演进与榜单
写在前面:为什么需要一张「地图」
过去三年,AI 模型几乎每周都在换名字、加版本号、刷榜、降价、开源或闭源。大家打开社交媒体,看到的往往是:
- 「某某模型登顶」
- 「参数量再创新高」
- 「开源碾压闭源 / 闭源碾压开源」
- 一张截图里的排行榜,旁边配一句「终局已定」
这些信息并不全是假的,但它们通常缺一张地图。没有地图,很容易把「某次评测第一」理解成「全面最强」,把「参数更大」理解成「一定更聪明」,把「开源」理解成「一定落后」。
这篇文章的目标很明确:
- 一张行业总览地图:先知道有哪些层、哪些赛道、哪些玩家;
- 做一次冷静科普:从 ChatGPT 爆发讲到现在,过往从简,当下讲清结构;
- 建立一点对榜单的清醒感:知道榜单是什么、测什么、别被洗脑。
本文不做个人推荐,也不给「该买哪家」的决策树。重点是:把乱成一团的名字,收成一张能继续更新认知的骨架。

先破两个常见误解
误解一:「参数越大越好」
参数量(Parameter Count)曾经是最容易传播的指标:70B、405B、万亿级……听起来像手机里的「跑分」。
但到了 2025–2026,这个指标已经明显失效,原因至少有四条:
-
有效参数 ≠ 总参数
-
训练数据、训练方法、后训练(post-training)往往比参数量更决定体验
-
推理时算力(test-time compute)改变了游戏规则
-
产品形态在重新分配能力
一句话:参数量是成本与架构的线索,不是智商排名。
误解二:「开源一定落后闭源」
更准确的说法应拆成三层:
| 概念 | 含义 | 常见例子 |
|---|---|---|
| 闭源 API 模型 | 只能调用,看不到权重 | GPT、Claude、Gemini 主流产品线 |
| 开放权重(open weights) | 可下载权重,许可可能有限制 | Llama、部分 Qwen、部分 Mistral |
| 更接近「开源」的发布 | 权重 + 较宽松许可 + 可复现训练信息不等 | DeepSeek 部分代际、部分 Apache/MIT 模型 |
事实是:从 2024 年底到 2026 年中,开放权重模型多次逼近甚至在局部赛道追平闭源前沿——尤其是性价比、可自托管、可二次微调、可做私有化部署这些维度。闭源仍然常在「最难任务的绝对上限、产品化工具链、安全策略与企业 SLA」上占优,但这不是「开源永远落后」的简单叙事。
更清醒的表述是:
闭源与开放权重在不同目标函数上竞争:绝对能力、成本、可控性、合规、生态。
榜单上接近,不代表产品上可互换;产品上可互换,不代表合规与运维成本相同。
一、总览地图:先把坐标系立起来
读 AI 模型,建议同时用四张「坐标系」,而不是只记名字。
1. 按「在买什么」分层
┌─────────────────────────────────────────────┐
│ 应用层:Chat 产品 / IDE 插件 / Agent 产品 │
├─────────────────────────────────────────────┤
│ 能力层:推理、工具调用、多模态、长上下文 │
├─────────────────────────────────────────────┤
│ 模型层:底座 LLM / 专用模型 / 生成模型 │
├─────────────────────────────────────────────┤
│ 基础设施:芯片、集群、推理引擎、路由与缓存 │
└─────────────────────────────────────────────┘
多数人争论的是「模型层谁第一」,真正影响体验的,往往是应用层 + 工具链 + 价格/延迟策略。
2. 按「能力赛道」分图
| 赛道 | 你在问的问题 | 典型玩家(全球,示意) |
|---|---|---|
| 通用对话 / 旗舰 LLM | 写、聊、总结、办公、综合问答 | OpenAI、Anthropic、Google、xAI、各大开放权重厂商 |
| 推理 / 深度思考 | 数学、科学、复杂规划 | 各家 reasoning / thinking 模式 |
| 代码与软件工程 Agent | 改仓库、修 bug、长期编码 | Anthropic、OpenAI、Google、DeepSeek、Kimi、Qwen 等 |
| 多模态理解 | 看图、看视频、听音频、读长文档 | Gemini 系尤为强调原生多模态;各家亦跟进 |
| 图像生成 | 文生图、图生图、风格与可控性 | Midjourney、Flux、Ideogram、各家图像模型 |
| 视频生成 | 文生视频、图生视频、镜头控制 | Veo、Runway、Kling、Sora 等 |
| 语音 | TTS / ASR / 实时对话 | OpenAI、Google、ElevenLabs 等生态 |
| 嵌入与检索 | 搜索、RAG、语义匹配 | 各家 embedding 模型 + 向量库 |
| 小模型 / 端侧 | 本地、隐私、离线、低成本 | Gemma、Phi、Qwen 小尺寸、Llama 小尺寸等 |
3. 按「公司角色」分图
大致可分成几类(有重叠):
- 闭源前沿实验室:OpenAI、Anthropic、Google DeepMind、xAI
- 开放权重推动者:Meta(Llama)、Mistral、DeepSeek、阿里(Qwen)、月之暗面(Kimi)、智谱(GLM)等
- 云与分发平台:把别人的模型托管起来卖推理(各大云、聚合 API)
- 垂直/工具公司:IDE Agent、搜索增强、视频剪辑工作流等——它们不一定训练最强底座,但决定用户每天摸到什么
4. 按「时间阶段」分图
| 阶段 | 大致时间 | 关键词 |
|---|---|---|
| 爆发期 | 2022 末–2023 | ChatGPT、GPT-4、第一波竞品 |
| 扩容与对齐期 | 2023–2024 中 | 更长上下文、多模态、指令跟随、开源追赶 |
| 推理浪潮 | 2024 末–2025 | o1 / R1 / thinking,测试时算力 |
| 收敛与产品化 | 2025–2026 | 前沿分差缩小;拼成本、Agent、可靠性、工具生态 |
斯坦福 AI Index 等公开观察也指向同一趋势:
顶尖模型在人类偏好 Arena 上的分差显著收窄,竞争重心转向成本、延迟、可靠性与垂直场景。
二、简史:从 GPT-3.5 / ChatGPT 到现在
过往不必逐代背诵,抓住「每一波真正改变大众认知的事」即可。
2022 年末–2023:对话把 AI 变成日常产品
- ChatGPT(基于 GPT-3.5) 让「和大模型聊天」一夜成为全球习惯。
- GPT-4(2023) 把能力上限明显抬高,同时催生了插件、浏览、代码解释器等「模型 + 工具」雏形。
- Google、Anthropic、Meta 等加速跟进;Llama 2 等开放权重模型让「自己部署」成为开发者日常话题。
- Midjourney、Stable Diffusion 等则在图像生成赛道同步爆发,证明「生成式 AI」不只是聊天。
这一阶段的公众叙事是:突然变聪明了,而且人人可用。
2023–2024:比谁更全能——上下文、多模态、生态
竞争主线变成:
- 更长的上下文(从几 K 到 100K+)
- 更好的指令跟随与拒答策略
- 视觉输入成为标配
- API 生态、企业版、价格战开始成形
- 开源侧出现 Mixtral、Llama 3、Qwen2 等一波「够用且可本地」的选择
这一阶段的公众叙事是:模型在变「产品」,而不只是 Demo。
2024 末–2025:推理模型改变「聪明」的定义
以 OpenAI o1 为代表的推理模型公开后,行业共识发生偏移:
- 不再只追求「秒回」;
- 允许模型在内部多步思考(chain-of-thought / reasoning tokens);
- 数学、编程竞赛、科学问答等难题分数快速上升;
- DeepSeek-R1 等开放权重推理模型证明:这条路并非闭源专属。
几乎同一时期,Agent / 编程助手从演示走向日用:模型开始更频繁地读文件、跑命令、改仓库、调用工具。能力评测也从「答题」转向 SWE-bench 这类「修真实软件问题」。
这一阶段的公众叙事是:会想、会干活,比会聊天更值钱。
2025–2026:前沿扎堆,赛道分化,榜单更碎
到 2026 年中,一个很醒目的现象是:
- 头部闭源模型在综合人类偏好上彼此接近;
- 「谁全面第一」越来越难回答,也越来越不重要;
- 真正拉开差距的是:编码 Agent、原生多模态、超长上下文、价格、速度、开放权重可下载性、企业合规;
- 图像与视频生成继续高速迭代,和工作流(关键帧→图生视频→后期)绑定更紧。
这一阶段的公众叙事应调整为:
别找唯一冠军。找「关心的赛道上,谁在优化什么」。
三、主要玩家
下面按全球主流玩家做演进史式梳理。只记「家族与定位」,具体小版本号会继续变。
OpenAI:从 ChatGPT 到「通用 Agent 操作系统」
演进主线(极简):
- GPT-3.5 / ChatGPT → 大众入口
- GPT-4 / 4o → 多模态与日用体验
- o1 / o3 系列 → 独立推理产品线
- GPT-5 世代 → 把「对话能力」与「可调节推理」逐步统一进同一产品家族
- 2026 年前后的旗舰代际(如公开讨论中的 GPT-5.x 系列)→ 更强调工具面、Agent、分层价位(旗舰 / 主力 / 高吞吐)
看 OpenAI,关键不只看「最强一档」,而要看:
- 同一家族里是否有清晰的能力/价格阶梯;
- Responses / 工具调用 / 代码执行 / 计算机使用等运行时能力;
- ChatGPT 消费端与 API 企业端是否同一套语义。
OpenAI 长期优势往往在:生态广度、默认心智占有率、把新能力产品化的速度。它不一定在每一个细分榜单永远第一,但很难被忽视。
Anthropic:从「更稳的对话」到「编码与严肃工作」
Claude 系列常见分层逻辑是:
- Opus:最强档,偏向难推理、难编码、长程任务
- Sonnet:主力工作马,平衡质量与成本
- Haiku:轻量高吞吐
演进上,Anthropic 早期以写作质量、拒答与安全风格被记住;2025 前后则在软件工程 Agent叙事上非常突出——模型能力与「能在终端里干活的产品形态」绑定。
到 2026 年,外界讨论里还出现了更多品牌名(例如公开评测中常见的 Fable / Mythos 等代际称呼)。对读者更重要的是:
Anthropic 经常提醒一件事:目录上的「旗舰名」不一定等于「该默认调用的模型」。定价、数据保留策略、安全路由、实际评测,都会让「名义最强」和「实用最强」分开。
Google DeepMind:原生多模态与长上下文的强势叙事
Gemini 系列的演进关键词通常是:
- 与搜索、Workspace、Android、云(Vertex)深度绑定;
- 原生多模态(文本 / 图像 / 音频 / 视频同请求处理)作为差异化;
- 长上下文(百万 token 量级成为卖点)服务「整库文档 / 长视频理解」;
- Flash / Pro 等分层:有时「Flash」反而成为性价比与速度上的主力。
Google 的故事不太适合用「纯聊天谁第一」概括,更适合用:
当任务天然带着多媒体与海量上下文时,Gemini 系经常进入候选第一梯队。
xAI:快速逼近前沿集群的后来者
Grok 系列从「有个性的聊天机器人」逐步走到与前沿模型同台竞争。2026 年公开讨论中,Grok 在部分 Agent / 终端任务 相关指数上表现抢眼,并强调与 X(社交信息流)检索等产品差异。
主要在于:能力是否进入前沿扎堆区;API / 消费端可用性是否一致;上下文长度相关的计价悬崖
Meta:开放权重生态的「基础设施型」玩家
Llama 系列的意义,常常超过「榜单第几」:
- 降低研究与创业的起点;
- 催生无数微调、蒸馏、本地部署方案;
- Llama 4 世代进一步强调多模态与超长上下文(公开材料中 Scout 等变体以极端上下文著称)。
注意术语:业界越来越谨慎地区分 open source 与 open weights。Llama 的许可通常带有使用条件,不等于 OSI 意义上的完全开源。
中国与亚洲的重要开放力量
以下并非完整名单,而是「地图上必须有点」的代表:
| 厂商 | 常见系列 | 常被提到的角色 |
|---|---|---|
| DeepSeek | V3 / R1 / V4 等 | 高性价比、强推理/编码、权重可获取(具体许可看代际) |
| 阿里(Qwen) | Qwen2 / Qwen3 / 3.x | 开放权重非常活跃;编码与多语言;另有 Max 等 API 档 |
| 月之暗面 | Kimi 系列 | 长上下文起家,后续在编码等赛道强势表现 |
| 智谱 | GLM 系列 | 开放权重与国内生态 |
| 快手等 | Kling 等 | 视频生成赛道的全球竞争者 |
| 其他 | MiniMax、百川、零一等 | 不同时期在开放或 API 市场占位 |
欧洲及其他:Mistral 等
Mistral 常被视为欧洲开放权重代表:强调许可友好、部署效率、数据驻留叙事。它未必永远占据「最强开放模型」标题,但在「可商用、可落地、区域合规」地图上很重要。
四、分赛道深挖
下表列的是各赛道当前公开讨论中的主流/最新代表(约 2026 年 8 月),不是永久排名。同公司常有旗舰 / 主力 / 高吞吐多档,表中尽量写清。
1. 通用对话与旗舰 LLM
这是大众最熟悉的赛道:聊天、写作、翻译、总结、头脑风暴。
2026 年的现实:
- 顶尖闭源模型综合体验接近,差异更多体现在文风、拒答、工具整合、记忆与产品包装;
- 「旗舰」常被拆成多档:最强、默认可调用、便宜高吞吐;
- 长上下文成为标配宣传点,但有效利用长上下文(检索质量、注意力、费用)比「支持多长」更关键。
当前代表性模型(闭源 / API 为主):
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| OpenAI | GPT-5.6 Sol / Terra / Luna | 旗舰—主力—高吞吐三档;综合对话与工具面很强 |
| Anthropic | Claude Fable 5、Claude Opus 5、Claude Sonnet 5 | Fable 为名义旗舰;Opus 常被当作难任务实用最强;Sonnet 是工作马 |
| Google DeepMind | Gemini 3.7 Flash、Gemini 3.1 / 3.5 Pro | Flash 常成速度与性价比主力;Pro 偏深度多模态/长上下文 |
| xAI | Grok 4.6 | 进入前沿扎堆区;强调实时检索与 Agent 能力 |
| DeepSeek | DeepSeek V4 Pro / V4 Flash | API 极强性价比;同时有开放权重 |
| 阿里(通义) | Qwen3.8 Max(API) | 闭源 Max 档与开放权重编号版并存 |
| 月之暗面 | Kimi K3 | 长上下文起家,综合与编码都很强 |
| Mistral | Mistral Large 3 等 | 欧洲代表;许可与数据驻留叙事突出 |
2. 推理模型(Reasoning / Thinking)
推理模型的核心不是「更会说话」,而是:
在答题前,愿意花更多计算做多步搜索、验算、自我纠正。
简要演进:
- 2024:o1 等让公众看见「慢思考」的价值;
- 2025:o3、各家 thinking 模式、DeepSeek-R1 等把推理能力扩散到开放权重与更多产品;
- 2025–2026:推理能力逐渐「嵌回」通用旗舰,用户侧常见为「低/中/高思考力度」开关,而不是永远单独一个 App。
代价也很真实:
- 更贵(输出里可能含大量推理 token);
- 更慢(首个可见答案延迟上升);
- 对简单任务可能「想太多」。
因此,推理不是默认全开的功能,而是难题开关。
当前代表性模型 / 模式:
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| OpenAI | GPT-5.6(可调推理力度);历史线 o1 → o3 / o4-mini | 推理已并入旗舰家族,不再只靠独立 o 系列 App |
| Anthropic | Claude Opus 5 / Fable 5(adaptive thinking) | 高思考档偏难推理与长程任务 |
| Google DeepMind | Gemini「Deep Think」/ High 推理档(如 3.x Pro / Flash High) | 与长上下文、多模态任务常一起用 |
| xAI | Grok 4.6(low / medium / high / xhigh) | 推理档位常开,延迟与成本需一并看 |
| DeepSeek | DeepSeek V4 Pro(low / high / max);历史里程碑 R1 | 开放权重侧推理浪潮的关键推手 |
| 阿里(通义) | Qwen3.x Thinking / Qwen3.8 思维模式 | 开源与 API 均常见 thinking 变体 |
| 月之暗面 | Kimi K3(推理/Agent 向) | 在难题与 Agent 评测中存在感强 |
3. 代码、工具调用与 Agent
如果说 2023 的关键词是 Chat,2025–2026 的关键词之一就是 Agentic coding(能动起来的编码)。
关注点从 HumanEval 这类「写函数」转向:
- 在真实仓库里定位问题;
- 多文件修改;
- 跑测试、读报错、迭代修复;
- 长时间保持任务目标。
对应评测常见:SWE-bench(及 Verified / Pro 等变体)、Terminal-Bench、各类 Live coding / Frontend Arena。
这个赛道的关键认知:
成绩高度依赖「模型 + 脚手架(harness)」。
同一模型配不同 Agent 框架,分数可以差一截。
所以厂商演示、第三方榜、你自己的 IDE 插件,三者不必一致。
当前代表性模型(模型层,不含具体 IDE 产品名):
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| Anthropic | Claude Opus 5、Claude Fable 5、Claude Sonnet 5 | 软件工程 / 长程修仓叙事很强 |
| OpenAI | GPT-5.6 Sol(及工具/Responses 面) | Agent 链路、终端与工具调用综合突出 |
| xAI | Grok 4.6 | 部分 Agentic / Terminal 指数上表现抢眼 |
| Google DeepMind | Gemini 3.7 Flash / 3.x Pro | 文档型 Agent、工具与搜索接地常见 |
| DeepSeek | DeepSeek V4 Pro | 开放权重 + 编码/Agent 性价比常被点名 |
| 月之暗面 | Kimi K3(含 Coding 向讨论) | 开放权重编码赛道热门 |
| 阿里(通义) | Qwen3.8 / Qwen3.6 编码向变体 | 开源编码与 Agent 任务活跃 |
| 智谱 | GLM-5.x | 开放权重编码候选之一 |
4. 多模态理解(看、听、读长材料)
这里要区分两类能力:
- 理解型多模态:输入图像/音频/视频,输出文本分析;
- 生成型多模态:输出图像、视频、语音(见后文)。
Google Gemini 系长期把「原生多模态 + 长上下文」当作主叙事;OpenAI、Anthropic 等也在视觉理解与文档理解上持续加码。实际使用中,瓶颈经常不是「能不能看图」,而是:
- 图表数字是否读准;
- 长 PDF 是否真的「读完」而不是局部抽样;
- 视频时序事件是否稳定。
当前代表性模型:
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| Google DeepMind | Gemini 3.7 Flash、Gemini 3.1 / 3.5 Pro | 原生多模态 + 超长上下文的标杆叙事 |
| OpenAI | GPT-5.6 系列(视觉输入) | 图文理解与工具链结合紧 |
| Anthropic | Claude Opus 5 / Fable 5 / Sonnet 5(读图) | 文档、图表、长材料理解强 |
| xAI | Grok 4.6(图文) | 多模态输入 + 实时信息产品差异 |
| 阿里(通义) | Qwen3.5 / 3.8 VL 等 | 开放权重视觉—语言活跃 |
| 月之暗面 | Kimi K3(文/图/视频理解向) | 长材料与多模态理解并存 |
| Meta | Llama 4(Scout / Maverick 等) | 原生多模态开放权重 |
5. 图像生成
图像赛道相对独立,用户心智也更接近「创意工具」而非「智商榜」。
当前代表性模型:
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| OpenAI | GPT Image 2(/ 2.0) | 综合遵循、文字渲染、多轮编辑讨论多 |
| Midjourney | Midjourney V8.x(如 V8.1 / V8.2) | 美学与风格辨识度标杆;偏平台封闭 |
| Black Forest Labs | FLUX.2(Pro / Flex / Max / Dev / Klein) | API + 部分开放权重;写实与可控强 |
| Imagen 4;Gemini 图像能力(如 Nano Banana 等产品名) | 产品照片、干净合成常见 | |
| Ideogram | Ideogram 4.0 | 海报/排版文字见长 |
| Recraft | Recraft V4.x | 设计向、矢量/品牌风格 |
| Stability AI | Stable Diffusion 3.5 等 | 开源工作流与本地生态 |
| 字节等 | Seedream 4.x 等 | 多语文字与商业设计向讨论多 |
6. 视频生成
视频比图像难一个数量级:要处理时间一致性、运动物理、镜头语言,越来越多模型还要处理同步音频。
专业工作流越来越不像「一句提示出片」,而像:
关键帧(图像模型)→ 图生视频 → 镜头延长/编辑 → 超分与调色 → 对口型/配音
当前代表性模型:
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| Google DeepMind | Veo 3.1(及 Veo 3) | 画质、物理、原生音频常被点名 |
| Runway | Gen-4 / Gen-4.5 | 创作者控制、镜头与制作工作流 |
| 快手 | Kling 3.0(及 Omni 等) | 时长、运动、口型等存在感强 |
| OpenAI | Sora 2 | 世界一致性/叙事影响大;产品可用性以官方为准 |
| Luma | Dream Machine / Ray 系 | 图生视频与快速迭代常见 |
| Pika | Pika 2.x | 短视频与社交向 |
| 腾讯等 | Hunyuan Video 等 | 开放/可部署视频权重生态之一 |
| 阿里等 | Wan 等 | 开源视频工作流常见选项 |
| MiniMax 等 | Hailuo 等 | 运动与人像向讨论多 |
7. 语音
语音赛道可拆成:
- ASR:语音转文字;
- TTS:文字转语音;
- 实时语音对话:低延迟双工(边听边说)。
它经常作为大模型产品的「接口层」存在:模型可以一般聪明,但语音体验差,产品仍会输。反之,语音体验好,能显著放大一个中等模型的日活。
当前代表性模型 / 服务:
| 公司 | 最新/主力代表 | 类型 | 备注 |
|---|---|---|---|
| OpenAI | GPT Realtime / ChatGPT Voice;OpenAI TTS;Whisper | 实时对话 / TTS / ASR | 消费端语音入口心智强 |
| Chirp / Cloud STT;Gemini Live;Cloud TTS | ASR / 实时 / TTS | 与 Gemini、安卓生态绑定 | |
| ElevenLabs | ElevenLabs TTS / 多语语音模型 | TTS 为主 | 音色与配音工业常用 |
| Cartesia、PlayHT 等 | 各家新一代 TTS | TTS | 低延迟语音合成赛道 |
| Anthropic 等 | 产品内语音能力(随代际变化) | 实时/接口 | 多作为助手入口而非独立 TTS 品牌 |
| 开源侧 | Whisper 系、FunASR、CosyVoice 等 | ASR / TTS | 本地与私有化常见 |
8. 嵌入(Embedding)与检索
做 RAG(检索增强生成)、语义搜索、推荐时,用的往往不是旗舰聊天模型,而是:
- embedding 模型(把文本/图变成向量);
- 重排序(rerank)模型;
- 向量数据库与分块策略。
这个赛道很少上热搜,却决定很多「企业知识库机器人」的上限。聊天模型再强,检索不准,一样一本正经地胡说。
当前代表性模型:
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| OpenAI | text-embedding-3-large / 3-small | 通用 RAG 默认选项之一 |
| Cohere | embed-v4 / embed 系列;Rerank 系列 | 检索 + 重排产品线完整 |
| Voyage AI | voyage-3 / voyage-code 等 | 高质量检索与代码嵌入常见 |
| gemini-embedding / text-embedding 系列 | 与 Google 云检索栈搭配 | |
| 智源 / BAAI 等 | bge-m3、bge-reranker 等 | 开源多语检索事实标准之一 |
| Jina AI | jina-embeddings-v3 等 | 长文本与多语嵌入 |
| 阿里等 | GTE / Qwen 嵌入系列 | 中文与开源检索常用 |
| NVIDIA 等 | NV-Embed 等 | 开源高分嵌入之一 |
9. 开放权重:并重视角下的「另一条主线」
开放权重不是闭源的廉价复制,而是另一套工业:
- 可复现与可研究;
- 可自托管与私有化;
- 可蒸馏、可微调、可做领域模型;
- 可用竞争把 API 价格打下来。
2025–2026 的开放权重前沿,常见讨论对象包括:DeepSeek、Qwen、Llama、Kimi、Mistral、GLM 等家族。竞争非常激烈,且某一周的第一名几乎没有长期意义。
读开放权重时,需要额外看三列:
- 许可(MIT / Apache / 自定义限制);
- 是否真能在自己的硬件上跑(显存、量化、推理引擎);
- 官方 API 与「可下载权重」是不是同一个 checkpoint。
当前代表性模型(可下载权重向):
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| DeepSeek | DeepSeek V4 Pro / V4 Flash(MIT 等) | 前沿级开放权重 + 极致性价比叙事 |
| 阿里(通义) | Qwen3.8(含 27B 等)、Qwen3.8-Max 权重变体 | 开放最活跃家族之一;注意 Max 许可 |
| 月之暗面 | Kimi K3(开放权重) | 前沿编码/Agent;体量巨大,自托管门槛高 |
| Meta | Llama 4 Scout / Maverick | 生态广;超长上下文(Scout);社区许可有条件 |
| Mistral | Mistral Large 3、Small 4 等 | 欧洲开放权重;偏友好许可 |
| 智谱 | GLM-5 / GLM-5.x | MIT 等宽松许可常被点名 |
| Gemma 4 系列 | 端侧到中尺寸本地很强 | |
| OpenAI | gpt-oss 等开放权重尝试(若仍在流通) | 闭源巨头偶发开放线,需核验代际 |
| Microsoft | Phi-4 / Phi-4-Mini 等 | 小模型效率路线 |
10. 小模型与端侧(简短)
端侧 / 小模型的目标通常不是登顶 Arena,而是:
- 隐私与离线;
- 手机 / PC 本地;
- 极低成本的高并发;
- 作为大模型前面的路由、草稿、分类器。
当前代表性模型:
| 公司 | 最新/主力代表 | 备注 |
|---|---|---|
| Gemma 4(E2B–31B 等档) | 笔记本/消费级 GPU 友好 | |
| Microsoft | Phi-4-Mini 等 | 极紧显存下的长上下文余量 |
| Meta | Llama 3.2 / Llama 4 小尺寸变体 | 端侧与边缘部署常见 |
| 阿里(通义) | Qwen3 / 3.8 小尺寸稠密档(如数 B–27B) | 本地编码与通用很强 |
| Apple 等 | 端侧基础模型(随系统代际) | 系统内建、隐私向 |
| Black Forest Labs | FLUX.2 Klein(4B/9B) | 图像侧的「端侧/消费级」对照 |
Gemma、Phi、各类 1B–14B 级模型、以及更小的专用头,都属于这张地图的边缘但必要区域:不是最炫,但很脏很累的活往往靠它们。
五、榜单科普:它们是什么,测什么,怎么读
大多数人不是不知道「有榜单」,而是不知道榜单之间不可互换。下面按「最常碰到的类型」做客观罗列
1. 人类偏好类:LMArena(原 LMSYS Chatbot Arena)
它是什么:
匿名两两对比,真人投票「哪边回复更好」,用 Elo 等机制排名。
它测什么:
真实对话场景下的综合观感——文风、有用性、礼貌、一定程度的正确性,但不是严格学科考试。
它适合回答:
「大家聊起来更喜欢谁?」
它不保证:
数学证明一定对、代码一定能合并进生产、长代理任务一定能完成。
2. 综合能力指数类:Artificial Analysis 等
它是什么:
第三方把多个基准、速度、价格等放到同一套框架里,给出 Intelligence Index、Agentic Index 等。
它测什么:
试图回答「综合智能 / 性价比 / 速度」这种更工程化的问题。
注意:
不同指数权重不同;「Max 思考」与「默认思考」也不是同一产品。
3. 知识与考试类:MMLU / MMLU-Pro 等
它是什么:
多学科选择题式知识评测。MMLU 曾是王者指标;后来出现更难的 MMLU-Pro。
现状:
很多前沿模型在经典 MMLU 上已高度饱和,区分度下降,于是社区转向更难、更新的集合。
4. 专家推理类:GPQA(含 Diamond)等
它是什么:
高难度科学问答,强调专家级推理,降低「靠背题」的轻松得分。
它适合回答:
「硬科学问题上的推理是否扎实?」
5. 数学竞赛类:AIME、MATH、各类竞赛集
它测什么:
符号化、多步数学解题。
读法提醒:
推理模型 + 更多测试时算力,会显著抬分;看分数时要看清采样次数、工具是否允许、是否 consensus。
6. 代码类:HumanEval → LiveCodeBench → SWE-bench
这是一条「越来越像真工作」的进化线:
| 榜单/基准 | 大致在测 |
|---|---|
| HumanEval 等 | 短函数生成 |
| LiveCodeBench | 更新题面、降低污染的竞赛/编程题 |
| SWE-bench 系列 | 真实 GitHub issue / 补丁级修复 |
| Frontend / Code Arena 等 | 前端或特定域的人类偏好与任务完成 |
如果你关心「能不能帮我改项目」,SWE-bench 类通常比 HumanEval 更相关——但仍不等于你的代码库。
7. 「人类最后一场考试」类:HLE 等超难综合集
当旧基准被刷满,社区会引入更难、更新、更综合的题集(名称与版本持续变化)。它们的意义主要是:重新制造区分度,而不是给普通用户日常选型。
8. 开放模型专用榜:Hugging Face Open LLM Leaderboard 等
它是什么:
主要服务可下载开放权重模型的可比评测,强调公开、可复现、反污染。
它适合回答:
「在可自托管模型里,谁相对更强?」
闭源 API 模型有时不在同一套规则下直接横比,不必强行一锅炖。
9. 聚合站与新媒体榜:BenchLM、各类「Best LLM 2026」
它们的价值是:把分散基准、价格、上下文、许可汇总成一张表。
它们的风险是:更新频率高、口径不一、标题党容易把快照写成终局。
10. 生成式媒体榜:图像 / 视频的人类偏好与 VBench 等
图像视频领域同样有人类偏好对战、自动化质量基准。和 LLM 一样:好看、可控、可商用、可进入工作流,往往比单一分数更重要。
六、主流榜单前几名解读(约 2026 年 8 月快照)
上一章讲的是「榜单是什么」;这一章看「现在顶上坐着谁」,以及为什么不同榜的前几名并不相同。
先立三条读法:
- 名次是快照,不是终局。 Arena 可能周更,厂商一发版、一调价、一改路由,表就会动。
- 前几名分差往往很小。 Elo 差十几分、指数差 1–2 分,统计上经常落在噪声附近,不必把「第 1 / 第 2」当成质变。
- 换一块表,冠军就可能换人。 这不是榜单「假」,而是它们在测不同东西。
下表综合公开第三方汇总与主流评测站点约 2026 年 8 月 的常见说法;精确小数与当日排序请以官网为准。
1. 人类偏好总榜:LMArena / Arena(原 LMSYS Chatbot Arena)
它在回答: 真人盲测里,聊天回复「更讨喜、更有用」的是谁。
2026 年 8 月,综合文本偏好榜常见前列形态:
| 大致位次 | 模型 | 公司 | 怎么读 |
|---|---|---|---|
| 顶尖档 | Claude Fable 5 / Claude Opus 5 / Opus 4.8 等 | Anthropic | Anthropic 在人类偏好上常占一整条「高原」 |
| 顶尖档 | GPT-5.5 Pro / GPT-5.6 系列 | OpenAI | 与 Claude 同属前沿扎堆区,分差通常很窄 |
| 顶尖档 | Gemini 3.1 Pro 等 | 综合文本常进第一梯队;科学/长上下文子榜更常出彩 | |
| 紧随 | Grok、Qwen Max、Kimi 等 | xAI / 阿里 / 月之暗面 | 已进入「可与闭源前沿同台」的讨论区 |
解读要点:
- 这张榜测的是对话观感
- 2026 年的主旋律不是「一家甩开十条街」,而是 Anthropic / OpenAI / Google(再加几家)挤在很窄的 Elo 带里。
- 同一家族多代同时上榜很常见(Opus 4.8 与 Opus 5、GPT-5.5 与 5.6),说明迭代变密,也说明旧旗舰未必立刻退场。
子榜提醒:
综合文本第 1,不等于编码第 1。公开讨论里,Frontend / Code Arena 等编码子榜上,月之暗面 Kimi K3(开放权重) 曾冲到编码向前列。
2. 综合能力指数:Artificial Analysis Intelligence Index
它在回答: 在同一套第三方框架下,把多类基准(推理、知识、编码等)压成一个「智能指数」,谁更高。
约 2026 年 8 月,公开讨论中的常见前列:
| 大致位次 | 模型 | 公司 | 指数量级(示意) | 怎么读 |
|---|---|---|---|---|
| 1 | Claude Opus 5(Max / 高思考档) | Anthropic | ~63 | 综合指数上常居榜首 |
| 2 | Claude Fable 5 | Anthropic | ~62 | 名义旗舰;与 Opus 分差极小,且可能含策略/回退设定 |
| 3 | GPT-5.6 Sol(高思考档) | OpenAI | ~61 | 非 Anthropic 阵营最强挑战者之一 |
| 4 | Kimi K3 | 月之暗面 | ~60 | 开放权重逼近闭源前沿的强信号 |
| 5–6 | Qwen3.8 Max、Grok 4.x 等 | 阿里 / xAI | ~56–58 | 性价比与产品差异开始进入「前排叙事」 |
解读要点:
- 顶部分数 61–63 这种间距,更像「同一重量级」,不像「代差」。
- 名义最贵 / 名义旗舰 ≠ 指数第一:Fable 定价与品牌往往更「旗舰」,但指数上 Opus 5 反而更常领先
- Kimi K3 能进前四附近,说明开放权重已不只是「便宜替代」,而是能在综合指数里占位。
和 Arena 对照:
Arena 偏「聊起来舒不舒服」;AA Index 偏「一堆硬题加权后强不强」。两者前列重叠(都是 Claude / GPT),但具体第几、谁压谁经常不一致——这是正常的。
3. 软件工程:SWE-bench Verified vs SWE-bench Pro
它在回答: 模型(通常还要加 Agent 脚手架)能不能在真实软件问题上给出可验证修复。
SWE-bench Verified(相对更「老」、更高分、更易饱和)
约 2026 年 8 月,公开汇总里常见前列形态:
| 大致位次 | 模型 | 公司 | 分数量级(示意) |
|---|---|---|---|
| 前列胶着 | DeepSeek V4 Pro、GPT-5.6 Sol、Claude Opus 5 | DeepSeek / OpenAI / Anthropic | ~95%–96%+ |
| 紧随 | Grok 4.6、Claude Fable / Mythos、Kimi K3 等 | xAI / Anthropic / 月之暗面 | ~93%–96% |
解读: Verified 顶部已经挤成一团。差 0.2–1 个百分点,很难单独拿来宣布「编码之王」;更说明前沿模型在「标准软件修复题」上整体变强,区分度在下降。
SWE-bench Pro(更难、区分度通常更好)
约同期公开讨论中的常见形态:
| 大致位次 | 模型 | 公司 | 分数量级(示意) |
|---|---|---|---|
| 1–3 | Claude Mythos 5、Claude Fable 5、Claude Opus 5 | Anthropic | ~79%–80%+ |
| 其后 | GPT-5.x、Kimi、DeepSeek 等 | 各家 | 低于 Claude 顶档 |
解读要点:
- Verified 上 DeepSeek/GPT 能贴脸,Pro 上 Anthropic 常更整洁地占住前排
- 分数高度依赖 scaffold(脚手架):官方演示、第三方统一 harness、本地的 IDE Agent,三者不必同序。
- Mythos 一类若属受限访问,榜上第一不等于人人可调用的第一。
4. 图像:Artificial Analysis Text-to-Image Arena 等
它在回答: 盲测里,文生图结果「更好看/更符合提示」的是谁。
约 2026 年 8 月,Image Arena 常见前列:
| 大致位次 | 模型 | 公司 | 怎么读 |
|---|---|---|---|
| 1 | GPT Image 2(high) | OpenAI | 综合盲测常处明显领先档 |
| 2–3 | Reve 2.1;Nano Banana 2(Gemini 图像) | Reve / Google | 紧追第一梯队 |
| 前列 | GPT Image 1.5、MAI-Image 等 | OpenAI / Microsoft | 证明图像赛道已多强并存 |
| 开放权重前列 | Ideogram 4.0、FLUX.2 [dev] 等 | Ideogram / Black Forest Labs | 「可下载/可自托管」另一条线 |
| 美学心智 | Midjourney V8.x | Midjourney | Arena 名次未必最高,但创作者心智仍极强 |
解读要点:
- 图像榜的「第一」更偏综合偏好 + 提示遵循;Midjourney 仍可能是很多人的「最好看」,两者不矛盾。
- FLUX / Ideogram 的价值经常在 API、开放权重、商用工作流,不必用总榜名次否定它们。
七、结语:地图的用法
AI 模型层出不穷,并不意味着需要追每一条新闻。更有效的姿态是:
- 用赛道看世界,而不是用单一冠军看世界;
- 用演进理解一家公司,而不是用一个型号理解一家公司;
- 用多种榜单交叉验证,而不是用一张截图下结论;
- 把「开源 vs 闭源」「参数大小」从信仰降级为工程约束。
行业还会继续快迭代。型号会过时,坐标轴 provably 更耐用:公司、赛道、开放度、工具链、成本、证据类型。把这六项盯住,你就已经比大多数「每周换信仰」的讨论,清醒得多。
更多推荐



所有评论(0)