返回首页

关于模型图鉴

项目定位

模型图鉴是 AI 模型选型助手——展示 58 个全球主流 AI 模型的数据,帮你找到最适合的模型。

提供「热度」和「智能」两个维度的场景推荐,详情页展示综合评分、定价和推荐标签,对比页支持多模型并排比较。

发现错误或想补充模型?欢迎提交 GitHub Issues

数据来源

从 Artificial Analysis 全球模型中按三档条件筛选:Large 尺寸、前沿标杆、或智能分≥30(补回高性价比中小模型),同系列旧代自动排除。活跃集默认保留 180 天内发布的模型。注入 Arena 排行榜与 OpenRouter 热度数据,按智能分统一排名。

数据定期更新数据更新于: 2026/08/04 09:11

Artificial Analysis

Artificial Analysis 是权威大模型评测机构,提供标准化基准测试,其 Intelligence Index 综合 MMLU、HumanEval、MATH 等基准,评估推理、编程和数学能力。

OpenRouter

全球最大 LLM API 路由平台,提供统一 API 访问,每周公布各模型 Token 消耗排名。本站采集其公开的周度消耗排名和 API 定价,消耗量反映真实热度,定价反映市场行情。

模型官网

从各模型官网获取官方定价,详情页同时展示官价与 OpenRouter 定价,列表页统一用 OpenRouter 价格便于横向对比,每周更新。

Arena

lmarena.ai(原 Chatbot Arena)是全球最大的众测 LLM 排行榜,基于真人盲测投票生成 ELO 分数。本站采集其文本对话、编程和视觉三榜数据,作为第三方真实使用体验的参考。

字段说明

下图鉴中的核心指标含义如下,帮助你更快理解模型能力。

综合智能

综合智能:Artificial Analysis 综合智能指数,整合 MMLU、HumanEval、MATH 等基准,0-100 分。

编程

编程能力:基于代码生成与理解任务的专项评分,0-100 分。

Agent能力

Agent 能力:评估模型在多步骤任务、工具调用与自主执行上的表现,0-100 分。

速度 (TPS)

速度:中位 TPS(每秒 token 数)、首 Token 延迟与端到端延迟,反映推理响应速度。

价格

价格:混合价 = 输入价×75% + 输出价×25%;列表页默认使用 OpenRouter 价格便于横向对比。

Arena 排名

Arena:lmarena.ai 真人盲测 ELO 分数与投票数,反映真实使用体验。

数据完整度

数据完整度:基于 18 个核心字段的加权评分,越接近 100% 表示数据越完整。

收录标准

为了保证榜单的实用性与可比性,当前收录规则如下:

  • 1规模门槛:从 Artificial Analysis 全球模型中筛选 Large 尺寸、前沿标杆或智能分≥30 的高性价比模型。
  • 2时效门槛:活跃集默认保留 180 天内发布的模型,同系列旧代会定期下线。
  • 3去重规则:同系列同子组仅保留智能分最高的版本,避免列表冗余。

数据来源覆盖度

最近一次数据刷新中,各数据源在收录模型上的覆盖情况:

Artificial Analysis99%
OpenRouter60%
Arena56%

覆盖率 = 该数据源有值的模型数 / 总收录模型数。部分新模型或闭源模型可能暂缺 Arena/OpenRouter 数据。

最近更新

2026-08-04 数据刷新,共收录 68 个模型。

  • 🆕Qwen3.8 Max — 智商 53 · 46 TPS · $2/M
  • 💰Hy3-preview — 输出价 $0.235→$0.21 (-11%)
  • 💰Grok 4.20 0309 v2 — 输入价 $2→$1.25 (-37%)
  • 💰Grok 4.20 0309 v2 — 输出价 $6→$2.5 (-58%)
  • 💰Inkling — 输入价 $1.87→$1 (-46%)
  • 💰Inkling — 输出价 $4.68→$4.05 (-13%)

本图鉴仅供参考,不构成投资或使用建议。模型性能因场景而异,实际体验可能与数据有差异。