模型图鉴是 AI 模型选型助手——展示 58 个全球主流 AI 模型的数据,帮你找到最适合的模型。
提供「热度」和「智能」两个维度的场景推荐,详情页展示综合评分、定价和推荐标签,对比页支持多模型并排比较。
发现错误或想补充模型?欢迎提交 GitHub Issues。
从 Artificial Analysis 全球模型中按三档条件筛选:Large 尺寸、前沿标杆、或智能分≥30(补回高性价比中小模型),同系列旧代自动排除。活跃集默认保留 180 天内发布的模型。注入 Arena 排行榜与 OpenRouter 热度数据,按智能分统一排名。
Artificial Analysis
Artificial Analysis 是权威大模型评测机构,提供标准化基准测试,其 Intelligence Index 综合 MMLU、HumanEval、MATH 等基准,评估推理、编程和数学能力。
OpenRouter
全球最大 LLM API 路由平台,提供统一 API 访问,每周公布各模型 Token 消耗排名。本站采集其公开的周度消耗排名和 API 定价,消耗量反映真实热度,定价反映市场行情。
模型官网
从各模型官网获取官方定价,详情页同时展示官价与 OpenRouter 定价,列表页统一用 OpenRouter 价格便于横向对比,每周更新。
Arena
lmarena.ai(原 Chatbot Arena)是全球最大的众测 LLM 排行榜,基于真人盲测投票生成 ELO 分数。本站采集其文本对话、编程和视觉三榜数据,作为第三方真实使用体验的参考。
下图鉴中的核心指标含义如下,帮助你更快理解模型能力。
综合智能
综合智能:Artificial Analysis 综合智能指数,整合 MMLU、HumanEval、MATH 等基准,0-100 分。
编程
编程能力:基于代码生成与理解任务的专项评分,0-100 分。
Agent能力
Agent 能力:评估模型在多步骤任务、工具调用与自主执行上的表现,0-100 分。
速度 (TPS)
速度:中位 TPS(每秒 token 数)、首 Token 延迟与端到端延迟,反映推理响应速度。
价格
价格:混合价 = 输入价×75% + 输出价×25%;列表页默认使用 OpenRouter 价格便于横向对比。
Arena 排名
Arena:lmarena.ai 真人盲测 ELO 分数与投票数,反映真实使用体验。
数据完整度
数据完整度:基于 18 个核心字段的加权评分,越接近 100% 表示数据越完整。
为了保证榜单的实用性与可比性,当前收录规则如下:
最近一次数据刷新中,各数据源在收录模型上的覆盖情况:
覆盖率 = 该数据源有值的模型数 / 总收录模型数。部分新模型或闭源模型可能暂缺 Arena/OpenRouter 数据。
2026-08-04 数据刷新,共收录 68 个模型。
本图鉴仅供参考,不构成投资或使用建议。模型性能因场景而异,实际体验可能与数据有差异。