最新大模型实力排行!
本帖最后由 中英文泡椒 于 2026-8-11 20:01 编辑大模型圈动作不断:Claude Opus 5 发布、DeepSeek V4 Flash 更新、Kimi K3 冲击第一梯队……各家实力如何?最新排行榜,直接看图。
综合智能指数
涵盖 GDPval、Terminal-Bench、SciCode、Humanity's Last Exam 等 9 项评测的综合智力分:
Claude Opus 5 断层第一(60.69),Anthropic 包揽冠亚军。GPT-5.6 Sol 第三,Kimi K3 冲到第四,DeepSeek V4 Flash 排第 13 但分数
紧咬前十。
智能 vs 成本:性价比之王
横轴是智能分,纵轴是每次任务成本(美元),越靠近左上角越香:
DeepSeek V4 Flash 成本仅 $0.027/任务,是 Claude Opus 5 的 1/86。虽然智能分有差距,但在这个价位上几乎没有对手。MiniMax-M3 同样亮
眼,智能中等但价格低。
Agentic 智能体能力
衡量模型自主拆解任务、调用工具、完成复杂流程的实战能力:
Claude Opus 5 第一(55.26),GPT-5.6 Sol 紧随其后仅差 1.26 分。、DeepSeek V4 Flash 排第 9,结合 $0.027 的价格——做 Agent 任务性价
比无敌。Kimi K3 排第 4,国产 Agent 天花板。
输出速度排行
每秒输出 token 数,数字越大越流畅:
emini 3.6 Flash 以 215 tok/s 登顶,GLM-5.2 速度排第 4 且智能也在前十,智谱综合表现均衡。Claude Opus 5 智能最强但速度只有 55 tok/s。
国外Claude,国内DeepSeek和kimi
页:
[1]