中英文泡椒 发表于 2026-8-11 16:17:35

最新大模型实力排行!

本帖最后由 中英文泡椒 于 2026-8-11 20:01 编辑

大模型圈动作不断:Claude Opus 5 发布、DeepSeek V4 Flash 更新、Kimi K3 冲击第一梯队……各家实力如何?最新排行榜,直接看图。

综合智能指数

涵盖 GDPval、Terminal-Bench、SciCode、Humanity's Last Exam 等 9 项评测的综合智力分:



Claude Opus 5 断层第一(60.69),Anthropic 包揽冠亚军。GPT-5.6 Sol 第三,Kimi K3 冲到第四,DeepSeek V4 Flash 排第 13 但分数

紧咬前十。


智能 vs 成本:性价比之王

横轴是智能分,纵轴是每次任务成本(美元),越靠近左上角越香:



DeepSeek V4 Flash 成本仅 $0.027/任务,是 Claude Opus 5 的 1/86。虽然智能分有差距,但在这个价位上几乎没有对手。MiniMax-M3 同样亮

眼,智能中等但价格低。


Agentic 智能体能力

衡量模型自主拆解任务、调用工具、完成复杂流程的实战能力:



Claude Opus 5 第一(55.26),GPT-5.6 Sol 紧随其后仅差 1.26 分。、DeepSeek V4 Flash 排第 9,结合 $0.027 的价格——做 Agent 任务性价

比无敌。Kimi K3 排第 4,国产 Agent 天花板。


输出速度排行

每秒输出 token 数,数字越大越流畅:



emini 3.6 Flash 以 215 tok/s 登顶,GLM-5.2 速度排第 4 且智能也在前十,智谱综合表现均衡。Claude Opus 5 智能最强但速度只有 55 tok/s。

时光不老 发表于 2026-8-12 10:22:45

国外Claude,国内DeepSeek和kimi
页: [1]
查看完整版本: 最新大模型实力排行!