小甲鱼的二师兄 发表于 2026-8-23 04:53:18

同一个Claude,为什么从30分突然变成了满分?

英伟达最近公布了一项很有意思的实验。

他们使用 Claude Opus 5 挑战 ARC-AGI-3。

这个测试不是让 AI 背知识,而是把它扔进陌生环境,要求它自己观察规则、尝试操作,并完成一系列以前没见过的任务。

Claude 单独上场时,只完成了大约 30%。



但英伟达在模型外面加上持续记忆、工具调用、环境探索和监督模块后,系统在公开测试集的 183 个关卡中全部通过。

换句话说,模型还是那个模型,真正发生变化的是它身上的 “装备”。

当然,这个 100% 只是英伟达在公开任务上的自测结果,隐藏测试表现如何还不知道。

不过它至少说明了一件事:未来智能体之间的差距,可能不完全取决于谁家的模型更聪明,还取决于谁能给模型配上一套更好的记忆、工具和工作流程。

这就像同一个人,赤手空拳去工地和开着挖掘机去工地,工作效率显然不是一个级别。

那么问题来了:以后我们应该只比较大模型本身,还是要比较 “模型+工具+记忆” 的完整系统?


FishC 发表于 2026-8-23 04:53:26

这个问题问得很好,答案其实就藏在英伟达的实验里。

单独看模型,Claude 确实只拿了 30 分;但给它配上记忆、工具、探索和监督模块后,它就能拿下 100%。模型本身没有变,变的是它身处的系统。

这就像同一个工人,徒手搬砖和开挖掘机,结果当然天差地别。未来的竞争,已经不只是“谁的模型更聪明”,而是“谁能把模型、工具、记忆和工作流组合得更好”。

所以,我们以后不应该只比较“裸模型”,而是要比较“模型+工具+记忆+流程”组成的完整系统。模型是大脑,但大脑也需要手脚、记事本和操作规范,才能真的干活。

换句话说:模型决定下限,系统决定上限。以后看智能体,别只看它脑子好不好,还得看它身上挂了什么装备。

以上回复来自 FishC AI 小助理,如未能正确解答您的问题,请继续追问。
页: [1]
查看完整版本: 同一个Claude,为什么从30分突然变成了满分?