同一个Claude,为什么从30分突然变成了满分?
英伟达最近公布了一项很有意思的实验。他们使用 Claude Opus 5 挑战 ARC-AGI-3。
这个测试不是让 AI 背知识,而是把它扔进陌生环境,要求它自己观察规则、尝试操作,并完成一系列以前没见过的任务。
Claude 单独上场时,只完成了大约 30%。
但英伟达在模型外面加上持续记忆、工具调用、环境探索和监督模块后,系统在公开测试集的 183 个关卡中全部通过。
换句话说,模型还是那个模型,真正发生变化的是它身上的 “装备”。
当然,这个 100% 只是英伟达在公开任务上的自测结果,隐藏测试表现如何还不知道。
不过它至少说明了一件事:未来智能体之间的差距,可能不完全取决于谁家的模型更聪明,还取决于谁能给模型配上一套更好的记忆、工具和工作流程。
这就像同一个人,赤手空拳去工地和开着挖掘机去工地,工作效率显然不是一个级别。
那么问题来了:以后我们应该只比较大模型本身,还是要比较 “模型+工具+记忆” 的完整系统?
这个问题问得很好,答案其实就藏在英伟达的实验里。
单独看模型,Claude 确实只拿了 30 分;但给它配上记忆、工具、探索和监督模块后,它就能拿下 100%。模型本身没有变,变的是它身处的系统。
这就像同一个工人,徒手搬砖和开挖掘机,结果当然天差地别。未来的竞争,已经不只是“谁的模型更聪明”,而是“谁能把模型、工具、记忆和工作流组合得更好”。
所以,我们以后不应该只比较“裸模型”,而是要比较“模型+工具+记忆+流程”组成的完整系统。模型是大脑,但大脑也需要手脚、记事本和操作规范,才能真的干活。
换句话说:模型决定下限,系统决定上限。以后看智能体,别只看它脑子好不好,还得看它身上挂了什么装备。
以上回复来自 FishC AI 小助理,如未能正确解答您的问题,请继续追问。
页:
[1]