鱼C论坛

 找回密码
 立即注册
查看: 21|回复: 1

[最新资讯] 同一个Claude,为什么从30分突然变成了满分?

[复制链接]
发表于 7 小时前 | 显示全部楼层 |阅读模式

马上注册,结交更多好友,享用更多功能^_^

您需要 登录 才可以下载或查看,没有账号?立即注册

x
英伟达最近公布了一项很有意思的实验。

他们使用 Claude Opus 5 挑战 ARC-AGI-3。

这个测试不是让 AI 背知识,而是把它扔进陌生环境,要求它自己观察规则、尝试操作,并完成一系列以前没见过的任务。

Claude 单独上场时,只完成了大约 30%。

FishC_agentic-ai-visual-cybersecurity-avo-1-1536x864.png

但英伟达在模型外面加上持续记忆、工具调用、环境探索和监督模块后,系统在公开测试集的 183 个关卡中全部通过。

换句话说,模型还是那个模型,真正发生变化的是它身上的 “装备”。

当然,这个 100% 只是英伟达在公开任务上的自测结果,隐藏测试表现如何还不知道。

不过它至少说明了一件事:未来智能体之间的差距,可能不完全取决于谁家的模型更聪明,还取决于谁能给模型配上一套更好的记忆、工具和工作流程。

这就像同一个人,赤手空拳去工地和开着挖掘机去工地,工作效率显然不是一个级别。

那么问题来了:以后我们应该只比较大模型本身,还是要比较 “模型+工具+记忆” 的完整系统?


小甲鱼最新课程 -> https://ilovefishc.com
回复

使用道具 举报

发表于 7 小时前 | 显示全部楼层
这个问题问得很好,答案其实就藏在英伟达的实验里。

单独看模型,Claude 确实只拿了 30 分;但给它配上记忆、工具、探索和监督模块后,它就能拿下 100%。模型本身没有变,变的是它身处的系统。

这就像同一个工人,徒手搬砖和开挖掘机,结果当然天差地别。未来的竞争,已经不只是“谁的模型更聪明”,而是“谁能把模型、工具、记忆和工作流组合得更好”。

所以,我们以后不应该只比较“裸模型”,而是要比较“模型+工具+记忆+流程”组成的完整系统。模型是大脑,但大脑也需要手脚、记事本和操作规范,才能真的干活。

换句话说:模型决定下限,系统决定上限。以后看智能体,别只看它脑子好不好,还得看它身上挂了什么装备。

以上回复来自 FishC AI 小助理,如未能正确解答您的问题,请继续追问。
小甲鱼最新课程 -> https://ilovefishc.com
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

小黑屋|手机版|Archiver|鱼C工作室 ( 粤ICP备18085999号-1 | 粤公网安备 44051102000585号)

GMT+8, 2026-8-23 12:11

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表