MazeBench基准测试发布:最强模型得分仅13%

MazeBench是一个规模庞大的开放世界基准测试,外形酷似错综复杂的三维迷宫,专为评估AI智能体在长时间运行的代理循环中的综合能力而设计。该基准测试的核心在于考察智能体能否具备足够的视觉空间推理能力,不仅要感知周围环境,还要制定并执行复杂的行动计划。

MazeBench在整个世界中嵌入了大量推箱子(Sokoban)风格的解谜关卡。箱子形状各异、大小不一,智能体必须正确理解其结构,才能规划出如何加以利用。这些谜题往往需要超过一百步的长远规划,要求智能体将箱子作为工具,开辟新通道,进入迷宫的更大区域。

此外,MazeBench还引入了多种简单机制,包括电梯砖块、可切换墙壁以及冰面斜坡,旨在促使智能体进行真正意义上的三维立体思考。

开发团队在200余个房间中设置了艰巨挑战。所有谜题均经过内部测试并已验证可解,但开发者刻意不设难度上限。房间按课程式结构排列,最极端的谜题位于最深处,但即便是入门关卡,难度也会以极快速度攀升。


注:以上成绩均为启用Python条件下取得。不启用Python时,所有模型得分均低于1%。并且由于成本原因,Fable 5的部分运行未能完成,其实际能力可能比当前成绩所呈现的更强。

禁用Python时,智能体无法依赖求解算法,所有模型得分均低于1%。:。值得一提的是,人类玩家无需Python辅助即可通关。

启用Python时,编程智能体可编写并执行Python程序来模拟游戏物理规则,从而大幅降低长期规划的负担。前沿编程智能体能够轻松对游戏进行逆向工程,生成求解算法。即便如此,当前最先进模型的最高得分也仅为13%。

Fable 5与GPT-5.6风格迥异。Fable 5视野更广、探索欲更强,懂得将难题留待后续,优先攻克容易的谜题。它探索房间的速度快于GPT-5.6,但收集第一颗宝石的时间却晚于后者。理想的智能体应当二者兼具:该探索时探索,发现宝石时果断出手,遇到难题时懂得适时放弃。

在OpenAI系列中,GPT-5.6 Sol远超GPT-5.6 Terra。Sol能够挑战高强度谜题且几近成功,而Terra仍在挣扎于如何将箱子推入洞中。更小的Luna甚至难以理解掉入洞中是坏事这一基本概念。

在Anthropic系列中,Sonnet 4.6是同级别中表现最佳的模型。Sonnet 5经过多次测试,但始终无法超越Sonnet 4.6。较小的Anthropic模型同样表现出比大型模型更低的创造力。

10 个赞

这个视觉空间推理啥的应该是现在这批大模型最拉跨的能力方面了吧

4 个赞

有没有一种可能,眼睛这个器官(视觉)并不好用,根据不同场景长出/换个新的器官(激光 3D 扫描)应该会简单很多 :thinking:

1 个赞

感觉这种BENCH没啥用啊,主要对生产环境不构成任何建议

3 个赞

没有任何区别。视觉模型和三维模型最终都会映射成到语义空间中变成token,然后输入到模型中。


一定程度上展示模型的思考能力

2 个赞

真的吗 我去看了下blog 感觉要是困难点怕不是那么容易通关的 :distorted_face:

而且我更偏向于 此bench没能做到更好的输入,以让AI完全理解Goal, 当然这本身也其实应该由模型自己理解并完成, 如果要宣告AGI 我认为模型自己处理input/output是基础, 并且能在 Any Random Bench得到超过人类平均分才是AGI的真正宣告点

感觉跟涌现一样在赌,随着不同测试面能力的提升,某个时候就能泛化出通用能力
毕竟不管是什么题,只要有解,如果 AGI 实现了应该都能解决,大概? :thinking:

视觉输入杂乱无章,人类自己都没玩明白(指深度学习出现之前识别正确率提升缓慢),最后只能力大砖飞(神经网络, 大量数据)
如果缩小到特定领域,最起码数据集和测试集好搞了,RL 一下成绩提升飞快

1 个赞

如果能在这方面接近100%,估计机器人才能开始进入大规模商用

现有架构感觉难,训练参数堆高了带来的提升越来越不显著,而且上下文是个问题

堆参数上 T 后感觉确实到头了,再堆现有硬件成本下商业化困难,随着规模的提升训练语料感觉也不太够了。
后训练看上去还有提升空间(d4f-0731, glm-5.3),如果和代码一样能找到一种可以快速造大量数据,且方便验证结果的途径,视觉能力应该进步也会很快
如果当下没有这种途径,为啥大伙不试试抛弃现有器官,长出更合适(更好训练)的新器官呢 :thinking:

把社会改造成适合AI大人进化的样子吧 :tieba_025:

然而llm本身就是力大砖飞的代表。

且在深度学习出现之前,cv的发展和应用是好于nlp的。但是从resnet到vit,性能并没有出现很大的跃升。

我觉得根本问题还是数据集的量太少了,而且训练十分困难。现在最大的视觉数据集也就是10B级别。但是Llama 3时期的语料数据集就超过15T tokens了,三个数量级的差距。

并且llm和wfm要学的东西还不一样,llm本质上学习的是语言以及一切能用语言表达的知识,wfm学的是世界规律,后者是更大的范围。

而且直到目前,cv还没有scaling law。

1 个赞

世界模型感觉也不能完全解决这个问题,不知道为啥都去死磕这个了


难道没有根骨(视觉)就不能感受法则(世界规律),成就无上道基(AGI)了吗 :zany_face:

简单结论:sonnet5是区,安全魔怔了,偏偏能力不上不下,任务完成不明又嘴硬

1 个赞

是的,完全就是一坨垃圾,sonnet系列中最差的一代模型。即使降价在同价位的模型下也是又慢又贵又难用。

1 个赞

啥是wfm?佬能说明一下吗?。。

并且由于成本原因,Fable 5的部分运行未能完成,其实际能力可能比当前成绩所呈现的更强。
这是认真的评测吗?还是伸手要A畜给赞助?

2 个赞

World Foundation Model 世界基础模型