CMU教授开源Agent框架Motus,多模型编排SWE-bench跑到79%且成本减半

卡内基梅隆大学计算机科学系教授 Dimitrios Skarlatos(CEO)和 Zhihao Jia(CTO)创办的 AI 基础设施公司 Lithos AI 开源了 Agent 服务框架 Motus,Apache 2.0 许可证。团队由 CMU 和斯坦福研究人员组成,成员有 AWS、谷歌、Meta 和英伟达的生产基础设施经验。

Motus 的核心思路:不同任务适合不同模型,与其始终用最贵的前沿模型跑所有步骤,不如让系统从生产运行的轨迹中学习,自动把不同子任务路由到最合适的模型。当前 Agent 部署后是静态的,提示框架、模型和上下文策略固定不变,Motus 则从每次运行中提取任务成功率、延迟和成本信号,持续优化。

据 Lithos AI 官网数据,在 SWE-bench Verified 上,Motus 多模型编排达到 79% 准确率,高于 Claude Opus 4.6 的 75.8% 和 GPT-5.3-Codex 的 72.6%,成本不到单用 Opus 的一半。在 Terminal-Bench 2.0 上,准确率从 Opus 的 64% 提至 80.1%,成本同样约减半。框架还会根据具体工作负载调整上下文记忆策略,并自动检测可并行执行的步骤来降低延迟。

13 个赞

这个idea我在使用中也想到了, 一直在找没有人(LLM公司)可以实现

3 个赞

通俗易懂就是在不断的运行中自我学习是把,这样子理解

1 个赞

是的生产环境中收集每运行的痕迹,任务成功,失败、延迟、成本、工具使用效果等然后自动优化

梦中情校精神母校 CMU,大学期间正儿八经刷过的两门公开课 15213 和 15445 都是 CMU 的

2 个赞

meta-harness 那篇论文也是这样 让模型读trace进化harness

1 个赞

感谢分享! 等下就可以去围观一下这个repo了
好奇这种实际跑分的时候 如何避免测试集没有被之前自进化的内容影响到

可是这个概念早就有了吧,好像上年就有了呀..

这次是新品装旧酒还是有啥创新呢?

有落地工程么 :kissing_face_with_smiling_eyes:,高低得去看看,之前研究了几天meta-herness自己搞了个项目,发现个人实在是难搞定工程落地,直接参考团队的得了 :laughing: