阿里实验研究:使用AI智能体花了233天!维护100个代码库!考的是经过8个月演变,代码还能不能跑。

结果是:75%的模型越维护越乱,最后把本来能跑的代码搞崩了。
只有ClaudeOpus保持了一半以上的零退化率,其他全凉


13 个赞

Paper: SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

虽然这有点不太礼貌
但我觉得纯是 iFlow CLI 太烂 :distorted_face:

不过评测结果挺符合大家的印象
Qwen Max 真的烂

图 4: SWE-CI 上 8 家供应商的最先进模型的 EvoScore 变体

图 6: 所有模型按零回归率从小到大排序

水论文 +1 :winking_face_with_tongue:

7 个赞

克劳德宣传片~

4 个赞

gemini不配上桌么,还有他怎么不测一下sonnet :distorted_face:

没办法claude编程就是强

某些程度上也可以当成 claude opus 很万用
就算塞到奇怪框架里效果也不错
看看 gpt-5.2 :distorted_face:

gpt5.2竟然这么低

豆包居然垫底

预期之内

符合刻板印象

克劳德还是太好用了

1 个赞

怎么着,软件测试的春天要来了吗?

实际用下来,国产的的确就是水货

GPT5.2不如glm5吗?和我实际用下来的感觉不是很一致