结果是:75%的模型越维护越乱,最后把本来能跑的代码搞崩了。
只有ClaudeOpus保持了一半以上的零退化率,其他全凉
13 个赞
Paper: SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration
虽然这有点不太礼貌
但我觉得纯是 iFlow CLI 太烂 ![]()
不过评测结果挺符合大家的印象
Qwen Max 真的烂
图 4: SWE-CI 上 8 家供应商的最先进模型的 EvoScore 变体
图 6: 所有模型按零回归率从小到大排序
水论文 +1 ![]()
7 个赞
克劳德宣传片~
4 个赞
gemini不配上桌么,还有他怎么不测一下sonnet ![]()
没办法claude编程就是强
某些程度上也可以当成 claude opus 很万用
就算塞到奇怪框架里效果也不错
看看 gpt-5.2 ![]()
gpt5.2竟然这么低
豆包居然垫底
预期之内
符合刻板印象
克劳德还是太好用了
1 个赞
怎么着,软件测试的春天要来了吗?
实际用下来,国产的的确就是水货
GPT5.2不如glm5吗?和我实际用下来的感觉不是很一致





