grok build呢这个没有测试吗,对还有codex,zcode
2 Likes
是不是说明了市面上现存的harness对deepseek v4 flash ga 的优化是不够的
没有codex的测试吗,挺好奇的
好像这种图像类游戏类的 codex 就是 sh1t 默认不配参与比赛
3 Likes
在不同harness里为什么差距这么大?还是训练不够充分吗
2 Likes
面向agent控制训练的,你去看看d4f的官方海报,特意写了是用它们自己的harness跑的测评
1 Like
opus在cc 和 gpt-sol 在codex 本身就是他们最高分的地方. 没有一个模型需要在所有harness上都拿一样的分数 .
1 Like
会有这么大差距吗?这是什么原理,harness 不就是管理下上下文 提供下 agent 接口吗?难道是提示词?不太可能吧![]()
你对 harness 的理解有问题
你把模型成一个匹马
人 骑马
harness 就是 马的周边
你觉得还不重要吗
马蹄铁是人类历史文明重要的发明
4 Likes
那说明sol还被低估了 毕竟它自己也是在codex评 ![]()
opencodecli 还是opencli哦。佬?
没必要花功夫选,DS 自己的 harness 即将登场。
3 Likes
他们自己的 肯定也都是开源的魔改 不一定就是能后发制人 除非模型配合训练 但是不好说 毕竟人都是才招的
头一回见到管opencode叫opencli的,不看正文都没认出来
标题太长了 只能这样了 哈哈哈 这玩意没啥好的缩写不像 cc 大家知道是什么
你讲到重点了,模型肯定要训练的,agentic 轨迹和 harness 数据飞轮。



