最近没GPT用了,想用下国模看下效果,正好没注册过Trae,送了5000积分试了试glm、ds等模型发现这些国模总喜欢写各种脚本来做测试,然后保存下来,弄得我工程文件夹非常乱,我之前也用过小米的mimo也是同样的问题
相比之下GPT就从来不会。
不知道是不是我没有调用官方key的原因还是我的提示词写的不够好
最近没GPT用了,想用下国模看下效果,正好没注册过Trae,送了5000积分试了试glm、ds等模型发现这些国模总喜欢写各种脚本来做测试,然后保存下来,弄得我工程文件夹非常乱,我之前也用过小米的mimo也是同样的问题
相比之下GPT就从来不会。
不知道是不是我没有调用官方key的原因还是我的提示词写的不够好
这个是trea的问题
不过,每一个奇葩的规则背后,都是有理由的
参考L站之前有个佬,用codex,因为gpt清理临时脚本用错了命令,不小心删掉整个d盘的案例
你就能理解trae这么设计的苦心了
trae的模型不少都是阉割版(包括软件本身的提示词也不太好),而且不同的harness其实模型行为会有很大差异
还有就是gpt也是很能让人高血压的一个模型……
Trae是这样的,好马要配好鞍,这也不能全赖国模,好的模型差距没那么大
感觉和模型没关系,我用 gpt 一样也给我弄一大堆测试和防御。应该是得在 harness 遵守的规范中注入你自己的规则。例如 AGENTS.md 这种。
各有各的毛病吧
性能上GPT无可争议,也不会在项目目录下乱丢测试文件,但我真是烦透了它自主主张的全量测试……
我改两个样式,它要把整个项目全跑一遍……
就算约束了最小量,流口水的时候照旧跑大几百个测试……
你说的这些工程场景还好,国模在科研场景上那是一下都不能用,写出的模型算法一堆问题
我的GPT怎么和你不一样,也是写一堆测试脚本,还喜欢跑模型前编造一堆我没说过的数值gate,一没通过就说“这条道路封死了”。拉的这些脚本还会污染后续接手的其他模型,让他们模仿写gate脚本恶心人
我用的 sol 每次都是先给我来一套测试,然后才开始写代码,好时候还不分析需求,我刚说完就开始干活。
那篇帖子我也看到了,站在安全的角度是这样的。
gpt是干活猛,但是说话就不说人话,相比之下国模在中文下的人话指数就高很多
现在模型都是,有时候很聪明能理解需求。有时候又是一直纠结一件事浪费token ![]()
几个月前我用Trae用佬友写的byok用的GPT,上下文干一半都没开始动手。同样的prompt给codex分分钟干完了,Trae本身问题也蛮大的
看得出来oai已经在努力对齐了,但是结果就是从一堆高浓度黑话变成了一堆车轱辘话,就好像把沙子倒进水里,沙子没有溶解,黑话和人话泾渭分明
之前5.4时代的网页pro的输出体感就相对好很多,5.6堪比废话大师。
你这真是GPT的优点?这不是在说我们傻福GPT这个拉屎式测试爱好者吗
额 这不是显然是trae的能力问题,现在国模出活是没啥问题的,用gpt还能用出优越感的了 ![]()
国模更推荐什么软件来调用官方key表现效果会更好呢?官方的agent吗
gpt也会写测试啊,但是总感觉gpt写的测试比国模的要更加的务实一点,会尽量模拟真实环境和业务场景去测试,所以测试的质量更高一点