总结一下目前站内模型性能的讨论

目前站里的各种帖子有点散乱,我花时间查了下使用体验,目前大概是这样的:
写规划文档:
fable5、gpt5.6sol(ultra)
编辑:

写后端代码:
gpt5.6sol(medium)一般没问题,luna在在执行文档非常详细的情况下可以和sol差不多,但也有少数人发现还是有明显差距,terra有一部分佬反映上不如sol下不如luna,5.5大致介于5.6luna和terra之间。另外有一位佬说,gpt因为自带review功能,胜过其他所有模型(包括opus)
deepseekv4flah0731和luna差不多,但是速度更快,
grok4.5、4.6不降智也很好,但是现在都是降智甚至很慢,
glm5.2刚发布的时候也不错,但是后来降智就不行了,正值5.3发布,不知道有没有佬用,欢迎补充。
另外opus5官方说和fable5差不多,但实际用起来差距明显,前端不如fable5,也更适合执行。
编辑:glm5.3介于terra和sol之间

写前端代码:
fable5(max)写前端还是最强。然后是kimi k3,对了还有哈基米。看到佬测评说glm5.3也差不多了

写作:
想提一下opus4.6,但是个人体感大不如前,可能是算力集中于新模型了吧,不过还是最有人味。写网文deepseek,写有点文学性的kimi,之前听说glm很有人味,但是看到有佬说glm5.2平平无奇,不好不坏,我也没有试,不知道有没有佬拿5.3试试,欢迎补充
编辑:

没考虑性价比,纯使用效果总结

4 Likes

感谢佬友总结,目前来看还是ds4f-0731性价比最高了

1 Like

感觉GPT 5.6 SOL Ultra写文档,其实还不如Claude OPUS 5。这玩意写复杂文档会开一堆Agent互相Review,最后Review到东一块西一块,然后文档里面还有冲突的地方,还有错误没Review出来。GPT系列模型写文档都很差

1 Like

居然能总结出推荐sol ultra的结论吗,我看大部分人不推荐来着

1 Like

这个在写文档的时候可以交叉审阅,虽然又慢又贵,但是实际体验相当严谨,不过不适合写代码

2 Likes

其实我之前用opus写文档,后来给gpt看,找出了不少漏洞,后来就一直用gpt了,个人感觉写执行文档非常细致,属于给一般的模型也能操作的水平
佬,你不介意的话我把这个补充到帖子里行吗?

1 Like

写作的话个人体感glm5.3不如5.2

2 Likes

多写佬补充!我这就去填补空缺~~~

就我之前使用GPT 5.6 SOL Ultra去写一个量化模型的文档,然后当时应该用的是滚动训练,类似于PTSS,结果我一看,后面我review的时候,它把一部分的训练集写成验证集了,给我气笑了,我就再也没有用sol写过文档:(

2 Likes

居然还有这种事,我一般写好后没具体看,只看了细致程度……搞得我有点慌了

教我学习用什么模型推荐呢?主要在claude里面用,之前感觉kiro反代出来的教我体感也很好,但现在没了,需要找个平替之类的

都说luna max很慢,但是我用着感觉和sol high速度也差不多,没感觉有什么巨大的区别呢?

理科选逻辑类,比如gpt,claude、deepseek、glm
文科选幻觉类,claude其实最好,kimi、gemini甚至豆包也不错。glm我不知道效果怎样

别笑,看我把claude都放幻觉类,就知道不是单指豆包那种,主要偏感性的

1 Like

如果是氪金玩家,最具性价比是 Grok4.6

确实不错,不降智的grok哎……

嵌入式工科,我用过deepseek以前的版本,感觉国模没有opus(甚至是kiro反带出来的)舒服,主要是排版导致讲的很清楚,但是现在没有kiro的公益站了 :face_holding_back_tears: 找平替没找到,gpt太聪明了,导致我需求提的不对,他就讲不清楚,不给我讲底层

体感在写作是大幅倒退……前两天的5.2出了文学名著般的神来之笔,今天的5.3出了R1都不会犯的常识性错误。

那可能是因为opus也适合写作,挺有人味的,严谨方面gpt强一点,deepseek和gpt一样走的严谨路线,国产kimi、glm其实也有人味,逻辑好像也在线了,你可以试试,如果用量不大可以考虑中转或者工艺站,有的工艺有fable

1 Like

好的,感谢佬,我下一步试试kimi和glm吧,不行了就上fable,或者opus,还没有用过fable教我学,只用他干活

1 Like

其实fable反倒更适合学习,感觉干活有些大材小用了
对了,你其实可以,gpt弄一遍,然后换个有人味的润色一边哈哈~