用5.6做科研感觉到核弹爆炸

本人从cursor刚出的时候就开始用ai做科研,当时最开始还是claude3.6时代,一路到现在的5.6sol,之前5.5的时候都没什么感觉,但是现在这个5.6sol真是夸张,一跑就是跑一天,全程接管实验,不断调试,感觉体会到核弹爆炸的感觉,虽然确实这期间也感觉到sol的防御性,比如为了确保实验正确性,会筛好多东西,补好多实验,但是还是太牛逼了

14 个赞

用一用网页端的gpt pro模型吧,那个才是真正的科研顶级模型

7 个赞

听佬这么说感觉5.6确实适合做实验啊,会考虑各种情况的兜底。写代码反而过度防御了

4 个赞

利好民间科学家,什么科研训练,不如llm更新一个版本

4 个赞

是的,我还疑惑这么简单的事情他怎么跑那么久,看了下日志,才发现他从数据集就开始审查,查出了数据集的好多问题,然后再从之前别人的代码查,查出了好多问题

1 个赞

pro不是说和xhigh区别不大吗,我看跑分也从来没有用pro模型来跑分的说法,不过网页在干非代码任务确实用起来很舒服

1 个赞

但是研究生真的是慌的不行啊,感觉自己真是啥也不如了

2 个赞

哪天网断了,天才研究牲就陨落了 :distorted_face:

2 个赞

Claude3.8
好古老的昵称 :distorted_face:

1 个赞

差别大太多了,我一般用pro模型找论文和idea,是真的好用

2 个赞

但实际上只过了一年这才是最可怕的事情,当时用的模型还一堆问题,连最基本的idea实现都有问题,现在可以直接完全接管了

不用担心,我们能工智人研究生比gpt便宜 :smiling_face_with_tear:

4 个赞

那个时候还在薅cursor无限续杯,然后下半年codex还有free号额度,然后再是bugplus,最后到现在感觉越来越贵了,但是模型越来越牛逼了

让我想到某些数学博士生说现在vibe math每天就让gpt搞研究,然后验证成果,现在真不好说就能挖到一些大成果,以前是难以想象的。。

2 个赞

感觉你应该也看过奥本海默,这一刻你看到了普罗米修斯

2 个赞

想到自己自费买ai做科研就特别难绷,每个月我感觉按照现在的烧钱速度得要每个月200

1 个赞

deepmath已经成为主流了,现在整个数学体系已经收到了doss攻击了

1 个赞

现在验证成果是否合理还是瓶颈,还需要人类专家评审,但感觉这块llm早晚也会突破,以后就完全不需要人了。

2 个赞

对啊
那个时候有人和我说有个专门编程的模型叫Claude
我记得我就上去只试了一下下
感觉非常差 写出来代码跑都跑不动
我说就这还编程专精,再也不用了

— 直到Opus4.5 :distorted_face:

2 个赞

而且我在5.5,5.4时代想要做全自动科研还得加装一些项目,做那种autoresearch,当时但是觉得那些全自动的特别糖,很容易让ai的方向过拟合,但是5.6完全不需要了,真是可怕