来自官方System Card的Claude Opus 4.7牙膏倒吸实证

直接把分析放最前面:虽然整体来说在代码、多模态、电脑操作之类的领域有提升,但system card里也放了一些很差的结果。尤其是在类似大海捞针的长文本场景表现比Opus4.6更差(而且差了好多好多,几乎减半了!),在等量token使用的情况下在BrowseComp做网页操作也比Opus 4.6大概有5%的性能下降。DeepSearchQA的限定总token的检索也比4.6略差。




而且其实根据推特来看,砍得最狠的是token效率:

也就是说在改了tokenizer之后,如果用英文的话,Opus4.7要比4.6多输出50%的token!(修正:因为改的是分词器,输入输出的token数都会多50%)(不过也有人测试了如果用中文的话只会多输出6%的token,这下真全世界都讲中国话了)

29 Likes

你的意思是,在原本金子般的token的基础上,不仅涨价加快token消耗了,还比4.6的能力更弱,同时因为蒸了gpt导致染上了口癖 :thinking:

A/你真是飞了冯了 :sweat_smile:

41 Likes

长文本能力下降这么多真的是飞冯了
小模型蒸馏m一串包真的,感觉是向市场鼓动情绪的一款模型
毕竟m一串几乎没多少人能用到

m一串真像他们说的那样,市场会疯掉,多少应用场景直接成真,裁员更是一把大刀下来

我现在完全怀疑m一串单纯的吹出来的

还是等GPT6吧

6 Likes

是不是gpt要王朝了?奥特曼这下估计也要学A/了(悲)

3 Likes

干这行的看到核弹爆炸瘫坐也不是一次两次了 :melting_face:

9 Likes

A/到底要干嘛?你贵就算了起码性能得提升吧,真就版本号提升也算提升是吧

4 Likes

更废token,长上下文表现还差,性能还下降,debuff叠满了,还是等GPT6了,投入openai怀抱了,codex除了慢,别的使用体验还是很不错的:grin::grin::grin:

2 Likes

如果用来写毕设的话,是不是不如用4.6呀

难说,它代码能力和其他一些能力还是有提升的,但它中文的说话风格变了,以及能确定的是用的token数更多了

2 Likes

好的好的,谢谢大佬粗体文本,我两个都试试

这说法有点牵强了,实际上反而是MRCR的评测设定更符合真实用户输入

1 Like

可能主要是考虑到现在都是agent和harness的时代, 人类原始输入已经很少了,绝大部分的上下文都是agent自己和环境交互后得到的, 增强agent的能力让模型主动探索比死死记住一个历史的某个关键字(可能还有误导性)更有价值吧

这也不好说,长文本的benchmark有很多,探索的都是长文本情景下的不同维度,MRCR已经算是非常贴近真实输入场景的大海捞针变体了,测试的更多的是在混杂的长对话里抽取特定信息的能力,而graphwalk也和agent没有半点关系,测的是图论问题下的单轮长reasoning,按理说这两个互不冲突,不应该用谁比谁更贴近真实输入砍掉另一个

1 Like

最近用 opus 迁移一个 1300 行的 PHP。比 GPT 还偷懒,返工两次了。 真是越来越难用了 :smiling_face_with_tear:

1 Like

我觉得现在便宜大碗的gpt已经完全够用了

Claude Opus 4.7 = 来自 GPT-5.x 稳稳接住你的文风 + 如 Gemini 3 Pro 一样雷霆的上下文注意力性能 + 变相加价 35% 的 Opus 价格* + 负载一高就开始随机抽查用户 KYC