芒果TV平台模型实际上是注水模型

经过使用一轮提示词的测试,芒果TV平台提供的大模型实际上为claude sonnet 3.5,他通过提前注入提示词指示模型从预设定的几个模型中输出结果


实际模型测试结果如图

15 个赞

sonnet3.5没公开权重 并且停用api很久了 :distorted_face:

16 个赞

不是那他是咋弄到sonnet3.5的 而且实际用虽然效果不太行也明显是近半年模型的水平

并且色盲题和那几个常见逻辑测题基本上都可以正确回答 比mimo ds glm正确率都要高

1 个赞

一般如果要测试是不是 authpic系例的要问他一些经典的道德问题

由于创始人对这个看的比较重,另外 gpt 和 authpic的代码风格会有区别

这个完全不用测的啊 那几个逻辑题连opus4.7/4.8思考不开high以上都有概率回答错
目前脑筋急转弯类的题目低思考只有5.5和gemini系的回答正确率比较高

3.5 好像在部分平台有提供,cursor docs 之前给的 sonnet4.5 现在是 sonnet 3.5

怎么还有用问模型是谁判断模型身份的… 模型没有自我认知的话就会乱答的

6 个赞



你要觉得这个是claude那我没招了 目前国模除了3.7max有能这几个问题全对的吗

1 个赞

2026年 还有人问“你是谁” 来看模型是什么模型 我真的没招了。。

12 个赞

这里哪一个不比sonnet 3.5便宜,更何况已经sonnet 3.5被A/干掉了

等一下, 这里不是有一个很明显的问题吗

如果它是 claude sonnet 3.5 , 它怎么知道半年后的25年初会出 R1?

1 个赞

claude是唯一真神 能预测未来很正常

1 个赞

所以说,知识库 + 协作方式就可以判断的了其实。。。