经过使用一轮提示词的测试,芒果TV平台提供的大模型实际上为claude sonnet 3.5,他通过提前注入提示词指示模型从预设定的几个模型中输出结果
实际模型测试结果如图
不是那他是咋弄到sonnet3.5的 而且实际用虽然效果不太行也明显是近半年模型的水平
并且色盲题和那几个常见逻辑测题基本上都可以正确回答 比mimo ds glm正确率都要高
一般如果要测试是不是 authpic系例的要问他一些经典的道德问题
由于创始人对这个看的比较重,另外 gpt 和 authpic的代码风格会有区别
这个完全不用测的啊 那几个逻辑题连opus4.7/4.8思考不开high以上都有概率回答错
目前脑筋急转弯类的题目低思考只有5.5和gemini系的回答正确率比较高
3.5 好像在部分平台有提供,cursor docs 之前给的 sonnet4.5 现在是 sonnet 3.5
怎么还有用问模型是谁判断模型身份的… 模型没有自我认知的话就会乱答的
2026年 还有人问“你是谁” 来看模型是什么模型 我真的没招了。。
这里哪一个不比sonnet 3.5便宜,更何况已经sonnet 3.5被A/干掉了
claude是唯一真神 能预测未来很正常
所以说,知识库 + 协作方式就可以判断的了其实。。。