AB盲测,还有评分
不过只有单条测试,没有长条测试
榜单是野榜,看个乐
绷不住了,还有道歉的。
一来,长程任务中人物是否能保持严格人设不ooc是一个很重要的rp指标
二来,复杂提示词下AI是否可以理解,并遵守,是否具备“对人性”的理解是一个很重要的指标
三来,nsfw场景是很多酒馆用户的指标。nsfw写的好不好,色不色也是一个很重要的指标。
这种airp还是很难定量测量感觉,简单的一句话两句话只能看模型在无预设调试下的文风,其实和大家体验的airp差距很大。
光是看这榜里面gpt5.6sol都排到19了,就知道o/的实力了,拒绝一切
4.1Flash 排这么前面,纯纯野榜。
4.6 opus不是第一的都是野榜(