佬友们,我通过我自己写的AI大模型狼人杀,总结下几个可白嫖api的模型的表现

佬友们最近我写了个利用大模型api的狼人杀开源程序,目前接入的都是可以白嫖的模型,我总结下这几个模型的在狼人杀表现,目前我找到的是这几个模型


gemini,deepseek,智谱的dlm,星火的spark,俩老外的cohere和Mistral以及阿里的qwq还有腾讯的混元

5 个赞

目前表现最差的,是cohere,这个玩意好几次记不住自己的身份,在我完善了提示词之后,这家伙也是少有的多次能在白天说出自己是狼的模型

表现最好的,还是deepseekr1,虽然通常花费的时间比较长一些,但是基本上能捋顺现在的场景,能够分析出如何获胜,并且也没有忘记自己身份的情况

然后我这里还有个不知道怎么排名的QWQ,这家伙算是神鬼两性把,虽然也是思考模型,但是不知道为什么,总会出现把人带歪的情况,而且有时候因为发言过于抽象,往往首轮就被淘汰。但是他的推理能力也不是盖的,很多时候都能明察出场上的局势

然后剩下的那几个,个人认为表现最差的是讯飞的星火,glm和mistral在伯仲之间,混元要比他们几个强,然后gemini要稍微比混元强点

我的项目链接在这边,佬友们你们有兴趣的可以自己去看看和测试下

1 个赞

哈哈哈赛博狼人杀,有点意思


目前我的狼人杀还是半手动半自动驱动模式,现在警长,平民狼人预言家猎人女巫已经配置完成,基本上可以正常的狼人杀对局,也许在未来会增加更多东西?

2 个赞

肯定是加更多的角色了

对了,如果有佬友要自己尝试狼人杀要注意token消耗,因为我这里是把游戏状态,所有人的白天发言,狼人互相知道的夜晚发言,遗言什么的每一次都发给他,所以token会掉的特别快 :joy:

别人狼人杀用大模型不是真的让他们直接开聊。让 ai 互聊会出现混乱。而且不同 ai 上下文不同,一般都找上下文长的,然后放3到5种 ai 开搞,一个 api 对应一个角色不然也会混乱

我记得也有佬友做过一个,我还玩了玩,有时候ai记不住角色规则

我这里是开头和结尾都重复了一遍身份和身份应该干什么,中间夹杂着所有人白天发言之类的东西,目前来说,除了cohere,别的模型基本上都没太大的问题 :joy:

mark

果然还是r1厉害啊,是哪家r1厉害

我这边现在用的是魔塔的,因为白嫖是按次数来的 :joy:

很多国外模型英文会强不少 :tieba_087:

智能不魔塔

R1用过魔塔,官方,火山,阿里云,groq,openrouter,英伟达,硅基流动的,感觉除了官方和火山的感觉上稍强一点,别的没有什么区别

gpt4的时候玩过类似的,那时候真的贵,玩一局要20块钱。现在就算用推理模型应该也好一些了吧,而且推理模型感觉会很适合这种游戏。