佬友们最近我写了个利用大模型api的狼人杀开源程序,目前接入的都是可以白嫖的模型,我总结下这几个模型的在狼人杀表现,目前我找到的是这几个模型
gemini,deepseek,智谱的dlm,星火的spark,俩老外的cohere和Mistral以及阿里的qwq还有腾讯的混元
佬友们最近我写了个利用大模型api的狼人杀开源程序,目前接入的都是可以白嫖的模型,我总结下这几个模型的在狼人杀表现,目前我找到的是这几个模型
目前表现最差的,是cohere,这个玩意好几次记不住自己的身份,在我完善了提示词之后,这家伙也是少有的多次能在白天说出自己是狼的模型
表现最好的,还是deepseekr1,虽然通常花费的时间比较长一些,但是基本上能捋顺现在的场景,能够分析出如何获胜,并且也没有忘记自己身份的情况
然后我这里还有个不知道怎么排名的QWQ,这家伙算是神鬼两性把,虽然也是思考模型,但是不知道为什么,总会出现把人带歪的情况,而且有时候因为发言过于抽象,往往首轮就被淘汰。但是他的推理能力也不是盖的,很多时候都能明察出场上的局势
然后剩下的那几个,个人认为表现最差的是讯飞的星火,glm和mistral在伯仲之间,混元要比他们几个强,然后gemini要稍微比混元强点
我的项目链接在这边,佬友们你们有兴趣的可以自己去看看和测试下
哈哈哈赛博狼人杀,有点意思
肯定是加更多的角色了
对了,如果有佬友要自己尝试狼人杀要注意token消耗,因为我这里是把游戏状态,所有人的白天发言,狼人互相知道的夜晚发言,遗言什么的每一次都发给他,所以token会掉的特别快 ![]()
别人狼人杀用大模型不是真的让他们直接开聊。让 ai 互聊会出现混乱。而且不同 ai 上下文不同,一般都找上下文长的,然后放3到5种 ai 开搞,一个 api 对应一个角色不然也会混乱
我记得也有佬友做过一个,我还玩了玩,有时候ai记不住角色规则
我这里是开头和结尾都重复了一遍身份和身份应该干什么,中间夹杂着所有人白天发言之类的东西,目前来说,除了cohere,别的模型基本上都没太大的问题 ![]()
mark
果然还是r1厉害啊,是哪家r1厉害
我这边现在用的是魔塔的,因为白嫖是按次数来的 ![]()
很多国外模型英文会强不少 ![]()
智能不魔塔
R1用过魔塔,官方,火山,阿里云,groq,openrouter,英伟达,硅基流动的,感觉除了官方和火山的感觉上稍强一点,别的没有什么区别
gpt4的时候玩过类似的,那时候真的贵,玩一局要20块钱。现在就算用推理模型应该也好一些了吧,而且推理模型感觉会很适合这种游戏。