说说个人目前使用的各家模型的感受

首先,说一下本人用ai的情况:

  • Gemini的学生Pro
  • DeepseekV4的api
  • 自己本地部署的Qwen 27B & 35BA3B q4km 破甲版本
  • 以前用的是GPT
  • GROK提供“情趣”价值(普通账户 主用4.2 fast)

Gemini

网页版

网页版的Gemini3.1Pro模型目前用下来的感觉是,如果你和他随便聊聊天,或者叫他写代码写文章,这两个月的降智非常严重,就是有时候甚至会犯把A做的事情按到B头上这种古早的幻觉问题。但是,如果你给他拍一道题,他瞬间智商自动提高100%,就是真的思考思考能正确做出来,然后讲的还特别细,比学校的老师强100万倍,思路及其清晰,而且完美解答各种疑问,你把过程直接拍给他,还能帮你准确找出来到底错在哪里了,我的字奇丑无比,卷面一塌糊涂,照样完美识别。我严重怀疑谷歌是检测到你用题目考他他就自动切高版本的模型。所以现在Gemini在我这里已经彻底变成G老师了。
另外,Gemini的情商特别高,说话比GPT舒服100倍,GPT搞得好像我欠他100块钱一样的,说话呆呆的我会在这里稳稳的接住你这种,你说他错了,还必须要嘴硬怼回去。Gemini绝对不会有这种问题。

GeminiCLI

本人以前2.5时代用过Gemini的cli,那个时候真的评价为大粪。但是最近又把cli装回去了,现在的CLI,就我个人感觉,体验完全不输claudecode了。CLI的Gemini说话特别地道,而且做事情非常快,给他写一个需求md扔到目录里面,告诉他完成这个需求,很快就能弄出来,而且省上下文,做的东西还很不错。

Antigravity

纯大芬,里面的Pro比cli的flash还蠢,改个代码搞不定,而且harness做的特别差,经常陷入死循环……Antigravity还有严重的内存泄露问题,开个10个小时内存占用比IDEA大2倍……
我现在的工作流是,vscode开Geminicli,主要写大的需求,antigravity开着让他帮我看别人的repo的代码之类的(否则cli的quota不够用)。

另,我建议谷歌把他的UI团队全都开了得了,从Gemini的网页版,到Mac,iOS版本,再到aistudio,你们自己看看这用户界面是人类用的吗?和GPT完全没法比,自从谷歌整了material3之后,ui水平真的是直线下降了。

Deepseek

当年R1刚出来的时候,我当时用着gpt降智非常严重,直接切换到ds给我爽了一个寒假。最后手机里就留下了腾讯元宝,然后开了api充token放到自己的app里面聊天用。DS还是非常全能的,国产TOP1妥妥的,不论是综合能力,还是情商,还是别的,我用下来都是都是无对手的!特别的,flash就非常够,关键是他太便宜了,2块钱的输出,而且缓存命中率超级高,就是完全花不了多少的。

Qwen

开源

我也是Qwen的老用户了,从qwen2.5开始我就一直在本地部署。首先,现在开源T1梯队是有的,最重要的是,不像glm或者ds,太大了必须商业公司才能部署。Qwen是唯一一个给你开源小参数模型的,也基本是个人用户部署的唯一选择。个人使用上最好的是QWQ的破甲版本,写文很不错,关键是全本地运行,图个安心,唯一的缺点是,毕竟是老架构,每次都需要强制思考,而且输出太慢了。目前看下来最合适的的是Qwen3.5的27B版本或者35BA3B版本,智商足够,虽然容易犯幻觉(我怀疑是量化的问题),但是整体很优秀,甚至有时候还能爆金句,神操作之类的。甚至能拿来养龙虾(本地版本)……

APP

不多说,评价为路边,当年奶茶券给我来个领取失败,直接给我好感度归零了。我后面换了个号,给他甩了一张淘宝闪购截图叫他去那家店给我点个外卖,这玩意给我来了句——你自己去淘宝点。

Grok

我是从Grok3刚开始(当年还送过25美刀的api额度)就用的老用户了,评价为唯一的用途是18+。而且说话和马斯克很像,就和个流氓混混一样……。只能说,不限制是他唯一的好处了,情商不如Gemini,情节规划方面甚至不如我的Qwen 35BA3B,纯靠参数大硬上。有时候莫名其妙开始执行代码或者搜索网络,我都叫他不要找了。
最重要的是吃相太难看了,当年给你免费送额度,后面我反正就聊天写文章用fast就行,fast给的还行,够用了,还有视频生成的功能(SORA代餐级别)。然后突然开始有时候,会用的时候,告诉你服务器负载高,然后你一天就没法用了(我就说了一句),从没见过这样的,人GPT好歹会自动给你路由一个小模型用用,他直接给你停了。搞得我靠着Icloud邮箱注册了一堆小号勉强用着,结果后面把视屏生成给砍了,好吧…… 然后现在fast只能对话几次就告诉你到上限了,然后直接不让你用,最好笑的是,他的expert和fast是分开计算的,我一个普通用户甚至能在fast不可用的时候去用expert。有这么神人的计费方式真的无敌了。开Super那个价格更是上天,对比Gemini完全没有优势……
而且网页端还有严重的bug,就是容易导致中文输入法卡死,一秒钟动一下光标,这个毛病好久了。
最近打算用站里佬的2api反代到自己的app用去了。
另外,我当年用的时候,太神了:(骂人警告)

GPT

3.5turbo开始的老用户了,自从开了Gemini学生Pro之后就用的少了,优点是UI好看,特别是iPhone的app做的非常好,随手问问,拍照片或者啥,他能很快响应,不像Gemini那个残血app完全用不了……
没用过Pro或者team版本不做评价,但是我真的觉得gpt的巅峰在4o,4o之后的5真的不太行了。

这是本人用过的AI,佬们如果有使用体验也可以分享分享

21 个赞

另外,AIStudio不支持在内部branch,然后我当年整出来的……

4 个赞

这一个月以来codex后我真的就没用过怎么动过Gemini了,下载的 Antigravity也没怎么动过

1 个赞

antigravity感觉就是纯答辩,一点也不好使

4 个赞

就是纯答辩,一般来讲周quota的第一个5h重置是满血的,智商还行,然后后面看似一直有额度,但是给你不知道换了啥量化模型。而且好像是共享的,就是你flash把这个满血quota给用完了,你的pro也会降智,哪怕你没有用pro。

3 个赞

写代码我一直在用GPT4-mimi 感觉上下文支持很长,思考很快满足了自己心里的目标

有没有用过GLM的,感觉怎么样,和DS比呢

国内coding一流,不过超兽太严重了,慢的半死,还经常断联ds yyds

佬,我有一个4090,也想要部署一个小模型在qwen在本地,你的破甲版在哪里部署的?

huggingface上我只找到mac架构的,专门有个团队做,X86没找到,是不是都被封了?

因为白嫖了gemini会员,一直深度使用,这两个月真的是严重降智,跟明显的,没有大的开发需求,我感觉普通人日常,depk足矣。

gemini

目前用的网页版,白嫖的one会员,日常基本pro。代码分析以及写脚本(untiy)和代码方案设计都还行,也让它帮忙处理一些文章。api的没用过,不知道咋样,谷歌云赠金用起来挺麻烦的,懒得折腾。

gpt

目前用的也是网页版,和gemini辅助使用。就是网页版写东西太他妈啰嗦,给你分好几个标题来说。准备不忙了正价入一下(希望不要涨价)。

claude

也用的网页版,不敢付费。做了分流,没怎么重度使用。

glm-5

整体还比较满意,就是在opencode中,动不动死循环,一句话啰嗦好几遍;以及经常推出执行循环。(使用的公益站,等有空正价入看看会不会还这样。)

kimi-2.5

用他的app比较多,让他直接给我总结答案,直接说答案,不会说别的废话。问题仍然是在opencode中,不会主动调用任何的agent。(使用的公益站,等有空正价入看看会不会还这样。)

qwen

可能是使用的比较早期,刚出APP就用了,使用不是很理想,就放弃用了。上次用还是在测试知识库时使用的他的API。
开源的小模型我是真的喜欢,qwen-tts、z-image

deepseek

一般在手机上生成代码使用,整体还行,个别情况下代码能力稍逊于国外的gpt和gemini。

豆包

emm…多模态能力确实强,但是专业场合就废废的,但是架不住领导喜欢啊(diss火山平台,bug一堆)

minimax

因为没有app,且写代码用的omo所推荐的agent也很少执行到那,就没怎么体验过。

2 个赞

我自己的需求是日出对话和少量生图,完全不接触代码,用过:

1、DS(不是V4,在V4之前白嫖的版本了),评价是干活还不错,搜索的话半个智障,数据有时候太老不太准(现在新版本未体验过)

2、manus AI 看似很厉害,对话拉了坨大的,价格一点不便宜,真不如正价车了

3、gemini,用的是免费用户白嫖的版本,短暂拿来生图使用过,存在接头霸王行为(用A和B生成C,它直接给我把A图一部分接在了B图上),更高级的没用过,对话马马虎虎还行

4、微软copilot,连个word 都做不好的东西(只能找找固有的几个模板填你还不如manus AI呢),对话。。。没GPT免费用户的好用(白嫖的高级版,不过目前来看也就OD最实用)

5、poe 短暂使用过这家平台,对话质量还不错,就是免费的额度基本说几句话就没了,生图和高级模型是压根别想,价格真心不便宜

6、GPT(team薅羊毛)正在猛猛肘击奥特曼的羊毛,生图挺不错(字终于不歪了),对话的话pro的结果不错,其他等用一段时间再评价吧

7、中转站(这里没贬低其他佬友站点的意思,单纯个人被坑的角度)用过某家仿始皇头像的,为毛你家切换不同的模型都是一个鸟样?一个妈妈生的???价格嘛。。。这质量白嫖都是亏的

2 个赞

佬如果GPT正价发车带我应该,我只使用网页版简单对话,不使用codex

就hf上搜索关键词 qwen abliterated。
有几家专门做这个工作的,找个大小合适自己显存的参数量和量化版本,下gguf扔llamacpp或者lmstudio里面就能跑了。我自己是Tesla v100 ,跑起来还算可以。
不过可能得多试试看,有的破甲会导致降智,有几家的好一点。

opus 在代码还是 6。 gpt 想得最多最全。 grok 可以嘿嘿。

佬这是在grok问什么了,输出了这么多攻击原产地的话 :distorted_face:

就是叫他写文,里面他生成了某人说这句话,然后突然就停不下来了…就陷入那种几b小模型才容易出现的无限重复问题。
不过这是3时代了,grok4之后貌似没再遇到过

1 个赞

gpt:以前比較有感情,但是幻覺很高;後來codex還不錯,改善很多。
Gemini:和以前的gpt身分對調,以前的比較好,antigravity額度愈來愈少同樣以前的比較好。
Claude:很喜歡但是很貴,最近幾天4.7 opus幻覺很高,類似之前4.6後來4.7發布之前的那段期間。
mistral:很少用,簡單的任務需要隱私的可能可以用。
deepseek:審查和敏感詞很嚴重。
qwen:可能比deepseek寬鬆一點點。
poe:愈來愈貴。
glm:幾乎很少用。
kimi和minimax:都是2.5 2.6 2.7會搞混,好像不同版本有差異。
nemotron:比較適合龍蝦。
grok:查推特的東西。

突然想起来,我还在gpt4时代真的开过gpt的plus,只不过当年没这么多功能,连codex也没有,只能聊聊天。哪像现在的好时代啊。也算是最早一批用上土区订阅的人了 :upside_down_face:

1 个赞