舆情分析?将本站佬的开源项目(微舆)与manus|minimax|ChatGPT对比

生病在家闲来无事,把star很久的“微舆”——
本站佬做的一个非常非常优秀的开源项目,拿来和manus|minimax|ChatGPT的agent对比一下。

如果你想看看各家AI agent在舆情分析的表现 或是 想使用“微舆”但还没来得及部署的,可以看看这篇文章。

测试的主题选择了一个最近大家应该都很熟悉的话题:小鹏的机器人。这也能方便佬们自行判断各家agent的效果。

通过这个对比,佬们应该能对各家agent有一个判断,哪怕这次主题比较偏 :rofl:

我将从三个方面来对比最终的报告:

  • 第一方面:专业性、全面性、逻辑性
  • 第二方面:真实性、时效性
  • 第三方面:整体美观性, 图标/图表 美观性,文字美观性
叠甲

所有文字都是本人主观理解和判定,至于最终孰好孰坏是一件仁者见仁智者见智的


零、前情提要

  • 所有agent提示词相同(小鹏汽车(XPENG)智能机器人 “IRON” 舆情报告)
  • manus使用 1.5 lite 模型
  • 微舆使用docker部署,所有 AI 配置按照官方推荐模型设置
  • perplexity为PRO账户,使用实验室模式(lib)
  • 将按照以下顺序:
名称 输出格式
ChatGPT PPT,PDF
manus PDF,PPT
minimax(free) HTML
minimax(Pro) HTML,PPT
perplexity(pro-lib) PDF
微舆 PDF,HTML

一、ChatGPT

ChatGPT agent在运行了十分钟后给出了最终结果:

PDF:


PPT(ChatGPT官方展示链接):



打分:

方面 评价指标 星级
第一方面 专业性 ★★★☆☆
全面性 ★☆☆☆☆
逻辑性 ★★★☆☆
第二方面 真实性 ★★★★☆
时效性 ★★★☆☆
第三方面 整体美观性 ★★☆☆☆
图标/图表 ★☆☆☆☆
文字美观性 ★★☆☆☆

总分:2.5★

总结:ChatGPT的代理模式(agent)到现在可能都没有多少人用过 :rofl: 做出来的只能说能看,PPT做的一言难尽,PDF还行,但是整体的信息来源太稀少了,基本上全在官网转悠。

文件:
舆情报告PPT-ChatGPT.pdf (428.9 KB)

二、manus

manus应该是第一批agent了吧,不知道还有没有人记得manus邀请码十万一个的日子 :innocent:

下面是manus运行4分钟的结果:

PDF:


PPT:

与PDF版一模一样,故不浪费论坛资源 :grinning_face:


打分:

方面 评价指标 星级
第一方面 专业性 ★★★☆☆
全面性 ★★★☆☆
逻辑性 ★★☆☆☆
第二方面 真实性 ★★★★★
时效性 ★★★★☆
第三方面 整体美观性 ★★★☆☆
图标/图表 ★★★☆☆
文字美观性 ★★★★☆

总分:3.5★

总结:manus的PPT功能是官方重点介绍的功能之一,确实没有拖后腿,做的还是很不错的。令我意外的是manus的信息还是很广的。但是我不知道它为什么要写两页的“建议” :rofl:。

文件:
小鹏汽车智能机器人_IRON_舆情报告-manus_compressed.pdf (1.5 MB)


三、minimax

前两天从这家的code模型了解到的,就拿来一起试试了,但是这家的PPT和PDF导出功能一直转圈圈。

free(html)

pro


打分:

方面 评价指标 星级
第一方面 专业性 ★★★★☆
全面性 ★★★★☆
逻辑性 ★★★★☆
第二方面 真实性 ★★★☆☆
时效性 ★★★★☆
第三方面 整体美观性 ★★★☆☆
图标/图表 ★★★★☆
文字美观性 ★★★★☆

总分:3.72★

总结:minimax pro的表现出乎我的意料,尤其是在图标绘制的方面,非常不错。
free版也勉强,free在数据的广度和准确性基本上就一颗星。
但是同样的也有点偏离主题,它不仅提了两页PPT的建议,还介绍了两页 :rofl:(指Pro)


四、perplexity

应很多佬友要求,11.13更新perplexity。
perplexity以搜索为主打内容。
PDF:





打分:

方面 评价指标 星级
第一方面 专业性 ★★★★☆
全面性 ★★★★☆
逻辑性 ★★★★☆
第二方面 真实性 ★★★★★
时效性 ★★★★★
第三方面 整体美观性 ★★★☆☆
图标/图表 ★★☆☆☆
文字美观性 ★★★☆☆

总分:3.75★

总结:不愧是以搜索出身的产品,事件涵盖非常全面,并且有逻辑,美中不足的是图标不怎么样,有点为了做图表而做的感觉。

文件:
小鹏汽车IRON智能机器人舆情报告.pdf (994.9 KB)


五、微舆(BettaFish)

这是我们站上的一位大佬做的,已经2.2k star了,作为一个出生就是为了舆情分析的agent。
它运行了90分钟,消耗了我总计超过250w的tokens
来看看他的表现:

HTML:

PDF(部分截图):






打分:

方面 评价指标 星级
第一方面 专业性 ★★★★★
全面性 ★★★★★
逻辑性 ★★★★★
第二方面 真实性 ★☆☆☆☆
时效性 ★★★★★
第三方面 整体美观性 ★★★☆☆
图标/图表 ★★★★☆
文字美观性 ★★★★☆

总分:4★

总结:尽管开始前我已经做好了“这就是专业的”的准备,但是当结果出来后我还是非常震惊。他生来就是为舆情的。各位佬直接看截图吧。不知道为什么,PDF后面的图标位置有些错乱。

注意:这个项目仍然没有成熟,由于强依赖AI 导致报告大部分内容是虚构或极度夸大的。 因默认的部署是没有爬虫的,所以这里并没有使用项目的爬虫,会有一定原因。


给想要使用微舆的佬们的建议:先运行 MindSpider 爬虫(或导入其他合规数据源)把数据库填充起来,再让 Insight Agent 工作;否则它只能依赖语言模型自说自话

原因:Docker 一键启动只会拉起主应用和数据库容器,但不会自动执行爬虫去写入内容;官方文档也强调“数据爬取需要单独操作”,所以不跑 MindSpider 爬虫或导入历史数据时,本地数据库实际上是空库,Insight Agent 查询不到任何素材。

Insight Agent 的核心能力来自 MediaCrawlerDB 对本地舆情库的 SQL 查询,所有分析都依赖这些查询返回的真实帖子、评论和指标。如果库里没有数据,查询结果就是空列表。

即使查询结果为空,流程仍会把空列表送进总结节点,提示词却要求生成“充满数据、引用大量评论”的段落,这会促使模型靠想象补齐细节,增加幻觉风险。


核实详情

:cross_mark: 无法验证的具体事件和数据

  1. “10月23日工信部备案信息泄露”

    • 验证结果: 未找到任何相关报道
    • 质疑: 该报告中提到的时间线与实际发布不符
  2. “480元/小时维护费”

    • 验证结果: 未找到任何官方或媒体确认的具体成本数据
    • 质疑: 这是报告中的推断数据
  3. “1143元/小时综合成本”

    • 验证结果: 未找到任何来源支撑这个具体数字
    • 质疑: 这是报告分析中的推测
  4. “宝钢4.2/8小时效率数据”

    • 验证结果: 未找到任何报道披露具体效率数据
    • 质疑: 这是报告的假设场景
  5. "负面舆情占比51.4%"等具体数据

    • 验证结果: 未找到任何第三方舆情监测机构的类似数据
    • 质疑: 这些数据看起来像是模拟分析
  6. "关节异响"等具体技术问题

    • 验证结果: 搜索结果中主要提到的是"藏真人"质疑,而非关节异响
    • 质疑: 技术细节与实际报道不符
  7. "供应链中断"等具体商业风险

    • 验证结果: 未找到任何供应链相关的负面报道
    • 质疑: 这些风险评估可能基于情景分析

文件:
(因为PDF太大了所以只能分片上传,很抱歉)
关于小鹏IRON人形机器人舆情危机的深度分析报告-微舆_compressed_compressed-1.pdf (2.2 MB)
关于小鹏IRON人形机器人舆情危机的深度分析报告-微舆_compressed_compressed-2.pdf (2.3 MB)
关于小鹏IRON人形机器人舆情危机的深度分析报告-微舆_compressed_compressed-3.pdf (2.0 MB)
关于小鹏IRON人形机器人舆情危机的深度分析报告-微舆_compressed_compressed-4.pdf (37.8 KB)


五、总结

其实把微舆这个专业型agent拿来和manus这些通用agent是不合理的哈 :winking_face_with_tongue:

抛开微舆这个专业选手不谈,其他家的agent我按主观臆断排个名:
1、minimax agent(=perplexity)
2、manus agent
3、ChatGPT agent

大家权当看个乐呵,如果有想要原文件的可以找我要。

107 个赞

先赞再看,收藏学习

1 个赞

先赞再看,养成习惯

1 个赞

佬友,PDF 能上传到奶牛快传之类的文件分享站再贴个链接到这里吗

1 个赞

好项目,一会儿我也试试。感谢。

另外请问,是否与 genspark、perplexity 之类的平台对比过?
(原来我也粗略测试过几次各家大模型的 deepresearch 检索舆情、热点信息的质量,感觉 chatgpt 的还有点内容。其他的还是瞎编乱造的多。)

1 个赞

学习一下

1 个赞

这个其实没有哈哈把我忘了per了 我之前用它的lab还是挺好的

2 个赞

这么强,这就去部署试试

1 个赞

我核实了一遍,微舆的幻觉太强了,经常自己编造内容

4 个赞

这点很伤啊,我觉得做这种任务 信息是宁缺毋滥的,美观性、文字风格、信息全面性都是排在真实性之后的

不错的评测,谢谢分享 :heart:

5 个赞

是的 我也非常同意这个观点 我已经从prompt层面下手提了pr 看看会不会有帮助

我认为幻觉很大程度上都是因为prompt给模型的压力太大了,东西都写太死了,让模型不得不胡编乱造

2 个赞

佬友的评价都在理,贴出来的报告我也仔细看了一下。可以试一试先多爬一些数据再跑一下看看。最大的幻觉来源是Insight Agent,他只能从数据库来获取信息,并且报告的一些图表数据譬如大家的情绪发展曲线等等也主要是使用Insight Agent的数据,我们知道大模型做计算是容易出错的,所以这个Agent里内置了一些机器学习模型与计算器来算统计结果。如果数据库拉不出东西,但是prompt给的压力又要爆了,deepseek难以避免的开始瞎编了。论坛机制虽然有一定的纠正虚假言论的作用,但现在的prompt以及整个多agent框架设计还是没有去做强约束、以及专门拉一个工作流来干这个虚假言论检测的作用,所以幻觉小还可以抑制一下,一旦突破那个约束边界就没办法了,就开始彻底放飞自我了。这部分我这个月狂看了一些虚假言论检测的研究,后续也有一些迭代想法,可以持续关注一下。

感谢佬友做的测评,已经放到项目首页了。

6 个赞

想docker 部署的,一看要好多API。。。。放弃

2 个赞

点赞观看学习。 :melting_face:

1 个赞

您可以去百炼搞个api,用qwen-plus,所有需要配api的地方都用这个就行。百炼速度还是可以的,就算所有agent都用一样的api也是可以hold住的。

可以稍微等一等,已经在谈一些合作了,给大家可以在线体验。

1 个赞

是的是的 这么一看问题就很透彻了 很期待解决这个大难题之后的微舆:smiley:

其实一个硅基流动 +gemini就能搞定了

我试了很多主题 我发现微舆特别喜欢编一些有关工信部的事情:face_with_monocle: 和工信部过不去了哈哈

会不会跟模型也有关系?deepseek感觉就是很喜欢乱编,换个其它模型会不会好点?

全部用谷歌的gemini会不会好点?

感谢分享