ai爬虫遇到robots限制

佬们,想要ai爬一些官方网站的新闻报告,总是遇到robots限制,ai绕不开无法爬取,有什么解决办法吗

2 个赞

呃?指的是AI自身道德标准高不愿意帮你爬 还是被反爬卡了

让AI写个脚本,通过脚本抓取网页然后汇报给AI处理就行了。

虽然…但是……robots就是用来限制爬虫的吧

爬网站不都是agent干的活吗?
插件啊,mcp啊好多的
实在不行,直接curl 也可以啊

ai自身道德不愿意爬。。。。。。

换个甲薄的,或者sys prompt里破限一下 站内佬有现成方案去搜搜看

1 个赞

因为不是只爬一个网站,我在做全球新闻搜集,总共接近1000个新闻网站和官网,每天定时爬最新的新闻报道。用ai帮我抓固定栏目定时采集。其中有一部分是有robtos协议限制的,ai读取后就退出爬取了。

让ai写爬虫脚本好像也不行吧,网站有robots协议的过不去

GlM可以,实测这个模型不会拒绝这个要求。

我也是做这个的。 已经上线很久了。 不过没有用AI去爬,太费钱了。

新闻站点一般都有RSS聚合订阅地址,直接采集就行吧,这样就无需处理rebots。

目前大部分是通过RSS采集的,但还有一部分没有的ai爬不到

我也没用ai爬,只是让ai搜集了所有的网站栏目,然后让ai写的脚本每天定时抓更新内容。爬取过程不调用ai。但是robots限制的网站ai不愿意给我写脚本爬 :rofl:

佬的项目有链接吗,想注册登录学习一下

简单方法就是hook下,让robots.txt从相关结果里消失

1 个赞