你以为Anthropic做研究警示小样本训练投毒真的是为了AI Safety吗?

Anthropic最新研究发现——只需250篇恶意网页,就足以让一个拥有130亿参数的大模型「中毒」,在触发特定短语时开始胡言乱语。

诸位请细思。

「有毒」的数据库是危害极大的,因此需要将训练数据尽可能清洗到无毒。

清洗必然有一个标准,一个什么是「无害而有益」的知识库标准。此前Anthropic也在实验通过移除部分知识库,让模型更「无害」

结合两则新闻来看,他们的目的昭然若揭:他们意图建立什么是「无害而有益」的知识库标准。

在Anthropic这里,AI Safety离安全更远,离政治更近。

24 个赞

是这样的

8 个赞

必然的,这是Anthropic一贯的商业手段:贩卖AI Safety.

5 个赞

感觉这么多厂商,最纱布的就是A畜。反华反到魔怔。

4 个赞

真 ** 希望 Anthropic 早日倒闭,然后把模型开源 :sweat_smile:

反华、封号、限额、降智

坏事做尽 :sweat_smile:

3 个赞

……不知道,总感觉这个研究好像过了几个月了(还有视频

1 个赞

都是为了钱

1 个赞

我看Anthropic本身就中毒不轻

1 个赞

A厂的目标群体就是更看重安全性的 所以他们的商战思路就是我要让别的AI看起来不安全 让自己的看起来安全 至于性能什么的下次再说吧

1 个赞

看来是不行

有点杀毒软件自产自销的味道了