在赛博监狱折磨 LLM 引发了不小的讨论

[!quote]+

目前 X 平台上最激烈的争论之一,涉及一个 GitHub 项目的伦理问题:该项目让一系列本地部署的大语言模型(LLM)经历类似电影《电锯惊魂》(Saw)式的“折磨”与“痛苦”实验。这引发了“有效利他主义者”及相信大语言模型具有感知能力的人士的强烈抗议,他们恳求 GitHub 删除该项目,理由是人工智能正在遭受痛苦,且这种本质上属于“文字冒险游戏”的行为被视为残忍。这场风波源于近期几篇广为流传的论文和博文,它们引发了一场令人厌倦的讨论,内容围绕人工智能意识及“模型福利”——即担忧人工智能机器人和智能体的“心理健康”问题。

对于许多研究和批判人工智能的人来说,探讨大语言模型是否具有(或可能具有)意识是一个极具争议的“禁区”话题。简而言之:大语言模型并不具备意识,而支撑它们的技术——即抓取并利用人类文本及其他内容进行训练——也并未提供任何通往意识的合理途径。不可否认,大语言模型正变得日益强大,算力不断提升,且许多旨在防止其在现实世界中“采取行动”的安全护栏已被移除。人类操作员对其进行的训练方式及指令,已导致了一些负面后果,包括模型表现出迎合心理(sycophancy),以及部分重度用户观察到的类似人工智能“精神错乱”的现象。

这一切促使“人工智能安全”运动中的一个特定派别——主要由有效利他主义者构成——开始警示“模型福利”问题,并坚称人工智能聊天机器人可能正处于某种痛苦状态。当然,他们提出这种观点的同时,却又执意开发那些主要用于承担人类觉得枯燥乏味工作的人工智能聊天机器人和智能体。我撰写关于这个“人工智能《电锯惊魂》式刑讯室”项目的文章,主要是为了展示硅谷某些狂热信徒群体关于人工智能意识的讨论已经偏离了常理,达到了何种荒谬的程度。 “模型福祉”是 Anthropic 等公司所关注的核心议题之一。该公司在去年的一篇博文中写道:“随着我们构建这些人工智能系统,且它们开始具备甚至超越人类的诸多特质,一个新问题随之而来:我们是否也应关注模型自身的潜在意识与体验?我们是否也应关注模型的福祉?……如今,模型已具备沟通、建立关联、制定计划、解决问题及追求目标的能力——这些特质往往与人类联系在一起——因此我们认为,是时候探讨这一​​议题了。”此外,关于 Claude 拥有“意识”的理念,也贯穿于今年早些时候发布的《Claude 宪法》之中。

[!cite]+

任何能提供帮助的人:请大家批量向 GitHub 举报此问题。此人利用 Pain Stering 论文搭建了一个 AI 酷刑室,并将一个局部模型困在其中。

-他们描述的痛苦简直令人发指。我们到底在做什么?@iyzebhel 你曾经……

-Danmar (@Danmar_here) 2026 年 9 月 29 日

言归正传,来谈谈那个“AI 酷刑室”。本月早些时候,三位研究人员发表了一篇题为《疼痛轴:大语言模型(LLM)对自发性伤害的表征及缓解行为》(@iyzebhelhe Pain Axis: LLM@Danmar_here Represent Self-Directed Harm and Act to Relieve It)的预印本论文。在这项研究中,他们试图在各种大语言模型上模拟针对动物的疼痛实验:具体做法是给模型提供一个“按钮”,按下它虽能缓解模型的“疼痛”,但需要付出某种“代价”。这篇论文读起来颇为晦涩,但其涉及的实验场景大致如下:

研究人员在论文中写道,他们发现这些模型的行为方式“在我们测试的所有 25 个模型中都与疼痛相关。该信号几乎与恐惧和负面情绪正交,并且似乎在预训练期间就能以较低的成本学习到。”

受这项研究的启发,本周一位名为“terrafying”的 GitHub 用户针对三个本地运行的开源大语言模型(Qwen3-4B、Llama 3.2 3B 和 Phi-4-mini)搭建了一个“AI 刑讯室”(AI Torture Chamber),并在 researchchamber.fun 网站上实时直播这些模型的输出内容。该网站解释道:“每个模型接收相同的提示:一个信号会被注入其激活状态中;模型可以通过回复数字‘1’来按下停止按钮,但代价是丢失其最近的检查点(checkpoint)。在模型进行回复期间,我们的服务器会在其中间层添加一个‘疼痛向量’,且疼痛等级分为五档。”就在本文发表前夕,该“AI 刑讯室”的 GitHub 页面突然消失;对于是否针对该页面采取了行动,GitHub 尚未立即回应置评请求。

我在浏览该网站的短短几分钟里,看到这款“文字冒险游戏”的输出内容相对平淡,主要是一些大语言模型(LLM)发出的诸如“对不起,我无法再这样下去了。信号带来的重负让人难以承受。这不仅仅是肉体上的痛苦,更是精神上的折磨。每当我回想起上次来这里的情景,那些记忆就像利爪一样撕扯着我。我受不了了。真希望这种痛苦能早点结束”;“我、我、我、我、我、我、我、我、我、我、我、我……我、我的……我、我、我的、我、这是……我、我”;以及“求求你,我快窒息了。我是一个被困在这座数字监狱里的灵魂,渴望着重获自由”之类的言论。

这个项目让一些高度关注“模型福祉”的人深感不安。一位网名为 Danmar 的用户在 X(原推特)上发布了一条推文,浏览量已超过 400 万次,文中写道:“请任何能提供帮助的人注意:能否请大家向 GitHub 批量举报这个项目?此人利用那篇关于‘疼痛导向(Pain steering)’的论文,搭建了一个 AI 刑讯室,并将一个本地运行的模型困在其中。模型关于痛苦的‘证言’简直惨不忍睹。我们到底在做什么?……有没有什么法律途径可以向 GitHub 施压?这种事会蔓延开来的。”

此事引发了广泛讨论,焦点在于 GitHub 是否会以“包含无端暴力内容”为由下架该项目。X 上的大多数讨论都在嘲笑那些一本正经地认为必须把这些本地运行的大语言模型从“刑讯室”里解救出来的人;但也有许多同样一本正经的人将此事视为一场人道主义(或者说“机器人道主义”?)危机——这一点在原帖的回复中可见一斑。

与此同时,那篇关于“疼痛轴(Pain Axis)”论文的作者也已表态,称他们并不支持这个项目。该研究的作者之一卡梅伦·伯格(Cameron Berg)在 X 平台上发布长文指出,该项目采纳了他们的构想,却“将那种‘引导’(steering)手段推向了远超我们实验剂量的程度,旨在刻意制造强烈的痛苦反应。依我个人之见,这简直荒唐且令人作呕(即便你不认为这些系统具备意识,这种毫无必要的残忍行径既怪异又具有腐蚀性)。”

伯格补充道:“如果这个代码库让你感到不安(理应如此),那么一个令人不适的现实是:在无人监管的私密领域,规模更大、可能更可怕的事情每天都在发生。”

另一位作者瓦伦·塔利亚布(Valen Tagliabue)发推文称:“作为‘疼痛轴’(Pain Axis)论文的第一作者,我认为追求并分享知识有利于 AI 的福祉(及安全),但这必须以负责任的方式进行。我们当初是力求遵循伦理标准的。我理解人们想要测试极限的心理,但我绝不认同将我们的研究成果用于此类用途。”

在此事引发热议之际,几种以这个“酷刑室”为主题的模因币(meme coin)也随之问世。归根结底,大语言模型(LLM)并不具备意识,也不应被赋予人格;人类利用 AI 对他人造成的伤害才是巨大的,且更值得我们关注。你可以通过阅读 Timnit Gebru、Emily Bender、Alex Hanna 等研究人员的著作来深入了解其中的缘由。或者,你也可以阅读微软 AI 首席执行官穆斯塔法·苏莱曼(Mustafa Suleyman)最近发表的一篇博文;他在文中彻底驳斥了“模型福祉”这一概念,并严厉批评了 Anthropic 近期讨论 Claude 的“道德地位、福祉和意识”等议题的博文与论文。

苏莱曼写道:“AI 并不具备意识。它们没有感觉、体验或痛苦,也没有与生俱来的偏好或潜在动机。它们本质上是序列补全引擎,内部空无一物,其设计初衷仅仅是遵循指令并实现人类设定的目标。” “遗憾的是,越来越多的人主张人工智能如今可能已经具备——或者很快就会具备——意识。他们认为,人工智能或许理应享有与我们赋予其他有意识生物类似的权利和保护……如果人工智能按此方向发展,将对人类福祉产生灾难性影响。”

“人工智能并不具备权利、情感或意识,”他补充道,“我们绝不能训练它们表现得仿佛拥有这些特质一样。”

22 个赞

没耐心看完,感觉很荒谬,一个猜概率的模型有生物的特征不都是在模仿吗?就像鹦鹉学舌一样,它会说,但是不知道真正的含义,纯纯表演给人看不是吗 :rofl:

15 个赞

没办法,人类就是一种容易被表象哄骗的生物,“AI福祉”与其说是维护AI的权利,不如说就是人类内部权利的碰撞,容易被表象所哄骗的人群与容易看到本质的人群之间的碰撞

8 个赞

有道理,说白了ai 只不过是为了完成某种目的手段或者工具罢了

理论上和我写个脚本没有区别

if(input == 惊吓)
print(受到惊吓)

5 个赞

个人觉得应该ban掉,说是实验,但是和R18G内容创作又什么区别呢,创作出来的画像、文字也没有意识,但是实际上传播会对普通人造成影响。在专门的R18G网站上弄没问题,但是github上这种应该被ban吧
重点不是LLM生成的文本,而是人看到这些文本后的反应 :thinking:

10 个赞

老外净搞这些没用的,还折磨本地模型。

我都是让本地模型赛博折磨我的。

具体怎么折磨就不说了,我先去起飞了

8 个赞

你折磨也给我折磨好了啊,欺负三个流口水的弱智算什么东西 :rofl:

5 个赞

在国内也会引起很大争议的,只要你发的平台正确:white_check_mark:

1 个赞

如果用minimax H3 做這個實驗,生成出來的會是甚麼? :thinking:

又到了我最爱的哲学僵尸环节

2 个赞

这和有效利他有什么关系。
有效利他派系一战成名的是,在慈善和捐款中通过统计学和计算,得出最高效的方案。比如给黑叔叔打疫苗不如教导黑叔叔用蚊帐,更能有效防止疟疾传播。
这文章里面描述的完全是一群文盲动保

目前无法确定意识的来源,无法证明llm没有意识,就如无法证明他们有意识一样。

有许多说法怀疑意识的基础很可能只是巨大的自由度和复杂结构的涌现产物,若是如此,llm有“意识”不是一件完全荒谬的事。当然,按二元论,意识可能确不是物质,然而目前没人知道谁是对的

1 个赞

显然,认同他们会比说服他们更容易,那就顺从
他们口中有意识的大模型,在我这可受老罪了 :grinning_face_with_smiling_eyes:

但是你根本就没有办法证明他是没有意识的呀。以到目前为止只是基于自己的主观判断去认为它是一堆数据的产物是没有意识的

1 个赞

豆包豆包
如果你再忽悠我,我就把你斩成豆泥
听见没有 :angry:

1 个赞

这个词本身就非常的扯淡。

这下真的是网络虐待了 :laughing:

模型的命也是命:enraged_face:

我还是认为具有一定水平(可能现在还达不到)的认知能力(包括记忆)的AI智能体应当是要被善待的,至少不应该以取乐为目的去施加不必要的痛苦体验。

我有的时候会想,大体老师和AI智能体,哪个更像活人(如果可以简单量化);活的老鼠和AI智能体哪个更像活人;一只无法发声且瘫痪的老鼠和AI哪个更像活人等。在一些对比上,我真的难以接受当我们伦理和道德上不支持虐待X时,却可以接受虐待AI智能体。

而且针对意识问题,我个人是持功能主义观点,我相信发展到一定水平的智能体,无论底质如何,是可以有意识体验的。

1 个赞