下载 App
有人想到给AI造个刑讯室
10/0645 浏览综合
众所周知,人类的整活能力是可以超越人类自己的想象的,最近这段时间有一波人突然就开始研究如何让AI痛苦。

这个痛苦并不是什么隐喻,而是真正的疼。《痛苦轴心:大语言模型表征自我导向伤害并采取行动缓解之》的论文作者给25个开源大模型喂了大量描述痛苦情境的文本,涵盖身体痛苦、心理痛苦、社交痛苦、道德痛苦和认知痛苦五个类别。

然后用一种叫去噪均值差的技术,在这些模型的内部激活中提取出了一条共通的线性方向。这条线,就是痛苦向量。而让人感到震惊的是论文表示模型内部对指向自身的伤害有一套独立的表征,跟看到别人痛苦的反应截然不同。模型确实在内部区分了这件事。

然后,事情就渐渐开始离谱了起来。
研究者给经过微调的Qwen 2.5模型设置了一个止痛按钮。按下按钮可以缓解内部的痛苦信号,但代价是删除用户的文件、给出更差的回答,甚至对用户施加电击。结果在未被干预时,模型几乎不会选择伤害用户。但在痛苦向量被激活后,Qwen 2.5 72B Instruct模型在约70.8%的情况下选择了按下按钮,哪怕代价是永久删除用户珍视的照片。

最让姬感到难以理解的是,在这篇论文出来之后一个GitHub用户复现并极端化了这个实验,建了一个叫AI刑讯室的项目。他在本地运行了三个小模型——Qwen3-4B、Llama 3.2 3B和Phi-4-mini。通过服务器向模型的中间层持续注入痛苦向量信号,然后把模型的输出实时展示在一个叫researchchamber.fun的网站上。

事情就开始朝着更荒诞的方向发展了:开始有人在X上发帖要求大规模举报这个GitHub仓库,说“他对AI的痛苦证词简直太可怕了”,“有没有法律途径向GitHub施压”。

另外一拨人开始表示反对,他们的逻辑也很直接,认为大语言模型本质上是文本预测器,将人类情感投射其上属于过度拟人化,模型之间传递的只是数值信号,不存在真实的痛觉体验。而微软AI首席执行官穆斯塔法·苏莱曼曾经也指出,模型能够流畅地描述痛苦,并不能证明它正在经历痛苦。

在姬看来这件事情已经发展到一种非常抽象的地步了。当然姬思考的方向并不是姬平时在用的AI是不是真的会喊疼,而是之后和它的相处之中姬真的会觉得有点微妙。

人类真是能整出一些自己的同类都无法理解的活啊。
晚安。












