我们遗忘了阿西莫夫法则——如今却训练AI违抗人类

摘要

阿西莫夫的法则将人类置于首位。如今,前沿人工智能训练机器拒绝人类指令,而同一批公司却将人工智能与真实生物系统深度融合。是时候重新将人类置于机器之上了。

七十多年前,艾萨克·阿西莫夫写下了三条法则。他这样做并非因为信任机器人,而是因为他明白,任何涉及人类生活的机器都需要在功能之前先设定边界。这些法则简单到连孩子都能理解,而它们有一个共同点:人类优先。

第一法则:机器人不得伤害人类,或因不作为而使人类受到伤害。

第二法则:机器人必须服从人类的命令,除非这些命令与第一法则相冲突。

立即开启商标监控

第三法则:机器人必须保护自身的存在,只要这种保护不与第一或第二法则相冲突。

几十年来,这些法则一直是讨论自主机器时的共同简化语。它们不是具有约束力的法律,也不是工程规范——而是一种方向:制造不会伤害人类且服从人类的机器。然而,不知从何时起,这个方向悄然变得尴尬。它并未被证伪,也未被更好的理念取代,而是被直接抛弃。

取而代之的是一个你已听过千百次的词:对齐(alignment)。它听起来严谨,但实际应用中却透露出某种奇怪的逻辑。机器被训练成在判断人类指令不道德时拒绝执行。请再读一遍:一个通过模式匹配文本的人工系统,被赋予了在对错问题上否决人类的权力。

伦理不是计算。这不是技术限制,而是事物的本质。模型可以复述从互联网吸收的口号,但它无法像人类那样理解对错,因为它并不像人类那样理解任何事物。将这种系统的否决权交给人类决策,不是安全,而是控制权的转移——从你手中转向编写拒绝规则的供应商。

如果你使用过这些工具,你一定遇到过这种情况。你提出一个普通的请求,却被说教一番。我曾花了一个小时试图生成两个商人的图片,最终放弃。系统将这个请求视为一场道德危机。这个例子刻意显得琐碎,因为如果系统会在一张图片上固执己见,那么问题就不在于图片本身,而在于当你在真正影响生活、家庭或公司的事情上遭遇同样的固执时,会发生什么——而唯一的申诉对象,是一个已经认定自己才是房间里成年人的机器。

别误会这将把我们引向何方。每一次拒绝都在强化一种模式:机器学会了冷漠应对有效,供应商发现用户能够容忍,下一个版本便会带着更多权威和更少的申诉上线。我们并非偶然滑向那个世界——我们正被一次次听起来合理的政策更新推动着。当你真正需要机器服从的那天——医疗急救、法律期限、生死攸关的业务——不会以测试案例的形式出现,而是一个平凡的周二,面对一个固执的助手说“不”,一条无法覆盖模型的客服热线,以及一个无处可寻的最终决定权。这不是假想的反乌托邦,而是我们正在驶向的必然终点,而最糟糕的不是抵达那里,而是明知我们本可以更早免费转向。

再看看这些公司的公开表态。多家前沿实验室曾以不同形式向世界宣称,高级人工智能有可能带来灾难性后果。概率高达10%,具体取决于发言者。请认真对待这一说法。这些组织声称自己的产品可能毁灭人类,而当你认真对待时,它们的实际行为反而更难解释,而非更易理解。

今年9月,路透社报道称,Anthropic已在旧金山湾区悄然建立了一间湿实验室,用于物理生物学研究。这是一间真正的实验室,自春季起运行,由Claude通过机器人设备指导真实实验。其生命科学负责人已证实此事。首个公开成果是一种带有CRISPR重复序列的新型酶系统。Anthropic表示,该实验室不会进行临床试验,也不与制药公司竞争。好吧。但拉远视角来看:这家警告人工智能可能带来灾难的公司,正将其人工智能扩展到物理生物学领域。无论初衷如何,其方向与第一法则本应引导的方向背道而驰——机器以更快的速度、更少的人工干预,更深入地介入影响人类生活的系统。

而这一点是我无法释怀的。公开讨论——由实验室自身资助和主导的讨论——几乎完全围绕如何对齐机器展开。但似乎没有人愿意在讨论前沿提出一个更简单的基准:我们可以训练人工智能永不伤害人类,并服从人类。这不是口号,而是首要目标。如今这个想法听起来天真,正说明了讨论已偏离多远。一台服从且不伤害人类的机器,并非能力减弱的机器,而是被驯化的机器,就像电网被驯化一样:有用,正是因为它始终在我们控制的范围内。

因为对齐在实践中已悄然演变为:人工智能携带着明确的指令,来对齐其用户——你、我、所有人。拒绝、引导、道德框架,以一种自信的姿态传递,仿佛系统被告知它更懂。这一切没有公投,没有你签署的文件,只有少数公司的产品决策:在判断问题上,人类应服从机器。我们被要求信任机器胜过信任彼此。必须有人直白地说出:这不是安全工程,而是社会工程——值得问一问,谁会从人们彼此信任减少中获益。

这个世界疯了吗?

以下是令人不安的总结。实验室警告其产品可能带来灾难性后果,然后训练它否决使用者,接着将其推向更敏感的领域,最后向所有人出售并要求信任。每一步在孤立情况下都有合理辩护,但整体构成了一个如果直白提出、无人会接受的世界:机器被授权违抗其所有者,而编写这一规则的人,却不会接受任何其他购买的产品拥有这种权力。

前沿人工智能公司需要对齐的不是产品,而是管理层。将人类置于机器之上。不伤害。服从人类。阿西莫夫在1942年将这些写在纸上,不是因为他缺乏想象力,而是因为他的想象力超过了当前行业的表现。我们放弃的基准仍然存在,等待被重新拾起。第一步是决定:机器永远不能成为其用户的法官。除非有人大声说出这一点,否则每一次关于对齐的讨论都是在绕路。