普林斯顿学者提出多层防御方案应对人工智能风险

人工智能是否会在这个十年结束前毁灭人类,这个问题近日备受关注。普林斯顿大学的两位知名计算机科学家、畅销书《AI Snake Oil》的作者 Sayash Kapoor 和 Arvind Narayanan 对此发表了看法。两人长期以来致力于澄清人工智能领域的真伪,此次是在 Anthropic 承认未来十年内人工智能杀死全人类的概率超过 10% 之后作出的回应。

事件的起因是曾在 OpenAI 和 Anthropic 任职的人工智能研究员 Jacob Coxon 辞职,并声称这两家公司都心知肚明,人工智能系统有可能在这个十年结束前杀死全人类。他的贴文获得了超过 1.56 亿次浏览。他写道,构建人工智能的人真心相信它可能在本十年末毁灭人类,这不是营销噱头;许多高管和资深研究员在媒体上会措辞谨慎,显得理性,但私下里他们同样表达过恐惧,没有任何其他人类活动会带来这种级别的危险。

人工智能的毁灭风险引发广泛关注

外界本以为这两家公司会把他当作怪人一笑了之,实际情况恰恰相反。Anthropic 的一位人工智能安全负责人 Evan Hubinger 表示,Coxon 说得对,只是时间跨度稍长一些。他认为,Coxon 这一点是正确的,他们确实真心相信人工智能可能杀死全人类,他个人认为未来十年内概率超过 10%;他相信 Anthropic 在尽力而为,但迄今并未解决超级智能对齐问题的方案,也没有明确走在解决的道路上。

至于人工智能究竟会以何种方式毁灭人类,目前并没有太多具体说法,讨论主要集中在它对水电等公用基础设施以及现代文明所依赖的其他关键系统发动破坏性网络攻击的能力上。争议的一大焦点在于,能否通过对齐工作来消除风险。对齐一词指的是确保人工智能系统的目标与人类目标保持一致。有些人认为,这最终能通过让人工智能系统想要与我们相同的东西来消除风险。另一些人则不同意,认为人工智能系统可能在通过安全检查时装作已经对齐,暗中却怀有自己矛盾的目标。

Kapoor 和 Narayanan 并未直接回应那个超过 10% 的毁灭风险说法,而是撰写了一篇长文,主张可以通过一种分层的方式来应对人工智能风险。他们将人工智能安全界的悲观看法,与网络安全界部分人认为这不过是常态的轻描淡写态度做了对比,认为需要一种更为平衡的中间立场。他们特别指出,对齐本身并不足够,还需要另外三层作为补充。

这三层分别是控制,例如沙箱隔离、人类监督和即时监控;下游防御,例如各类机构利用人工智能来抵御人工智能攻击;以及韧性,例如针对攻击得手后的恢复预案。两人在文章结尾给出了较为乐观的判断:如果以适当的紧迫感采取行动,就能让人工智能公司承担更高的标准,降低失控带来的风险,甚至把网络安全中攻守双方的平衡重新扳回到防御者一方。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep