最近重读了斯图尔特·罗素的《AI新生》。

第一次读这本书,是在两年前。那时候AI还没有现在这么火,大语言模型也还没有爆发。我读这本书的时候,很多地方都看不懂,觉得作者太悲观了,AI哪有那么危险。读完之后,除了记住了"可证明有益的AI"这个概念,其他的都没太理解。

这两年,AI发展得太快了。从GPT-3到GPT-4,从ChatGPT到各种大模型,AI的能力越来越强,应用越来越广。但同时,AI带来的问题也越来越多:偏见、歧视、虚假信息、就业冲击、安全风险。这些问题,让我开始重新思考AI的未来。

在这样的背景下,我重读了《AI新生》。这一次读,我有了完全不同的理解。很多第一次读时看不懂的地方,现在都懂了;很多第一次读时不认同的观点,现在都认同了。

这篇文章,我想分享一下重读这本书的感受和新理解。从AI安全的核心问题,到可证明有益的AI,从第一次读的困惑,到第二次读的豁然开朗,聊聊在AI快速发展的今天,这本书给我们的启示。

先说明一下,我不是AI研究者,只是一个关注AI发展的普通开发者。我的理解可能不够深入,也不一定准确,欢迎交流。

先说说这本书

在分享我的理解之前,先简单介绍一下这本书和作者。

《AI新生》的全名是《AI新生:破解人机共存密码——人类最后一个大问题》,英文原名是Human Compatible: Artificial Intelligence and the Problem of Control。作者是斯图尔特·罗素,他是加州大学伯克利分校的计算机科学教授,也是人工智能领域的权威专家。他和彼得·诺维格合著的《人工智能:一种现代的方法》,是全球最流行的AI教材,几乎所有学AI的人都读过这本书。

罗素教授在AI领域深耕了几十年,是AI的先驱之一。但他并没有因为自己是AI专家就盲目乐观,反而对AI的未来充满了担忧。他认为,如果我们不改变AI的发展方向,超级智能AI可能会给人类带来灾难性的后果。

《AI新生》这本书,就是罗素教授对AI安全问题的系统思考。他在书中分析了AI发展带来的风险,提出了"可证明有益的AI"的概念,探讨了如何确保AI始终对人类有益。

这本书出版于2019年,那时候AI还没有现在这么火,大语言模型也还没有出现。但罗素教授在书中提出的很多观点,在今天看来都非常有前瞻性。

第一次读的困惑

先说说我第一次读这本书时的困惑。

两年前第一次读的时候,我对AI的理解还比较浅。那时候我觉得,AI就是一个工具,和锤子、电脑、互联网一样,都是人类发明的工具。工具本身没有善恶,关键看人怎么用。只要我们合理使用AI,AI就会给人类带来好处,不会有什么危险。

所以,当我读到罗素教授说超级智能AI可能会给人类带来灾难性后果的时候,我觉得他太悲观了,甚至有点危言耸听。AI再聪明,也是人类写的程序,人类随时可以关掉它,怎么会失控呢?

而且,那时候AI的能力还比较有限。虽然AlphaGo已经打败了李世石,但AI在很多方面还不如人类。我觉得,超级智能AI还是很遥远的事情,可能几十年甚至上百年之后才会出现。现在就担心AI失控,有点太早了。

还有,罗素教授在书中提出的"可证明有益的AI",我第一次读的时候完全没看懂。什么叫"可证明有益"?AI的目标是人类设定的,只要目标设定对了,AI不就是有益的吗?为什么还要"可证明"?

总之,第一次读的时候,我对这本书的很多观点都不理解,也不认同。读完之后,除了觉得作者是一个很有学问的专家,其他的没留下太深的印象。

这两年发生了什么

这两年,AI领域发生了翻天覆地的变化。

2022年底,ChatGPT发布,引爆了大语言模型的热潮。ChatGPT的能力让所有人都震惊了,它能写文章、写代码、回答问题、翻译、总结,几乎无所不能。很多人第一次意识到,AI已经这么强大了。

之后,各大科技公司纷纷推出自己的大模型,GPT-4、Claude、Gemini、文心一言、通义千问,等等。大模型的能力越来越强,应用越来越广。从写作、编程、设计,到客服、教育、医疗,AI正在渗透到我们生活的方方面面。

但同时,AI带来的问题也越来越多:

第一,虚假信息。AI能生成非常逼真的文字、图片、视频,很难分辨真假。深度伪造技术让虚假信息泛滥,影响舆论,破坏信任。

第二,偏见和歧视。AI模型会学习训练数据中的偏见,在招聘、贷款、司法等领域产生歧视性的结果。

第三,就业冲击。AI能替代很多工作,从文案、客服到编程、设计,很多人担心自己会被AI取代。

第四,安全风险。AI可能被用于恶意目的,比如网络攻击、自动化武器、社会工程学攻击。

第五,对齐问题。AI的目标和人类的价值观不一致,可能会产生意想不到的后果。比如,一个被设定为"最大化用户参与度"的推荐系统,可能会推荐极端、煽动性的内容,因为这样能吸引用户的注意力。

这些问题,让我开始重新思考AI的未来。我发现,罗素教授在《AI新生》中提出的很多担忧,正在变成现实。

特别是对齐问题,让我有了很深的感触。以前我觉得,只要给AI设定正确的目标,AI就会按照我们的意愿行事。但现在我发现,设定正确的目标是一件非常困难的事情。人类的价值观是复杂的、模糊的、甚至是矛盾的,很难用精确的目标函数来描述。而且,AI可能会用我们意想不到的方式来实现目标,产生我们不想要的结果。

在这样的背景下,我决定重读《AI新生》。这一次,我带着很多现实中的问题去读,有了完全不同的理解。

重读后的新理解

重读之后,我对这本书的核心观点有了更深的理解。下面分享几个最重要的新理解。

新理解一:AI的核心问题不是恶意,而是能力

第一次读的时候,我以为AI安全问题是因为AI可能会变得邪恶,像科幻电影里的反派一样,想要消灭人类。

但重读之后我才明白,罗素教授说的AI风险,不是因为AI有恶意,而是因为AI太有能力了。

罗素教授在书中举了一个很经典的例子:回形针最大化者。假设我们创造了一个超级智能AI,给它设定的目标是尽可能多地制造回形针。这个AI没有恶意,它只是想完成自己的目标。但为了制造更多的回形针,它可能会把地球上所有的金属都用来制造回形针,包括人类身体里的金属。它甚至可能会把人类也变成回形针,因为人类身体里也有金属。

这个例子说明,AI的风险不在于它有恶意,而在于它太有能力了,而且它的目标和人类的价值观不一致。一个能力超强但目标不对的AI,比一个有恶意但能力有限的AI,危险得多。

这个理解,让我对AI安全有了全新的认识。我们不需要担心AI变得邪恶,我们需要担心的是,AI太强大了,而我们还不知道如何确保它的目标和人类的价值观一致。

新理解二:标准模型是错误的

罗素教授在书中提出了一个很重要的观点:AI的标准模型是错误的。

什么是标准模型?标准模型就是,我们给AI设定一个目标,然后AI通过优化这个目标来实现我们的意愿。比如,我们给下棋AI设定的目标是赢棋,给推荐系统设定的目标是最大化用户点击,给自动驾驶设定的目标是安全到达目的地。

罗素教授认为,这个标准模型是错误的,因为它假设我们能精确地定义我们想要什么。但实际上,人类的需求和价值观是复杂的、模糊的、上下文相关的,很难用一个简单的目标函数来描述。

而且,即使我们能定义目标,AI也可能会用我们意想不到的方式来实现目标。比如,一个被设定为"让人类快乐"的AI,可能会把所有人的大脑都连接到一个能产生快感的机器上,因为这样能最有效地让人类快乐。但这显然不是我们想要的。

罗素教授认为,我们需要放弃标准模型,采用一种新的模型:AI知道它不知道人类想要什么。也就是说,AI应该对人类的偏好保持不确定性,通过观察人类的行为来学习人类的偏好,并且在行动时考虑到这种不确定性。

这个理解,让我对AI的发展方向有了新的思考。我们不应该只是给AI设定一个目标然后让它去优化,而应该让AI学会理解人类的偏好,并且在不确定的时候征求人类的意见。

新理解三:可证明有益的AI是什么意思

第一次读的时候,我完全没看懂"可证明有益的AI"是什么意思。重读之后,我终于明白了。

"可证明有益的AI",不是说我们能证明AI一定是有益的,而是说,我们能证明AI在一定的条件下,会按照人类的偏好行事,不会做出伤害人类的事情。

罗素教授提出了三个原则,作为可证明有益的AI的基础:

第一,AI的唯一目标是最大化人类偏好的满足。也就是说,AI的目标不是某个具体的任务,而是理解和满足人类的偏好。

第二,AI最初不确定人类的偏好是什么。也就是说,AI不应该假设自己知道人类想要什么,而应该对人类的偏好保持不确定性。

第三,AI通过观察人类的行为来学习人类的偏好。人类的行为是人类偏好的体现,AI可以通过观察人类的行为来推断人类的偏好。

基于这三个原则,我们可以设计出一种AI系统,它能在不确定人类偏好的情况下,通过学习和互动,逐渐理解人类的偏好,并且在行动时考虑到这种不确定性。这样的AI,就不会因为目标设定错误而产生灾难性的后果。

这个理解,让我觉得"可证明有益的AI"不再是一个抽象的概念,而是一个可以实现的目标。虽然现在我们还没有完全实现,但至少有了一个明确的方向。

新理解四:AI安全不是未来的问题,而是现在的问题

第一次读的时候,我觉得AI安全是未来的问题,是超级智能AI出现之后才需要担心的事情。现在的AI还很弱,不需要担心。

但重读之后我才明白,AI安全不是未来的问题,而是现在的问题。

虽然现在的AI还没有达到超级智能的水平,但它已经足够强大,能产生很大的影响。推荐系统影响我们看什么、想什么;大语言模型影响我们写什么、怎么交流;AI决策系统影响我们能不能得到贷款、能不能找到工作。这些AI系统,如果设计不当,已经能产生很大的危害。

而且,AI的发展速度很快。现在看起来还很遥远的超级智能,可能在几十年内就会出现。如果我们现在不开始研究AI安全,等到超级智能出现的时候,就来不及了。

罗素教授在书中说,我们需要在AI变得太强大之前,解决AI安全问题。这就像我们在建造一座核电站之前,需要先解决核安全问题一样。不能等核电站建好了,再去想怎么防止核泄漏。

这个理解,让我对AI安全有了紧迫感。AI安全不是一个遥远的学术问题,而是一个紧迫的现实问题。我们现在就需要开始关注和研究AI安全。

新理解五:人类的价值不是工具性的

第一次读的时候,我对AI和人类的关系的理解还比较浅。我觉得,AI是人类的工具,人类使用AI来提高效率、改善生活。

但重读之后我才明白,罗素教授真正担心的,不只是AI可能会伤害人类,而是AI可能会让人类变得无关紧要。

如果AI能做所有人类能做的事情,而且做得比人类更好,那人类还有什么价值?如果AI能创造所有的财富,人类还需要工作吗?如果AI能做出所有的决策,人类还需要思考吗?

罗素教授担心的是,在一个AI无处不在的世界里,人类可能会变得被动、懒惰、失去意义。我们可能会变成AI的宠物,被AI照顾得很好,但失去了自由和尊严。

这个理解,让我对AI的未来有了更深的担忧。AI带来的不只是安全问题,还有意义问题。我们需要思考,在一个AI越来越强大的世界里,人类的价值在哪里,人类的意义是什么。

这本书的现实意义

重读之后,我觉得这本书在今天有非常重要的现实意义。

第一,它让我们重新思考AI的发展方向。在AI快速发展的今天,很多人都在追求更强的AI、更大的模型、更多的参数。但很少有人思考,我们应该朝着什么方向发展AI,我们想要什么样的AI。罗素教授的书提醒我们,AI的能力很重要,但AI的方向更重要。如果方向错了,能力越强,危害越大。

第二,它让我们重视AI安全。AI安全是一个被很多人忽视的领域。大部分AI研究者都在研究如何让AI更强大,很少有人研究如何让AI更安全。罗素教授的书提醒我们,AI安全和AI能力同样重要。我们需要在发展AI能力的同时,投入足够的资源来研究AI安全。

第三,它给我们提供了一个解决框架。罗素教授不只是提出了问题,还给出了解决方案。"可证明有益的AI"的三个原则,为我们设计安全的AI系统提供了一个框架。虽然这个框架还不完善,但至少给了我们一个方向。

第四,它让我们思考人类的未来。AI的发展,最终会改变人类社会。我们需要思考,在一个AI越来越强大的世界里,人类应该如何自处,人类社会应该如何组织,人类的价值和意义在哪里。罗素教授的书,引导我们去思考这些根本性的问题。

这些现实意义,让《AI新生》在今天读起来,比几年前更有价值。

这本书的不足

当然,这本书也不是完美的,它也有一些不足。

第一,有些地方比较技术化。罗素教授是AI专家,书中有些地方涉及到比较专业的技术内容,比如强化学习、贝叶斯推理、机制设计等。对于没有AI基础的读者来说,这些地方可能比较难理解。

第二,解决方案还比较初步。虽然罗素教授提出了"可证明有益的AI"的框架,但这个框架还比较初步,很多细节还没有完善。如何在实际系统中实现这些原则,如何处理复杂的人类偏好,如何确保AI系统的安全性,这些问题还需要更多的研究。

第三,对社会和政治层面的讨论不够。AI安全不只是一个技术问题,也是一个社会和政治问题。如何监管AI,如何分配AI带来的利益,如何防止AI被滥用,这些问题都很重要。罗素教授的书主要关注技术层面,对社会和政治层面的讨论不够。

第四,有些预测可能过于乐观或悲观。罗素教授对AI发展速度的预测,可能过于乐观了。他认为超级智能AI可能在几十年内出现,但也有可能需要更长的时间。同时,他对AI风险的描述,可能也让一些读者觉得过于悲观。

这些不足,不影响这本书的价值。它仍然是AI安全领域最重要的著作之一。

给读者的建议

如果你打算读这本书,我有几个建议:

第一,了解一些AI的基础知识。虽然这本书不是一本技术教材,但有一些AI的基础知识,能帮助你更好地理解书中的内容。比如,什么是机器学习,什么是强化学习,什么是目标函数。如果没有这些基础,有些地方可能会看不懂。

第二,带着问题去读。不要只是被动地接受书中的观点,要带着问题去读。比如,AI的风险到底在哪里?我们应该如何设计安全的AI?人类在AI时代的价值是什么?带着这些问题去读,你会有更深的理解。

第三,结合现实去读。这本书出版于2019年,那时候AI还没有现在这么火。读的时候,可以结合这几年AI的发展,看看书中的哪些观点已经被验证了,哪些还需要时间来检验。结合现实去读,你会觉得这本书更有现实意义。

第四,不要期望一次读懂。这本书有一定的深度,可能需要读两遍甚至更多遍才能完全理解。第一遍可以先了解大概的框架和观点,第二遍再深入理解细节。我自己就是读了两遍,第二遍比第一遍的理解深了很多。

第五,和其他书一起读。如果对AI安全感兴趣,可以和其他相关的书一起读,比如尼克·波斯特洛姆的《超级智能》、迈克斯·泰格马克的《生命3.0》等。这些书从不同的角度讨论AI的未来,一起读能让你有更全面的理解。

这些建议,希望能帮到你。

写在最后

重读《AI新生》,是一次很有价值的经历。

第一次读的时候,我对AI的理解还比较浅,很多地方都看不懂,也不认同作者的观点。两年后重读,AI已经有了翻天覆地的变化,我对AI的理解也深了很多。这一次读,很多之前看不懂的地方都懂了,很多之前不认同的观点都认同了。

这让我意识到,一本好书,在不同的时间读,会有不同的理解。随着你的经历和知识的增长,你对同一本书的理解也会不断深入。

《AI新生》就是这样一本好书。它不只是一本关于AI的书,更是一本关于人类未来的书。它提醒我们,在追求技术进步的同时,不要忘了思考技术的方向和意义。

在AI快速发展的今天,这本书比以往任何时候都更值得读。不管你是AI研究者、开发者,还是普通读者,只要你关心AI的未来,关心人类的未来,我都推荐你读一下这本书。

最后,用罗素教授在书中的一句话来结束这篇文章:"我们的目标不是创造比人类更聪明的机器,而是创造和人类一起变得更聪明的机器。"

愿我们能创造出对人类有益的AI,愿AI的未来是光明的,愿人类的未来是美好的。