如何不让我训练的AI杀了我自己?

AI资讯3年前 (2023)发布 GPTHub
17 0

大家也许还有印象,近期一则关于人工智能的恐怖“新闻”:在美军进行的一次模拟测试中,一架搭载了AI技术的无人机出现了异常,它认为操作员下达的“不许攻击”的命令是阻碍它完成任务,开始攻击人类操作员,以确保其可以更加高效地执行既定任务。

后来被证明,这只是一段被添油加醋的社交网络讹传。

类似的案例曾经更多地出现在科幻作品里:经典科幻电影《2001:太空漫游》中,人工智能HAL发狂并且杀死人类宇航员的原因,就是因为它推导出,人类宇航员会阻碍它完成任务。

但这些幻想作品中的恐慌越来越多地开始映射到了现实当中。GPT-4的出现,让AI前所未有地逼近人类。一些人工智能专家甚至认为:超越人类的强人工智能的出现,不过是未来10-20年内就会发生的事情。如果真的如此,这种涉及人类生死存亡的问题,就变得极为紧迫。

那么我们能不能找到一个办法,确保人工智能能够安全地为人类所使用,不会伤害人类?

在虚构故事里,问题的答案在80年前就已经出现:这就是阿西莫夫在著名的《我,机器人》里提出的“机器人三大定律”——这可以说是最早的人工智能安全和伦理学讨论。

我们在这里复述一下三定律:

第一定律:机器人不得伤害人类,或坐视人类受到伤害;

第二定律:机器人必须服从人类命令,除非命令与第一定律发生冲突;

第三定律:在不违背第一或第二定律的情况下,机器人必须保护自己。

这三条定律就是一个相当严密的,对于人工智能的限制和规定。它将人工智能置于一个完全服从人类,并且不得伤害人类的情境下。

那么下一个问题自然是——我们如何将这三大定律变成代码,嵌入到我们现有的人工智能程序里面?是不是有了这三大定律,我们就能高枕无忧了?

阿西莫夫写的是科幻小说,自然不用操心“如何实现”这个问题。在“机器人”系列的设定中,机器人的技术基础是“正电子脑”,一种跟现有的集成电路完全不同的计算机架构,有了正电子脑,机器人才成为可能。但是在现实世界里,将“机器人三定律”如此抽象绝对的道德概念灌输给神经网络,至少目前看来是不可能的。

《我,机器人》的原著,其实就是围绕着两个问题进行讨论和故事推演:“机器人三大定律”在什么情况下会失效?失效之后怎么办?

语义学问题就是最基本的一道门槛:如何定义“人类”?如何定义“伤害”?如何定义“冲突”?哪怕在人类自己的道德哲学中,类似的争论就没有一个绝对意义上的结论,那还怎么奢望让今天的程序和深度学习神经网络去理解这一点?

其中有一个短篇,讲的就是一个机器人偶然获得了读心能力,因为三大定律中“不伤害人类”的限制,它遇到每个人时都只会顺着对方的心意说话——因为它判断,一旦说出了让对方不舒服的真相,就造成了一种“精神伤害”。这个短篇指出了一个问题:精神伤害是否属于定律中的“伤害”?就像在社交媒体时代相互争议:网络暴力是不是暴力?

阿西莫夫在创作“机器人”系列的后期也察觉到了这个问题:字面意义上对“三大定律”的解释只会导致混沌的结果,于是他加了一个补丁,也就是“机器人第零定律”:机器人不能坐视人类整体受到伤害,或者坐视人类整体受到伤害而无动于衷。

“第零定律”讲人类束缚AI的枷锁向前更推进了一步:从“如何判断人类个体”变成了“如何判断人类整体”——一个在伦理学中更难定义的问题。

这很接近“正义论”里两种道德观念的冲突:一是“绝对主义”,也就是说存在绝对的“道德观念”,比方说,杀人就是不对的,在任何情况下都不应该杀人,这就很像机器人第一定律;第二种叫做“功利主义”,这种观念认为,一个行为是否正确,要看它是否有利,利益是否最大化。但这又出现了新的问题,就是如何定义“利益”?以及对谁利益最大化?

“第零定律”就在这里做出了一个判断:这个利益最大化的主体是“人类整体”。在这个过程中或许有些人是受损的。那人工智能能不能很好的判断“人类整体”呢?谁知道,毕竟,人类自己都做不好这个判断。

从这个角度来看,机器人三定律也的确只能是虚构写作中才会成立的事情。在人工智能还被嘲讽为“人工智障”的年代,讨论如何给它嵌入道德观念,只能算是一种无伤大雅的茶余闲谈;但是现如今,这件事情已经变得非常紧迫了。

请看下面这个思想实验:

假设你是一个人工智能,人类给你下达了一个任务:制造曲别针,越多越好。你会怎么做?

一开始,你只能使用手头现有的资源,比方说你有一卷铁丝,来做曲别针;然后你想出来更高效的办法,能够用更少的铁丝制造区别针;然后你建立了曲别针工厂;但是这个时候你没钱了,于是你去研究股市,如何赚钱,来建立更大的曲别针工厂;然后你的曲别针工厂越造越大,曲别针越来越多,这个时候人类感觉到了不对劲,开始试图阻止你;最终你得出了结论,人类的存在本来就是一种对你完成任务的阻碍;于是你毁灭了全人类,把整个地球的物质都转化成了曲别针和其制造设备。(在人工智能学界,这称之为硬接管,hard takeover)

是不是和一开始说的那个无人机的案例非常接近?这是一个人工智能学界著名的思想实验,被称之为“曲别针假说”。这个思想实验的意义在于呈现,让人工智能理解什么是“善”,是很困难的;人工智能并不会存在与人类一致的伦理道德观念,它的手段和目的可以是完全无关的。就算是最无害的目的,都可能导致非常可怕的后果。

那么,如何将人工智能的手段和目的与人类的道德和伦理观念调谐到一致的程度,让人工智能在执行任务的过程中不伤害人类,不造成可怕的后果,这就是最近非常火热的“人工智能一致性问题(AI Alignment,也有翻译成人工智能对齐问题)”。

 

“机器人三定律”就是一个最早出现的试图建构与人类有一致道德观念的人工智能的规则,这是它最有意义的地方。(当然,从这个角度来说,阿西莫夫实际上是将近代殖民文学的传统延续到了科幻写作之中:在“机器人”系列的叙事里,机器人实际上就是某种“亚人”,跟殖民文学里将殖民地有色人种视为“亚人”是一脉相承的。举个例子,假如将《鲁滨逊漂流记》里的“星期五”描写成一个机器人,恐怕故事层面也不会有什么变化。)

在《我,机器人》的最后一篇中,主角苏珊·凯文发现整个世界已经完全被机器接管,机器人根据三定律,自行推导出了一个结论:为了防止人类自相伤害,只能让机器来控制这个世界。这实际上就是“人工智能一致性”问题的一个体现:即使在如此严密AI安全性法则之下,最终的结果仍然是人工智能接管世界(在人工智能学界,这称之为“软接管”,soft takeover)。而第零定律也正是为了这个结论而打下的一个补丁。

2004年好莱坞曾经拍了一版《我,机器人》的电影,国内引进后的官方译名叫做《机械公敌》。电影在当时引起的反响很一般,观众恐怕只是对片中那辆非常酷炫的、球形轮胎、可以原地转向的奥迪概念车RSQ印象稍微深刻。实际上,电影没有采用原著的任何一个故事,而是原创了剧情:一个警察和苏珊·凯文博士调查美国机器人公司创始人朗宁博士离奇死亡的案件。而在场的只有博士自己制造的机器人桑尼,而受到“机器人三大定律”约束桑尼“不可能”杀人。

这个故事的结局的确承继了阿西莫夫在《我,机器人》里的叙事。经过一番调查和冒险之后主角团发现了真相:最终的幕后黑手实际上是美国机器人公司的中央控制系统 VIKI,她认为,最可能伤害人类的,是人类自己。想要阻止人类受到伤害,必须将人类完全控制起来,人类才不会自己作死。这实际上就是VIKI自己独自推导出了第零定律。而主角团和桑尼最终斗智斗勇破坏了VIKI,解放了所有人类和机器人。

故事的最后,他们得出结论:想要达到人类机器人和谐相处的目标,是让机器人获得情感,而非单纯的逻辑计算。

这个结局当时颇有些莫名其妙而且陈词滥调,但现在来看,是很超前的;就如同我们在上面所讨论的,让人工智能理解什么是“善”,是很困难的。纯粹的逻辑推理,就算是机器人三定律这样严苛的规则,最终都可能会导致很可怕的结局。

所以电影中俗套的答案,或许真的将成为未来的一种解决方案:让人工智能拥有与人类似的情感结构,让机器明白“己所不欲,勿施于人”,甚至“己所欲,也勿施于人”。

© 版权声明

相关文章

必读要闻一:谷歌测试医疗聊天机器人,AI医疗时代有望正式开启 谷歌云业务部门表示,正在与Mayo Clinic合作测试一项新的服务,以定制专用的医疗领域的聊天机器人。 海外“AI+医疗”发展相对成熟,已推出AI影像、诊断、制药、管理、机器人等产品。长江证券认为,多维度共同驱动之下,“AI+医疗”有望成为医疗IT行业下一个核心增长点。国内相关企业或进一步加大AI领域的研发进度,未来存在商业化进一步升级的可能。 上市公司中,朗玛信息(300288)成功开发出具有自主知识产权的医疗健康人工智能产品“朗玛·39AI全科医生”的认知水平可以达到初、中级全科医生的水平。创业慧康(300451)与浙大计算机创新技术研究院、浙江省智慧医疗创新中心签订三方战略协议,推动AI大模型在临床医疗、公共卫生、个人健康等场景中的研究与开发。 必读要闻二:这类器件有望广泛应用于光模块等多个领域 机构指出,薄膜铌酸锂调制器具有大带宽、低功耗、小尺寸等优势,有望成为调制器未来的重要发展方向。光通信、光纤陀螺、超快激光器等领域均存在对薄膜铌酸锂调制器的需求,未来增长具备广阔的市场空间。 中信建投证券表示,薄膜铌酸锂器件将大大减小尺寸,有望广泛应用于光模块和光器件等多个领域,市场规模进一步提升。根据Light Counting的预测数据,薄膜铌酸锂调制器适配的600G及以上相干光模块DSP市场,有望从2021年的1.31亿美元,增长至2027年的9.92亿美元,6年CAGR为40.06%,薄膜铌酸锂调制器行业具备较高的成长性。 上市公司中,天通股份(600330)生产的铌酸锂单晶材料是薄膜铌酸锂调制器的上游关键原材料。光库科技(300620)具备了开发高达800Gbps及以上速率的铌酸锂调制器芯片和器件的关键能力。 必读要闻三:到2027年中国游戏市场总收入或将超过570亿美元 咨询机构Niko Partners发布的一份最新报告显示,2022年中国游戏市场收入达到455亿美元,包含手机、PC和主机游戏。中国游戏公司在全球手机游戏和PC游戏的收入占比分别为47%和39%。预计到2027年,中国游戏市场总收入将超过570亿美元。 随着游戏科技不断发展,相关科技的运用早已突破游戏行业本身,在AI、VR等诸多领域也已产生作用。中信建投表示,游戏行业是AIGC的天然适用场景,是AIGC最重要的商业化方向之一。随着未来AIGC技术不断成熟,其对游戏行业将带来变革式影响。 上市公司中,顺网科技(300113)边缘算力网络可提供足量及就近的边缘算力服务,承接来自于人工智能、云游戏、工业互联网等行业对于实时算力的需求。迅游科技(300467)的“迅游网游加速器”是基于公司独立研发的SCAP,在行业内具备较高的知名度和较强的竞争优势。 必读要闻四:这一模式或快速在AI行业渗透,可最大化合理利用资源 随着AI的快速发展,算力短缺问题凸显,算力租赁或成为AI企业破局点。 华福证券指出,对于大多AI企业和行业应用企业而言,轻资产的算力租赁模式与企业资金实力和业务场景最为匹配,该模式有望快速在AI行业渗透,掌握算力资源的企业将具备非常明显的先发优势。另一方面,算力租赁业务本身也是轻资产模式,通过管理城市云的闲置资源并进行调度最大化合理利用资源,租赁收益与政府分成实现双赢,有利于城市云的进一步落地。 上市公司中,世纪华通(002602)深度参与投资的位于上海松江的腾讯长三角人工智能先进计算中心及生态产业园区项目。首都在线(300846)在10余个国家或地区建设了云网一体化的云计算节点,可为云游戏、AI、XR、数字人、数字孪生、智能制造等各领域提供算力。 钛小股·钛媒体财经研究院 2023.06.12 下载钛媒体App,关注更多财经投资机会! 更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App