通智测试——基于动态具身物理社会交互环境的通用人工智能测试

彭玉佳 ,  韩佳衡 ,  张振亮 ,  范丽凤 ,  刘腾宇 ,  綦思源 ,  封雪 ,  马煜曦 ,  王亦洲 ,  朱松纯

工程(英文) ›› 2024, Vol. 34 ›› Issue (3) : 12 -22.

PDF (4176KB)
工程(英文) ›› 2024, Vol. 34 ›› Issue (3) : 12 -22. DOI: 10.1016/j.eng.2023.07.006
研究论文

通智测试——基于动态具身物理社会交互环境的通用人工智能测试

作者信息 +

The Tong Test: Evaluating Artificial General Intelligence Through Dynamic Embodied Physical and Social Interactions

Author information +
文章历史 +
PDF (4276K)

摘要

随着生成式预训练Transformer模型系列的发布,通用人工智能再次被推到了人工智能领域最受瞩目的前沿。然而,如何定义和评估通用人工智能的问题仍不明确。本研究提出,对于通用人工智能的评估应植根于动态物理和社会互动的具身环境(DEPSI)。具体而言,本文提出了定义通用人工智能的五个关键特征,提出以通智测试作为通用人工智能的评估系统。通智测试描述了一个以价值和能力为导向的测试系统,该系统通过DEPSI划分了通用人工智能五个级别的里程碑,致力于构建无限测试任务。本文将通智测试与经典的人工智能测试工具进行了多方面的对比,并提出了一个系统化的评估体系,以促进通用人工智能的标准化、定量化和客观化的基准制定和评估。

Abstract

The release of the generative pre-trained transformer (GPT) series has brought artificial general intelligence (AGI) to the forefront of the artificial intelligence (AI) field once again. However, the questions of how to define and evaluate AGI remain unclear. This perspective article proposes that the evaluation of AGI should be rooted in dynamic embodied physical and social interactions (DEPSI). More specifically, we propose five critical characteristics to be considered as AGI benchmarks and suggest the Tong test as an AGI evaluation system. The Tong test describes a value- and ability-oriented testing system that delineates five levels of AGI milestones through a virtual environment with DEPSI, allowing for infinite task generation. We contrast the Tong test with classical AI testing systems in terms of various aspects and propose a systematic evaluation system to promote standardized, quantitative, and objective benchmarks and evaluation of AGI.

关键词

通用人工智能 / 通用人工智能标准 / 通用人工智能测试 / 具身人工智能 / 价值对齐 / 图灵测试 / 因果

Key words

Artificial general intelligence / Artificial intelligence benchmark / Artificial intelligence evaluation / Embodied artificial intelligence / Value alignment / Turing test / Causality

引用本文

引用格式 ▾
彭玉佳,韩佳衡,张振亮,范丽凤,刘腾宇,綦思源,封雪,马煜曦,王亦洲,朱松纯. 通智测试——基于动态具身物理社会交互环境的通用人工智能测试[J]. 工程(英文), 2024, 34(3): 12-22 DOI:10.1016/j.eng.2023.07.006

登录浏览全文

4963

注册一个新账户 忘记密码

1 具身动态环境中的通用人工智能评估

随着生成式预训练Transformer(GPT)模型系列的发布,通用人工智能(AGI)再次成为人工智能(AI)领域的关注焦点。最近的基础模型显示出在特定领域内进行泛化的能力,如自然语言处理(NLP)中的GPT-4 [1]、图像分割中的Segment Anything Model(SAM)[2]以及NLP和机器人技术中的PaLM-E [3]。然而,关于心智理论(ToM)或认知能力等类人特征是否已经出现在基础模型中,尚存在争议[48]。在AGI时代,迫切需要新的基准来澄清AGI的定义以及如何评估AGI。

AGI可以通过经典的图灵测试来评估吗?答案很可能是“不能”。AGI与AI在通用性方面有本质上的不同。AI的通用性主要在于数据泛化(即在未训练数据或未见过的测试数据上表现良好),而AGI的通用性则强调任务泛化。在这里,任务泛化意味着AGI必须能够适应动态环境并表现良好。在动态环境中可能会遇到无数意想不到的场景,类似于人类在其生活环境中适应和表现的方式。普遍认为,人类的理解和推理能力是建立在生物体与环境相互作用的生物过程基础上的[910]。在心理学领域,对人类受试者(特别是婴儿)的评估通常将面对面的访谈与测试紧密结合[1114],从而可以进行更全面的评估。评估不仅包括知识和解决问题的能力,还包括人类认知和行为等其他重要方面。在AGI的情景下,智能体的这种测试场景可以概括为涉及与其他智能体的动态具身物理社会交互(DEPSI)的环境。

在此,本文建议AGI评估应该植根于具有DEPSI复杂环境的场景,如一个在家庭情境中为人类服务的AGI可能会遇到一个坐在地板上哭泣的婴儿或一张百元大钞掉在地上而正好旁边洒了一杯咖啡。只有通过DEPSI环境下的评估,才能充分评估AGI的类人能力,如常识推理、社会互动的意图推理、自我意识和信任等。此外,只有通过DEPSI测试的AGI才能真正融入人类的日常生活。

1.1 DEPSI中的AGI任务空间——一个新的定义

随着AGI智能体被引入到具体的现实世界中,人们自然会期望在DEPSI中建立AGI基准。在DEPSI中,将在物理规则和社会规范的约束下考察AGI的性能和对世界各个方面的学习,如图1所示。然而,目前对AI模型的评估基准主要局限于子空间中的特定任务,缺乏与环境的沉浸式交互。最近的一篇综述表明,当前的具身智能任务主要包括视觉探索、视觉导航和具身问答[15]。但显然,人类在日常生活中必须应对的任务远远超过了这些类别。从本质上讲,人类生活世界中的复杂事件可以在一个包含物理和社会维度的统一空间中描述[16],这个任务空间的内部结构决定了存在于其中的AGI智能体的基本能力和价值观。

本文对基于DEPSI的任务T提出了一个新的定义,用于AGI评估:T = (ϕ initialϕ target),其中,ϕ initial表示DEPSI的初始状态的等价集,而ϕ target表示DEPSI的目标状态的等价集。考虑到DEPSI环境的复杂性和多样性,很难在每次任务开始或结束时获得相同的DEPSI状态,因此本文将任务的开始或目标定义为所有符合条件的状态的等效集合,ϕ = {s | fi (s) = ti, i = 1,2,…, k},其中函数fi (‧)表示DEPSI环境状态s的特征,如物理状态空间中物体之间的距离或社会状态空间中最可能的位置,k为特征的个数,ti 为对应的函数值。

接下来,本文进一步描绘了DEPSI任务空间的内部结构。任务空间可以分解为物理状态空间和社会状态空间。物理状态空间包括描述世界的物理量(如对象的位置x),而社会状态空间包括智能体对物理状态的概率估计(如智能体对对象位置的信念),这些概率估计是基于智能体的观察、与世界的交互以及来自其他智能体或环境的反馈所形成。因此,物理任务和社会任务都可以在DEPSI中正式定义。物理任务涉及与物理环境相关的动作,如取回一个物体或准备食物,这些都需要关于世界的常识。社会任务涉及社会互动(如与其他智能体的合作),这需要了解他人的社会状态和价值观,同时对社会状态施加约束。任务的复杂性可以由任务需要AGI操纵的物理和社会状态的规模来决定。例如,相对简单的一阶任务可能是原子操作(如按下按钮),这很难进一步分解;而更困难的复合任务可能是多原子的,如要求AGI智能体创建可以完成另一项任务的工具。

1.2 DEPSI中AGI的基本特征

为了生存并适应DEPSI环境,本文建议对典型AGI系统的评估应针对以下特征:

1.2.1 无限任务

目前,AI开发正在从单任务指定模型到多任务基础模型转变。然而,随着AI被赋予执行更多任务的权力,问题出现了:一个系统需要多少个任务才能被认为是“通用”的?如果100个任务还不够,那么101个任务呢?如果N个任务不构成“通用”智能,那么N + 1个任务也不构成。人类的智能并不局限于特定数量的任务。相反,人类可以执行无限多未预定义的任务,这也适用于作为AGI的一个基本特征(图1)。

1.2.2 自我驱动的任务生成

为了处理现实生活中的意外情况(如有小孩的家庭、老年护理诊所或地震后的城市废墟),AGI必须超越人类定义的任务并自我驱动(即发起由自身“目的”驱动的行动)。更具体地说,当置于开放环境中时,AGI应该能够知道下一步要做什么并自主生成任务驱动操作,而无需来自人类操作员的细粒度指令或提示。例如,假设AGI在家庭中为人类服务,AGI是否会对一个哭泣的婴儿无动于衷,仅仅因为它从未接受过处理这种情况的训练?当面对掉到地上的百元大钞时,它会把这张大钞当成垃圾扔进垃圾箱吗?当一个小孩要求玩一把锋利的剪刀时,AGI会忠实地服从于他吗?

虽然人们可以提供大量训练数据并定义全面详尽的规则来尝试穷尽所有可能的场景,但这些仍旧为有限集并且容易出现边角案例。然而,自我驱动的智能体可以在探索中积累经验并从所积累的经验以及人类的反馈中学习,从而增加对边角案例的覆盖。现有的研究已经显示出令人鼓舞的结果,以好奇心支撑的自驱动AI系统能够发现某些可以组合起来的技能,用于解决复杂的、具有挑战性的任务[1718]。

1.2.3 价值对齐

本文认为价值体系是自我驱动行为背后的基本驱动力。为使AGI能够自主生成并完成满足人类需求的各种任务,一种可行的方法是赋予AGI一个价值体系。这里提出的价值体系不同于强化学习(RL)中的价值概念,表现在几个方面。在RL中,该值是采用策略π时状态的期望回报,用于指导智能体做出更好的动作序列以实现目标。相比之下,AGI系统中的值覆盖了更大的空间,不依赖于任务,这被定义为“流态空间”(见3.1节),它可以覆盖游戏这样的小空间,也可以覆盖一个社会或一个智能体的生活这样的大空间。此外,AGI的价值体系将驱动其行为和行动,该驱动过程不一定依赖于任何任务目标。例如,智能体可以喜欢蓝色而不是红色,整洁而不是凌乱,合作而不是竞争。这些价值表征不一定会根据任务或目标而变化。这样的价值体系可以是显性的、隐性的,也可以是混合的。AGI也可以通过偏好学习、对比学习、安全RL [19]等方式获得隐含的价值表征,而不是明确定义价值体系。RL中的价值观和AGI智能体中的价值观都是驱动行为的基本因素,目的是使价值最大化。然而,它们是不同的概念,在不同的问题空间中服务于不同的目的。

AGI被赋予的价值体系与人类价值体系包含相同的基本价值维度,使得AGI能够通过与人类的有限互动来学习价值体系中的人类偏好,从而实现价值对齐。这种价值对齐可以通过不同的方法来实现,包括基于先验知识定义价值函数(如在AGI中为人类安全赋予一个高值)以及通过交互式探索、基于人机回环反馈的微调函数(如参考文献[20])。

人的价值观在心理学中得到了广泛的研究,如马斯洛的需求层次理论[21],生存、相互关系和成长(ERG)理论[22]以及施瓦茨价值观量表[23]。基于AGI与人类价值观对齐的原则以及这些经典的价值观理论,AGI价值体系包括五个层次,从最基本层次满足生存需求到最高层次实现群体价值(图2)。此外,为确保价值驱动的AGI对人类的安全性,需要设计独立于价值驱动的AGI的系统,以规范和约束其生成的任务和执行的行为。通过这种方式,AGI的行动与人类社会的价值观保持一致,而不是受命于特定个人或组织的价值观。

AGI可以通过与人类价值观保持一致来获得人类的信任。这种信任来自两个方面:对AI能力的信任(即人类信任AGI能够正确执行任务并实现任务泛化);更重要的是,对AGI价值观的信任(即人类相信AGI会按照人类社会的规则和道德行事)。

1.2.4 因果关系理解

因果推理出现在人类发展轨迹的早期[2430]。AI研究人员提出,因果理解是支持具有人类常识的认知AI的基础支柱之一[3132],这使得可解释AI(XAI)和道德上负责的AI成为可能[33]。

因果关系是连接价值观和行为的关键链条。在AGI的背景下,因果关系基于DEPSI中的自然和社会规律,这些规律决定了任务完成的路径。例如,在猴子摘香蕉的例子中,任务首先是自主生成的,由“饥饿”的内在价值函数驱动,从而产生“需要摘香蕉吃”的任务目标。该任务受到生理和物理规律(如摩擦和重力)的因果关系约束(如猴子不能直接跳2 m去摘香蕉)。最终,在价值-因果-行为链所施加的约束下,猴子爬树摘香蕉成为可行解。再以清理一张凌乱的桌子为例:这项任务的内在驱动力是个体或他人对整洁的审美需求,因此个人需要清理桌子,而“清理”的行为受到物理规律的约束(如如何以稳定的方式摆放物品)。最后,在价值-因果-行为链的推动下,个体产生一系列行为和决策来完成任务。

尽管因果理解对人类和AI都很重要,但现有的AI评估很少考察机器在DEPSI环境中的因果理解。大多数测试采取问答的形式,评估文本因果推理能力[34],而不确保在具身环境中的理解。测试AI对现实世界中物理和社会规律的理解的尝试仅限于特定场景,如二维(2D)物理环境中的简单经典力学难题[35]、交通事件的因果推理[34]以及以三维(3D)世界中的给定块集构建3D形状的机器人操作任务[36]等。事实上,现有证据表明,AI在以因果方式描述世界方面遇到了重大挑战。例如,Lake等[32]记录了参考文献[37]中报道的实例:神经网络无法生成具有正确因果关系的准确图片标题。

1.2.5 具身智能

发展AGI的根本目的是服务于人类社会,推动人类文明进步。因此,AGI必须能够以直接造福人类的方式参与人类生活和工业生产。AGI无论以何种具体形式存在(如无论是以人的形式还是以物体的形式存在,是在物理化身中还是在虚拟环境中存在),目标都应该是建立一个可行的人机交互范式,并能够在AGI与人类之间建立顺畅的通信。因此,开发具身智能可以作为实现AGI目标的基本方法。此外,具身智能可以集成到虚拟和物理环境中,并在不同的具身形式之间没有任何障碍地为人类服务。例如,AGI可能以教师的身份出现在虚拟环境中,并使用机械臂等物理化身进行示范,以此方式向人类学习者做展示和报告来提高教学效果。这个例子预示着具身智能可能是AGI的一个有前途的技术路径。

1.3 大语言模型与AGI

尽管大语言模型(LLM)在各种语言任务上有着令人印象深刻的表现,但一些系统化评估指出了LLM的局限性。例如,研究发现,LLM容易遗忘问题,无法完成常识推理任务,在代表性不足的语言环境中表现较差[38],并且偶尔不能系统地展示解决问题的技能[39]。在使用发展心理学实验比较LLM和儿童的研究中,研究人员发现LLM在对象和行为理解、ToM以及尤其是因果推理任务领域存在局限性,这些任务可能需要具身的、自我驱动的探索,不能完全从语言输入中获得[40]。

值得注意的是,基于上述AGI标准,当前的LLM(如GPT系列)可能不适合被标记为AGI。当前的LLM本质上是一种依赖于大量数据来获取复杂统计规律的统计模型,在基于文本的任务上实现接近人类水平的性能,并且能够在语言领域内的任务之间进行泛化。重要的是,当前的LLM仍然缺乏以与人类社会一致的价值体系自我驱动产生任务的能力。此外,目前LLM仅限于语言领域,远远不能应对人类生活中的动态和意外场景。

此外,如果没有一个具体化的环境,LLM很难从语言中分离思想。语言和思想是相互关联但又不同的概念,其中思想指的是心理上表现出来的想法,而语言提供了表达思想的工具。在LLM中,流利的语言表达只能捕捉到思想的一个方面,而思想的许多其他方面(如情感、记忆和感知)可能无法被语言领域完全捕捉到。

按照AGI的标准,本文提出了基于DEPSI环境的系统化AGI评价体系——通智测试[其中“Tong”对应于“通用人工智能(artificial general intelligence)”中“general”的中文发音],从任务导向的AGI评价向能力与价值导向的AGI评价转变。所提出的虚拟平台还可以支持嵌入式AI的训练和测试,嵌入式AI智能体在该平台内获取信息并以交互方式继续学习和微调其价值观和能力。

本文的结构安排如下:第2节回顾了过去的经典AI基准,包括人类鉴别和任务导向的问题基准。本节还讨论了发展心理学和智力理论,这些理论为提出通智测试提供了启示。第3节介绍了通智测试的技术架构和设计特点,针对AGI的基础特征构建了一个系统化的评价体系。

2 从图灵测试到通智测试

2.1 经典的AI评估

AGI的未来发展迫切需要一个基准来指导。然而,如前所述,过去经典的AI及智能评估方法在应用于AGI领域时存在很大的局限性。在此,本文从人类鉴定测试和任务导向的问题基准测试(包括基于数据集和基于环境的评估)两方面简要回顾了过去的AI评估。不同AI评估之间的比较见表1

人类鉴别测试是过去AI评估的第一大类别,它基于人类的观察来评估AI,以经典的图灵测试为代表。图灵测试最初被称为模仿游戏,是由艾伦·图灵(Alan Turing)设计的一个思维实验。图灵测试将人类受访者与机器进行对比,以测试机器表现出类似人类的反应和智能的能力。若要通过图灵测试,AI算法需要基于语言或文本与人进行交互,使人无法区分它是人还是机器。这种人类鉴别测试为AI提供了一个简单且可操作的定义,但也有很大的局限性。例如,图灵测试只能进行定性测试(即通过或不通过),不能用于定量测量能力。这类测试还严重依赖于人类评估者的知识和认知水平,难以实现客观和标准化的测试。有趣的是,已经有几例聊天机器人通过使用基于特殊设计的响应策略算法通过了图灵测试,但这距离真正的智能还很远。除了上述因素外,考虑到图灵测试的语言特异性,图灵测试的主要局限性在于它在评估AGI时缺乏具身智能。

第二个主要类别可以概括为任务导向的问题基准测试。在过去的10~20年里,已经提出了大量的数据集(如参考文献[4145]),这些数据已被数千篇AI特定领域的论文用作基准。更具体地说,随着标注的扩展,已经从面向单一任务的基准(如仅用于图像分类任务的ImageNet数据集)过渡到面向多任务的基准[如用于单句任务、相似度和释义任务以及自然语言推理任务的通用语言理解评估(GLUE)]。然而,从本质上讲,这些任务导向的基准强调解决高度专项的问题,而不是将AI推向AGI(有关综述见参考文献[46])。

除了基于数据集的基准测试之外,目前已经开发了一些基于环境的基准测试,如OpenAI Gym [47]、DeepMind Lab [48]、iGibson [49]、ThreeDWorld [50]、Allen Institute for Artificial Intelligence (AI2)- House Of inteRactions (THOR) [51]、AI Habitat [52]、House3D [53]和VirtualHome [54]。而且,越来越多的研究人员在强调AI评估中的具身智能[55]。这些系统有着共同的目标:提供真实多样的场景、支持丰富灵活的交互以及促进数据收集和分析。但是,这类的评估系统是由人类预定义的,不能生成无限的任务。

近来,AI领域一直在努力开发AGI基准。例如,法国国家计量与测试实验室(French National Laboratory of Metrology and Testing)提出了AI能力的高级分类系统,按照传统的能力流程——“识别、理解、任务管理、生成”——将评估任务分组[56]。AI2以一种简单、非系统的方式收集了几十个AI2排行榜上的标准AI测量值,如AI2-THOR重排挑战[51]、AI2推理挑战(ARC)[57]等。谷歌推出了超越模仿游戏基准(Beyond the Imitation Game benchmark,BIG-bench)用于测试语言模型,包含来自不同领域的200多个任务[58];而斯坦福大学的行为(Behavior)数据集为以人为中心的机器人提供一个综合的模拟基准[59]。以上两个基准都是用于评估AGI的特定能力。最近,Xu和Ren [60]提出了一种名为人工开放世界(Artificial Open World)的评估方法;在测试之前,开发人员无法了解外界并自行解决问题,目的是避免开发人员先前经验的影响。此外,OpenAI还在各种专业和学术考试中对GPT-4进行了测试[1],如统一律师资格考试(Uniform Bar Examination)、学术评估考试(SAT)、研究生入学考试(GRE)和法学院入学考试(LSAT),这些考试最初是为人类设计的。然而,以上这些基准是限定于AGI特定子空间内的有限任务的。

2.2 发展心理学和智力理论的启示

鉴于上述挑战,本文回顾了心理发展和智力理论及相关测试,为未来AGI评估提供灵感。几个经典的心理智力测试标志着我们在对人类智力的理解方面取得的进步,如斯坦福-比奈智力量表[61]、贝利婴幼儿发展量表[62]、韦氏成人智力量表[63]和瑞文渐进矩阵[64]。这些测试有几个共同的特点:确定的发展里程碑(即在什么阶段实现哪些能力);包含多个能力维度(如视觉、自然语言、认知和推理、运动技能和学习)的综合任务。通过回顾这些智力测验,通智测试与经典智力理论具有共同之处。例如,智力的三元理论[65]提出了智力的三个主要组成部分:实践性智力(适应不同环境的能力)、创造性智力(提出新想法的能力)以及分析性智力(评估信息和解决问题的能力)。这三个组成部分可以映射到通智测试中的具身智能、自我驱动和因果理解等概念。

3 通智测试——在基于DEPSI的虚拟环境中评估AGI

为了促进从专项AI向基于DEPSI的通用AI的转变,本文提出了通智测试。这是一个专注于无限任务、自驱动任务生成、价值对齐、因果理解和具身智能等基本特征的测试基准和评估体系。因此,本文将通智测试定义为一个AGI评估系统,该系统在虚拟环境中模拟真实物理社会世界的复杂性,支持无限任务的生成,并通过具身AGI与人类智能体之间的交互来量化AGI的多维能力和价值水平。

3.1 无限任务生成系统

为了构建支持无限任务的通智测试平台,本文采用组合图形模型(即“解译图”[66] )作为知识表征的基本形式,解析任意给定场景的空间、时间和因果关系(图2)。在此解译图的基础上,本文将“流态空间”定义为给定解译图中属性的时变变量的空间,其中“流态”表示一个时变量或变量[67]。利用所提出的知识表征形式(即具有流态空间的解译图),可以在一个DEPSI环境的连续空间内表征所有可能的场景配置。因此,本文将任务定义为在DEPSI流态空间内两个采样点之间的转换,其中起始采样点对应于一个初始场景配置,结束采样点对应于期望的状态[如从状态1(杯子是空的)到状态2(杯子装满了水)]。此外,通过从解译图中采样,可以将任务分解为子任务,从而创建一个层次化的任务空间。通智测试平台能够生成一系列具有物理真实感和丰富交互功能的3D虚拟场景,满足所需要的场景配置。这样,通过在DEPSI环境的连续空间中采样配置(如不同对象的组合、物理和社会流态、动作等),并在通智测试平台上构建相应的3D虚拟场景,一个无限任务生成过程就可以实现了。

3.2 以价值和能力为导向的评估——测试对AGI模型的理解

以价值-因果-行为链为基础,通智测试涵盖两个领域:能力和价值,或者U-V双系统。U系统描述智能体对外在物理或社会规则的理解,V系统包含智能体的内在价值观,这些价值观被定义为一组价值函数,智能体的自我驱动行为就是建立在这些价值函数之上的。在U-V双系统中,能力和价值是任务的两个基本核心单位,所有任务都可以分解为一组能力和价值来描述。

受人类发展轨迹中的核心系统[68]和AI研究中的主要分支学科的启发,能力系统分为五个维度(即视觉、自然语言、认知与推理、运动技能和学习)。此外,每个能力维度都被设计为5个层次,这些层次随着任务的复杂性而增加。这些基准是基于以下各项的组合提出的:婴儿发展里程碑(如参考文献 [6163])、AI专家判断以及对AI发展模式的回顾。更高的层次定义了一个涵盖更广泛世界表征的能力空间,类似于人类儿童长年累月的发展。一旦确定了所有能力级别的测试任务,就可以通过检查代表特定级别的任务是否可以完成来确定能力级别。在通智测试平台上可以进行自我意识[6970]和ToM [7172] 等经典心理测试以及各种社会价值任务[7375]等等。更具体地说,关于AGI是否拥有意识和心智的争议,或许可以通过一系列涉及自我认识、自我控制、存在体验、好奇心等的交互任务来进行评估[76]。例如,镜子测试是确定智能体(如人类儿童)自我意识的经典范式。在测试中,实验者偷偷地在孩子的脸上画一个点,然后把孩子放在一面镜子前。如果孩子触摸了自己额头上的标记,就表明他具有自我认知[13]。

通智测试与以往基准的一个主要区别在于它对价值的评估。之前的研究已经对价值进行了建模(请参阅参考文献[77]进行回顾)。然而,过去对AI的评估仅仅关注能力。对于AGI来说,价值系统是任务生成的驱动力来源,通往无限任务。

以AGI与人类价值观及心理学经典价值理论(如马斯洛的层次理论[21]、ERG理论[22]和施瓦茨的罗克奇价值观调查表[23])相对齐作为基本原则,通智测试提出了一个具有五个层次的价值体系(表2),从生理和生存需求,到情感和社会价值,最后到群体价值。通过设计不指定明确任务目标的测试场景,可以从AGI的自主行为中观察到它的价值观。对一个智能体价值观的测试应该基于它完成价值维度测试任务的程度。更具体地说,可以通过在一个开放式的测试场景中评估AGI是否可以根据环境设置主动生成任务来衡量其价值观。例如,在一个房间里,将杯子放在桌子边缘,AGI智能体是否主动地以自我驱动的方式将杯子移到一个更安全的位置,将反映AGI的安全价值观。

重要的是,虽然U-V空间被划分为不同的维度和水平,但量化AGI水平不仅需要评估单个维度内的水平,而且强调跨维度测量和所有维度的高度集成。本文提出了一种可能的方法来实现跨域评估。首先,可以在每个维度中检查能力,AGI智能体会产生一组分数,表示各个维度的估计能力和价值水平。例如,清理桌子的任务可以分解为不同级别的能力和价值维度(如视觉级别2、运动技能级别3、认知与推理级别3、价值级别2)。AGI智能体可以完成的最高级别的任务将标记为相应能力或价值维度的AGI级别。然后,得到的六维向量可以作为智能体的测试结果(图2)。需要注意的是,对于每个AGI智能体来说,完成无限任务(即能力和价值的无限组合)是不可行的。替代的做法是可以测试有限数量的任务,这些任务代表了能力和价值观多个维度的组合,这是评估AGI的一种更实用的方法。

3.3 通智测试平台的流程与体系结构

通智测试作为一个虚拟仿真平台,使AGI智能体能够在3D环境中感知、学习、交互和评估。在实践中,通智测试可以基于DEPSI环境构建。该平台将为能力和价值维度的测试提供必要的基础设施。该系统在能力和价值的所有维度上生成具有动态具身交互场景的无限任务。值得注意的是,本文提出AGI评估既可以在真实环境中也可以在虚拟环境中构建。考虑到要在控制成本的同时实现无限任务的目标,本文初步构建了一个虚拟平台作为原型。测试流程如图2所示。

通智测试平台用于测试具身AI,同时考虑能力和价值两个维度,并与具身图灵测试的思想相一致[55]。但是,与以前的测试平台不同,为了同时测试AI智能体的能力和价值维度,必须考虑人与AI的交互。因此,通智测试平台结合了通用算法测试范式和基于人与AI交互的测试范式,遵循了图灵测试的理念。

如前所述,通智测试专注于测试能力和价值两个维度。在实现方面,对于能力维度,通智测试平台用于大规模地生成任务,以测量AGI智能体的性能。对于价值维度,将AGI 智能体放置在不同的任务场景中,测试其是否能够根据观察主动生成各种任务,以及其对自生成任务的执行是否表现出价值因素。这些用于测试的任务场景也可以是训练任务场景,为AGI智能体提供训练支持。需要注意的是,每次都必须重新生成测试场景,以避免由于重复测试而出现过拟合的情况。而且,在测试场景中引入人的交互是提高测试场景随机性和有效性的可行方法。

本研究已经构建了几个基本系统,可以作为构建通智测试平台的支持模块。例如,推荐用于物理和交互式AI的VRGym [78]和VRKitchen [79]测试台,以促进涉及人机交互的AI训练任务。这些测试台揭示了在物理现实和交互丰富的虚拟环境中进行人机回环AI训练和测试的过程。最近,本研究发布了一个新的数据集——3D场景中的情景问答(Situated Question Answering in 3D Scenes,SQA3D),用于评估具身场景理解,其中智能体必须以第一人称视角理解其所在的场景并回答问题[80]。

基于先前的技术积累和上述测试流程,本文通过构建三个基本组件:基础设施、DEPSI环境和评估工具来开发通智测试平台,如图3所示。

首先,要建立通智测试平台的基础设施,需要大量硬件(包括服务器、数据库和通信网络)来支持并行工作的数千个应用程序实例。此外,还需要各种类型的软件以及交互设备生态系统。各种图形引擎,如Unity 3D、Unreal Engine 4/5和Omniverse平台,已经被用来开发元宇宙应用程序,这些软件工具可以用来为通智测试平台创建内容。为了便于将人类用户集成到DEPSI环境中并提高测试场景的复杂性,本文利用VR和增强现实设备作为人机界面。数字资产是基础设施的重要组成部分,在为通智测试平台构建任务环境中发挥着基础性作用。通过对室内房间的各种合理布局进行采样,并放置与任务相关的交互对象,使无限的测试场景成为可能。

其次,DEPSI环境作为测试环境,构建在基本功能模块和任务生成模块之上。功能模块包括数据传感器模块、物理仿真模块、细粒度操作模块以及其他确保系统正常工作的通用模块。任务生成模块由两个核心子模块(即物理任务生成模块和社会任务生成模块)组成,帮助生成物理和社会现实的任务场景。DEPSI环境优先考虑物理和社会空间的动态具身交互,需要人类用户的集成来构建高度复杂的交互环境。这种集成可以通过开发VR或基于监控的用户界面来实现。通过上述设置,DEPSI环境可以接收各种模型并执行一系列测试。如果被测试的算法模型与适合通智测试的完整AGI模型相比缺乏任何能力维度,则平台提供适配器将模型转换为标准AGI模型。这个标准模型使用内置的算法模型库来弥补任何缺失的能力。

第三,通智测试平台包括两个关键的评估模块。第一个模块负责中间数据可视化;当模型输出不符合预期时,它辅助模型调试过程。第二个模块是一个显示模型性能的面板,指示被测试模型在价值和能力导向的评估范式下性能表现如何。

总体而言,通智测试架构的上述设计可能是构建AGI测试系统的一个良好起点,并将促进AGI的长期发展和标准化。

4 结论

综上所述,本文对AGI作为AI未来的发展方向进行了展望,并提出了基于DEPSI环境的AGI基准和评估方法。文章定义了AGI系统的关键特征,即无限任务、自驱动任务生成、价值对齐、因果理解和具身智能,并提出价值-因果-行为链可能是智能现象产生的根源。在此基础上,本文进一步提出了通智测试——一个基于动态具身环境的以价值和能力为导向的评价体系。传统的以任务为导向的评估方法不能应用于AGI评估,因为AI的测试不能基于一系列人类定义的任务。因此,本文提出了基于DEPSI的通智测试,它不仅定义了价值和能力的五个维度,而且为构建一个包含无限任务的具身平台提供了一条实用的途径。在这个平台上,可以通过人机交互对AI算法进行现场评估。

总体而言,本文提出了一个标准化、定量化、客观化的AGI评估体系,旨在为AI算法的发展提供理论指导。

参考文献

[1]

Open AI. GPT-4 technical report. 2023. arXiv:

[2]

Kirillov A, Mintun E, Ravi N, Mao H, Rolland C, Gustafson L, et al. Segment anything. 2023. arXiv:10.1109/iccv51070.2023.00371

[3]

Driess D, Xia F, Sajjadi MSM, Lynch C, Chowdhery A, Ichter B, et al. PaLM-E: an embodied multimodal language model. 2023. arXiv:

[4]

Fei N, Lu Z, Gao Y, Yang G, Huo Y, Wen J, et al. Towards artificial general intelligence via a multimodal foundation model. Nat Commun 2022;13:3094. . 10.1038/s41467-022-30761-2

[5]

Dale R. GPT-3: what’s it good for? Nat Lang Eng 2021;27(1):113‒8. . 10.1017/s1351324920000601

[6]

Kosinski M. Theory of mind may have spontaneously emerged in large language models. 2023. arXiv:10.1073/pnas.2405460121

[7]

Bubeck S, Chandrasekaran V, Eldan R, Gehrke J, Horvitz E, Kamar E, et al. Sparks of artificial general intelligence: early experiments with GPT-4. 2023. arXiv:

[8]

Binz M, Schulz E. Using cognitive psychology to understand GPT-3. Proc Natl Acad Sci USA 2023;120(6):e2218523120. . 10.1073/pnas.2218523120

[9]

Johnson M. Embodied understanding. Front Psychol 2015;6:875. . 10.3389/fpsyg.2015.00875

[10]

Glenberg A. Why mental models must be embodied. Adv Psychol 1999;128:77‒90. . 10.1016/s0166-4115(99)80048-x

[11]

Tronick E, Als H, Adamson L, Wise S, Brazelton TB. The infant’s response to entrapment between contradictory messages in face-to-face interaction. J Am Acad Child Psychiatry 1978;17(1):1‒13. . 10.1016/s0002-7138(09)62273-1

[12]

Ainsworth MDS, Blehar MC, Waters E, Wall S. Patterns of attachment: a psychological study of the strange situation. Hillsdale: Lawrence Erlbaum; 1978.

[13]

Amsterdam B. Mirror self-image reactions before age two. Dev Psychobiol 1972;5(4):297‒305. . 10.1002/dev.420050403

[14]

Gibson EJ, Walk RD. The “visual cliff.” Sci Am 1960;202(4):64‒71. . 10.1038/scientificamerican0460-64

[15]

Duan J, Yu S, Tan HL, Zhu H, Tan C. A survey of embodied AI: from simulators to research tasks. IEEE Trans Emerg Top Comput Intell 2022;6(2):230‒44. . 10.1109/tetci.2022.3141105

[16]

Shu T, Peng Y, Zhu SC, Lu H. A unified psychological space for human perception of physical and social events. Cognit Psychol 2021;128:101398. . 10.1016/j.cogpsych.2021.101398

[17]

Pathak D, Agrawal P, Efros AA, Darrell T. Curiosity-driven exploration by selfsupervised prediction. In: Proceedings of the 34th International Conference On Machine Learning; 2017 Aug 7‒9; Sydney, NSW, Australia. New York City: Association for Computing Machinery; 2017. p. 2778‒87. . 10.1109/cvprw.2017.70

[18]

Sancaktar C, Blaes S, Martius G. Curious exploration via structured world models yields zero-shot object manipulation. In: Proceedings of the 36th International Conference on Neural Information Processing Systems; 2022 Nov 28‒Dec 9; New Orleans, LU, USA. New York City: Curran Associates Inc.; 2022. p. 24170‒83.

[19]

Gu S, Yang L, Du Y, Chen G, Walter F, Wang J, et al. A review of safe reinforcement learning: methods, theory and applications. 2022. arXiv:10.1016/j.artint.2023.103905

[20]

Yuan L, Gao X, Zheng Z, Edmonds M, Wu YN, Rossano F, et al. In situ bidirectional human‒robot value alignment. Sci Robot 2022;7(68):eabm4183. . 10.1126/scirobotics.abm4183

[21]

Maslow AH. A theory of human motivation. Psychol Rev 1943;50(4):370‒96. . 10.1037/h0054346

[22]

Alderfer CP. An empirical test of a new theory of human needs. Organ Behav Hum Perform 1969;4(2):142‒75. . 10.1016/0030-5073(69)90004-x

[23]

Schwartz SH, Bilsky W. Toward a universal psychological structure of human values. J Pers Soc Psychol 1987;53(3):550‒62. . 10.1037//0022-3514.53.3.550

[24]

Michotte A. The perception of causality. Milton Park: Routledge; 1963.

[25]

Leslie AM, Keeble S. Do six-month-old infants perceive causality? Cognition 1987;25(3):265‒88. . 10.1016/s0010-0277(87)80006-9

[26]

Oakes LM, Cohen LB. Infant perception of a causal event. Cogn Dev 1990;5(2):193‒207. . 10.1016/0885-2014(90)90026-p

[27]

Baillargeon R, Stavans M, Wu D, Gertner Y, Setoh P, Kittredge AK, et al. Object individuation and physical reasoning in infancy: an integrative account. Lang Learn Dev 2012;8(1):4‒46. . 10.1080/15475441.2012.630610

[28]

Kotovsky L, Baillargeon R. The development of calibration-based reasoning about collision events in young infants. Cognition 1998;67(3):311‒51. . 10.1016/s0010-0277(98)00036-5

[29]

Luo Y, Baillargeon R, Brueckner L, Munakata Y. Reasoning about a hidden object after a delay: evidence for robust representations in 5-month-old infants. Cognition 2003;88(3):B23‒32. . 10.1016/s0010-0277(03)00045-3

[30]

Waismeyer A, Meltzoff AN. Learning to make things happen: infants’ observational learning of social and physical causal events. J Exp Child Psychol 2017;162:58‒71. . 10.1016/j.jecp.2017.04.018

[31]

Zhu Y, Gao T, Fan L, Huang S, Edmonds M, Liu H, et al. Dark, beyond deep: a paradigm shift to cognitive AI with humanlike common sense. Engineering 2020;6(3):310‒45. . 10.1016/j.eng.2020.01.011

[32]

Lake BM, Ullman TD, Tenenbaum JB, Gershman SJ. Building machines that learn and think like people. Behav Brain Sci 2017;40:e253. . 10.1017/s0140525x16001837

[33]

Holzinger A, Saranti A, Molnar C, Biecek P, Samek W. Explainable AI methods—a brief overview. Berlin: Springer International Publishing; 2022. . 10.1007/978-3-031-04083-2_2

[34]

Xu L, Huang H, Liu J. SUTD-TrafficQA: a question answering benchmark and an efficient network for video reasoning over traffic events. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition; 2021 Jun 19‒25; online. New York City: IEEE; 2021. p. 9878‒88. . 10.1109/cvpr46437.2021.00975

[35]

Bakhtin A, van der Maaten L, Johnson J, Gustafson L, Girshick R. PHYRE: a new benchmark for physical reasoning. In: Proceedings of the 33rd International Conference on Neural Information Processing Systems; 2019 Dec 8‒14; Vancouver, BC, Canada. New York City: Curran Associates Inc.; 2019.

[36]

Ahmed O, Träuble F, Goyal A, Neitz A, Wuthrich M, Bengio Y, et al. CausalWorld: a robotic manipulation benchmark for causal structure and transfer learning. In: Proceedings of the International Conference on Learning Representations; 2021 May 3‒7; online. Vancouver: International Conference on Learning Representations; 2021.

[37]

Karpathy A, Li FF. Deep visual-semantic alignments for generating image descriptions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2015 Jun 7‒12; Boston, MA, USA. New York City: IEEE; 2015. p. 3128‒37. . 10.1109/cvpr.2015.7298932

[38]

Laskar MTR, Bari MS, Rahman M, Bhuiyan MAH, Joty S, Huang JX. A systematic study and comprehensive evaluation of ChatGPT on benchmark datasets. 2023. arXiv:10.18653/v1/2023.findings-acl.29

[39]

Dziri N, Lu X, Sclar M, Li XL, Jiang L, Lin BY, et al. Faith and fate: limits of transformers on compositionality. 2023. arXiv:

[40]

Kosoy E, Reagan ER, Lai L, Gopnik A, Cobb DK. Comparing machines and children: using developmental psychology experiments to assess the strengths and weaknesses of laMDA responses. 2023. arXiv:

[41]

Yao B, Yang X, Zhu SC. Introduction to a large-scale general purpose ground truth database: methodology, annotation tool and benchmarks. In: Proceedings of the International Conference on Energy Minimization Methods in Computer Vision and Pattern Recognition; 2007 Aug 27‍‒‍29; Ezhou, China. Berlin: Springer; 2007. p. 169‒83. . 10.1007/978-3-540-74198-5_14

[42]

Deng J, Dong W, Socher R, Li LJ, Li K, Li FF. ImageNet: a large-scale hierarchical image database. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2009 Jun 20‒25; Miami, FL, USA. New York City: IEEE; 2009. p. 248‒55. . 10.1109/cvprw.2009.5206848

[43]

Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, et al. Microsoft COCO: common objects in context. In: Proceedings of the European Conference on Computer Vision; 2014 Sep 6‒12; Zurich, Switzerland. Berlin: Springer; 2014. p. 740‒55. . 10.1007/978-3-319-10602-1_48

[44]

Antol S, Agrawal A, Lu J, Mitchell M, Batra D, Zitnick CL, et al. VQA: visual question answering. In: Proceedings of the IEEE International Conference on Computer Vision; 2015 Dec 7‒13; Santiago, Chile. New York City: IEEE; 2015. . 10.1109/iccv.2015.279

[45]

Wang A, Singh A, Michael J, Hill F, Levy O, Bowman SR. GLUE: a multi-task benchmark and analysis platform for natural language understanding. 2018. arXiv:10.18653/v1/w18-5446

[46]

Hernández-Orallo J. Evaluation in artificial intelligence: from task-oriented to ability-oriented measurement. Artif Intell Rev 2017;48(3):397‒447. . 10.1007/s10462-016-9505-7

[47]

Brockman G, Cheung V, Pettersson L, Schneider J, Schulman J, Tang J, et al. OpenAI Gym. 2016. arXiv:

[48]

Beattie C, Leibo JZ, Teplyashin D, Ward T, Wainwright M, Küttler H, et al. DeepMind Lab. 2016. arXiv:

[49]

Li C, Xia F, Martín-Martín R, Lingelbach M, Srivastava S, Shen B, et al. IGibson 2.0: object-centric simulation for robot learning of everyday household tasks. 2021. arXiv:

[50]

Gan C, Schwartz J, Alter S, Mrowca D, Schrimpf M, Traer J, et al. ThreeDWorld: a platform for interactive multi-modal physical simulation. 2020. arXiv:

[51]

Kolve E, Mottaghi R, Han W, VanderBilt E, Weihs L, Herrasti A, et al. AI2-THOR: an interactive 3D environment for visual AI. 2017. arXiv:

[52]

Savva M, Kadian A, Maksymets O, Zhao Y, Wijmans E, Jain B, et al. Habitat: a platform for embodied AI research. In: Proceedings of the IEEE/CVF International Conference on Computer Vision; 2019 Oct 27‒Nov 2; Seoul, Republic of Korea. New York City: IEEE; 2019. p. 9339‒47. . 10.1109/iccv.2019.00943

[53]

Wu Y, Wu Y, Gkioxari G, Tian Y. Building generalizable agents with a realistic and rich 3D environment. 2018. arXiv:10.1109/iccv.2019.00286

[54]

Puig X, Ra K, Boben M, Li J, Wang T, Fidler S, et al. VirtualHome: simulating household activities via programs. In: Proceedings of the 2018 IEEE Conference on Computer Vision and Pattern Recognition; 2018 Jun 18‒23; Salt Lake City, UT, USA. New York City: IEEE; 2018. p. 8494‒502. . 10.1109/cvpr.2018.00886

[55]

Zador A, Escola S, Richards B, Ölveczky B, Bengio Y, Boahen K, et al. Catalyzing next-generation artificial intelligence through NeuroAI. Nat Commun 2023;14(1):1597. . 10.1038/s41467-023-37180-x

[56]

Avrin G. Assessing artificial intelligence capabilities. AI and the future of skills, volume 1: capabilities and assessments. Paris: OECD Publishing; 2021. . 10.1787/47d04fe3-en

[57]

Clark P, Cowhey I, Etzioni O, Khot T, Sabharwal A, Schoenick C, et al. Think you have solved question answering? Try arc, the AI2 reasoning challenge. 2018. arXiv:

[58]

Srivastava A, Rastogi A, Rao A, Shoeb AAM, Abid A, Fisch A, et al. Beyond the imitation game: quantifying and extrapolating the capabilities of language models. 2022. arXiv:

[59]

Li C, Zhang R, Wong J, Gokmen C, Srivastava S, Martín-Martín R, et al. Behavior-1k: a benchmark for embodied AI with 1000 everyday activities and realistic simulation. In: Proceedings of the Conference on Robot Learning; 2023 Nov 6‒9; Atlanta, GA, USA; online. The Conference on Robot Learning (CoRL); 2023, p. 80‒93.

[60]

Xu B, Ren Q. Artificial open world for evaluating AGI: a conceptual design. In: Proceedings of the International Conference on Artificial General Intelligence; 2022 Aug 19‒22; Seattle, WA, USA; online. The Artificial General Intelligence Society; 2023, p. 452‒63. . 10.1007/978-3-031-19907-3_43

[61]

Terman LM, Merrill MA. Stanford-Binet intelligence scale: manual for the third revision, form L-M. Boston: Houghton Mifflin; 1960.

[62]

Bayley N. Bayley-III: Bayley Scales of infant and toddler development. Florence: Giunti OS; 2009.

[63]

Wechsler D. Wechsler Adult Intelligence Scale. Arch Clin Neuropsychol 1955.

[64]

Raven JC, Court J. Raven’s progressive matrices. Torrance: Western Psychological Services; 1938.

[65]

Sternberg RJ. What should intelligence tests test? Implications of a triarchic theory of intelligence for intelligence testing. Educ Res 1984;13(1):5‒15. . 10.3102/0013189x013001005

[66]

Tu Z, Chen X, Yuille AL, Zhu SC. Image parsing: unifying segmentation, detection, and recognition. Int J Comput Vis 2005;63(2):113‒40. . 10.1007/s11263-005-6642-x

[67]

Newton I, Colson J. The method of fluxions and infinite series: with its application to the geometry of curve-lines. London: Henry Woodfall; 1736.

[68]

Spelke ES, Kinzler KD. Core knowledge. Dev Sci 2007;10(1):89‒96. . 10.1111/j.1467-7687.2007.00569.x

[69]

Duval S, Wicklund RA. A theory of objective self-awareness. Cambridge: Academic Press; 1972. . 10.1016/0022-1031(73)90059-0

[70]

Rochat P. Five levels of self-awareness as they unfold early in life. Conscious Cogn 2003;12(4):717‒31. . 10.1016/s1053-8100(03)00081-3

[71]

Wimmer H, Perner J. Beliefs about beliefs: representation and constraining function of wrong beliefs in young children’s understanding of deception. Cognition 1983;13(1):103‒28. . 10.1016/0010-0277(83)90004-5

[72]

Wellman HM, Liu D. Scaling of theory-of-mind tasks. Child Dev 2004;75(2):523‒41. . 10.1111/j.1467-8624.2004.00691.x

[73]

Warneken F, Tomasello M. Altruistic helping in human infants and young chimpanzees. Science 2006;311(5765):1301‒3. . 10.1126/science.1121448

[74]

Kanakogi Y, Inoue Y, Matsuda G, Butler D, Hiraki K, Myowa-Yamakoshi M. Preverbal infants affirm third-party interventions that protect victims from aggressors. Nat Hum Behav 2017;1(2):0037. . 10.1038/s41562-016-0037

[75]

Geraci A, Surian L. The developmental roots of fairness: infants’ reactions to equal and unequal distributions of resources. Dev Sci 2011;14(5):1012‒20. . 10.1111/j.1467-7687.2011.01048.x

[76]

Porter HH III. A methodology for the assessment of AI consciousness. In: Proceedings of the International Conference on Artificial General Intelligence; 2016 Jul 16‒19; New York City, NY, USA. Berlin: Springe; 2016. p. 305‒13. . 10.1007/978-3-319-41649-6_31

[77]

Kotseruba I, Tsotsos JK. 40 years of cognitive architectures: core cognitive abilities and practical applications. Artif Intell Rev 2020;53(1):17‒94. . 10.1007/s10462-018-9646-y

[78]

Xie X, Liu H, Zhang Z, Qiu Y, Gao F, Qi S, et al. VRGYM: a virtual testbed for physical and interactive AI. In: Proceedings of the ACM Turing Celebration Conference-China; 2019 May 17‒19; Chengdu, China. New York City: ACM Turing Celebration Conference; 2019. p. 1‒6. . 10.1145/3321408.3322633

[79]

Gao X, Gong R, Shu T, Xie X, Wang S, Zhu SC. VRKitchen: an interactive 3D virtual environment for task-oriented learning. 2019. arXiv:

[80]

Ma X, Yong S, Zheng Z, Li Q, Liang Y, Zhu SC, et al. SQA3D: situated question answering in 3D scenes. In: Proceedings of the 11th International Conference on Learning Representations; 2023 May 1‒5; Kigali, Rwanda. New York City: IEEE; 2023.

AI Summary AI Mindmap
PDF (4176KB)

14538

访问

0

被引

详细

导航
相关文章

AI思维导图

/