AGI标准
概述
AGI(Artificial General Intelligence,人工通用智能)是指不局限于特定任务,能够发挥与人类相似的学习、推理、规划、创造力等能力的智能系统。然而,关于AGI究竟是什么、以及应以何种标准判断其是否达成,学术界和产业界尚未达成共识。本文讨论了定义和评估AGI的各种标准、分类体系,以及近期的技术争论。
主要内容
AGI的定义与历史背景
AGI的概念自计算机科学初期就已存在,艾伦·图灵提出的图灵测试(Turing Test)是检验机器能否以与人类同等水平进行对话的早期标准。此后,人工智能研究集中于解决特定问题的狭义AI(Narrow AI),AGI则作为长期目标保留。随着近年来深度学习的进步,大规模语言模型(LLM)的出现使构建AGI的可能性讨论变得活跃起来。
判断AGI的主要标准
人类水平的通用性与适应能力
AGI必须具备能够在多种任务上执行的通用性,以及适应新环境的能力。也就是说,与在单一领域中的超人表现相比,能够泛化到未学习过的任务的能力被视为核心标准。这包括常识推理、因果理解、知识迁移(transfer learning),以及自主设定目标并制定计划的能力。
以绩效和经济价值为中心的定义
OpenAI在其章程中将AGI定义为“在大多数具有经济价值的工作中表现优于人类的高度自主系统”。这种定义更侧重于实际替代人类劳动并创造价值的能力,而非技术完善度。虽然这是产业视角下的实用标准,但也有批评指出它将智能的概念过度还原为经济绩效。
DeepMind的“AGI水平(Levels of AGI)”分类
2023年,谷歌DeepMind研究团队发表的论文“Levels of AGI”基于性能(performance)和通用性(generality)两个轴,将AGI分为6个阶段(Level 0~5)。Level 0是未达到人类能力的狭义AI(Narrow AI),Level 1是在特定任务上达到人类同等水平的“新手”,Level 2是在多种任务上展现出人类水平表现的“胜任”,Level 3是在多个领域达到人类专家水平的“专家”,Level 4是在大多数领域超越人类的“大师”,Level 5是在所有领域超越人类的“超人水平”。这一分类被认为不仅提出了AGI是否达成的判定,还提供了可以衡量阶段性发展的明确标准。
评估基准(Benchmark)的局限与替代方案
现有按任务划分的基准的问题
GLUE、SuperGLUE、MMLU、HumanEval等基准虽然评估特定的NLP问题或编程能力,但它们只是衡量狭义AI性能的手段,难以视作AGI达成的证据。人们担忧LLM通过重复学习类似问题并对基准过度优化,可能扭曲对真实智能的衡量。
AGI专用评估的出现
为此,诸如“ARC-AGI(Abstraction and Reasoning Corpus)”的新评估被提出。它由不依赖预训练知识、测试类比推理和抽象能力的问题构成,LLM的准确率仍然偏低,表明AGI仍很遥远。此外,OpenAI的“o1”模型在需要复杂推理的数学和科学问题上大幅超越现有LLM,展示了“会推理的AI”的可能性,但在泛化能力上仍暴露出局限。
关于AGI达成判定的哲学争论
与人类同等能力究竟意味着什么?
一些学者将AGI标准设定为在行为和外观上与人类无法区分的水平,但也有观点认为,考虑到人类智能永远无法具备的超人处理速度和数据规模,“人类水平”这一表述本身就十分模糊。例如,在多语言处理中,LLM已优于大多数人类,但在日常物理环境中的对话和互动却不如儿童。
主观指标与文化差异
智能的定义可能随文化和价值观而不同。一些社会重视语言能力,另一些社会则可能强调谈判能力或情感共情。因此,试图以单一的客观指标来规定AGI,可能包含政治和伦理判断,而非纯粹科学。
与产业界及安全讨论的关联
AGI标准不仅是技术评估问题,也直接影响人工智能安全与监管政策的设计。OpenAI、DeepMind、Anthropic等主要研究机构纷纷提出各自的“安全标准”,试图防止开发超出人类控制的AGI。尤其自2024年起,“AGI Ready”等术语出现,出现了根据经济影响力制定分阶段监管的动向。
最新动向(2024-2025)
2024年以后,AGI讨论的重心正从“能力”转向“方向性”和“可控性”。OpenAI表示,其大规模模型已按照内部标准达到“接近AGI的水平”,但由于安全问题正在调整公开阶段。谷歌DeepMind提出的6级分类逐渐被产业界接受为标准,多家AI公司开始按照该标准介绍自家模型。2025年初,部分模型在ARC-AGI测试中准确率超过50%,被认为向AGI迈进了一步,但大多数专家意见仍认为与人类水平的通用智能尚有距离。此外,在欧盟AI法案等监管框架中,也开始将AGI作为单独类别区分,并且越来越多的人主张发展与人协作的“IA(智能增强/人机协作系统)”,而非超人智能开发。
相关主题
- [[人工通用智能]]
- [[图灵测试]]
- [[AI安全]]
- [[OpenAI]]
- [[DeepMind]]
- [[ARC-AGI]]