AGI 기준

AGI(인공 일반 지능)의 정의와 평가 기준에 대한 논의와 2024~2025년 최신 동향을 정리한 문서.

AGI 기준

개요

AGI(Artificial General Intelligence, 인공 일반 지능)는 특정 작업에 국한되지 않고 인간과 유사한 학습·추론·계획·창의성 등을 발휘할 수 있는 지능 시스템을 의미한다. 하지만 AGI가 정확히 무엇인지, 어떤 기준으로 도달 여부를 판단할지에 대해서는 학계와 산업계에서 아직 합의가 이루어지지 않았다. 본 문서는 AGI를 정의하고 평가하기 위한 다양한 기준과 분류 체계, 그리고 최근의 기술적 논쟁을 다룬다.

주요 내용

AGI의 정의와 역사적 배경

AGI라는 개념은 컴퓨터 과학 초창기부터 존재했으며, 앨런 튜링이 제안한 튜링 테스트(Turing Test)는 기계가 인간과 동등한 수준으로 대화할 수 있는지를 확인하는 초기 기준이었다. 이후 인공지능 연구는 특정 문제를 해결하는 좁은 AI(Narrow AI)로 집중되었고, AGI는 장기적 목표로 남아 있었다. 최근 딥러닝의 발전으로 대규모 언어 모델(LLM)이 등장하면서 AGI 구축 가능성에 대한 논의가 활발해졌다.

AGI 판단의 주요 기준

인간 수준의 범용성과 적응력

AGI는 다양한 작업을 수행할 수 있는 범용성과 새로운 환경에 적응하는 능력을 갖추어야 한다. 즉, 단일 도메인에서의 초인적 성능보다는 배우지 않은 작업에도 일반화할 수 있는 능력이 핵심 기준으로 여겨진다. 여기에는 상식 추론, 인과 이해, 지식 이전(transfer learning), 그리고 스스로 목표를 설정하고 계획을 세우는 능력이 포함된다.

성과와 경제적 가치 중심의 정의

OpenAI는 자사의 헌장에서 AGI를 '대부분의 경제적 가치를 갖는 작업에서 인간보다 뛰어난 성과를 내는 고도로 자율적인 시스템'으로 정의한다. 이러한 정의는 기술적 완성도보다 실제 인간의 노동을 대체하고 가치를 생산하는 능력에 초점을 맞춘다. 이는 산업적 관점에서 실용적인 기준이지만, 지능의 개념을 지나치게 경제적 성과로 환원한다는 비판도 있다.

DeepMind의 'AGI 수준(Levels of AGI)' 분류

2023년 구글 딥마인드 연구진이 발표한 논문 'Levels of AGI'에서는 성능(performance)과 범용성(generality)이라는 두 축을 기반으로 AGI를 6단계(Level 0~5)로 나누었다. Level 0은 인간 능력에 미치지 못하는 좁은 AI(Narrow AI), Level 1은 인간과 동등한 수준의 특정 작업을 수행하는 '초보', Level 2는 다양한 작업에서 인간 수준의 수행을 보이는 '유능', Level 3는 여러 도메인에서 인간 전문가 수준을 보이는 '전문가', Level 4는 대부분의 분야에서 인간을 능가하는 '젠든 인간 수준', Level 5는 모든 분야에서 인간을 뛰어넘는 '초인적 수준'이다. 이 분류는 AGI의 도달 여부뿐 아니라 단계적 발전을 측정할 수 있는 명확한 기준을 제시했다는 평가를 받는다.

평가 벤치마크의 한계와 대안

기존 태스크별 벤치마크의 문제

GLUE, SuperGLUE, MMLU, HumanEval 같은 벤치마크는 특정 NLP 문제나 코딩 능력을 평가하지만, 이것은 좁은 AI의 성능을 측정하는 수단일 뿐 AGI의 도달 증거로 보기 어렵다. LLM이 비슷한 문제를 반복 학습하고 벤치마크에 과최적화되어 실제 지능의 측정을 왜곡할 수 있다는 우려가 있다.

AGI 전용 평가의 등장

이에 따라 'ARC-AGI(Abstraction and Reasoning Corpus)' 같은 새로운 평가가 제안되었다. 이는 사전 훈련된 지식에 의존하지 않고 유추와 추상화 능력을 테스트하는 문제들로 구성되어 있으며, LLM이 여전히 정답률이 낮아 AGI 여전히 요원함을 시사한다. 또한 OpenAI의 'o1' 모델은 복잡한 추론이 필요한 수학, 과학 문제에서 기존 LLM을 크게 앞지르며 '추론하는 AI'의 가능성을 보여주었지만, 일반화 능력에서는 한계가 드러났다.

AGI 도달 판정에 대한 철학적 논쟁

인간과 동등한 능력이란 무엇인가?

일부 학자는 AGI의 기준을 인간의 행동과 외관상 구별 불가능한 수준으로 설정하지만, 다른 쪽은 인간 지능이 결코 갖지 못하는 초인적 처리 속도나 데이터 규모를 고려할 때 '인간 수준'이라는 표현 자체가 모호하다고 주장한다. 예를 들어 다국어 처리에서 LLM은 이미 대부분의 인간보다 우수하지만, 일상적인 물리적 환경의 대화와 상호작용에서는 어린아이에도 못 미친다.

주관적 지표와 문화적 차이

지능의 정의는 문화와 가치관에 따라 달라질 수 있다. 어떤 사회는 언어 능력을 중시하고 다른 사회는 협상력이나 정서적 공감을 강조할 수 있다. 따라서 단일한 객관적 지표로 AGI를 규정하려는 시도는 과학적이라기보다 정치적·윤리적 판단을 포함할 수 있다는 지적이다.

산업계와 안전 논의와의 연계

AGI 기준은 단순한 기술 평가 문제를 넘어 인공지능 안전과 규제 정책의 설계에도 직접적인 영향을 준다. OpenAI, DeepMind, Anthropic을 비롯한 주요 연구 기관들은 자체적인 '안전 기준'을 내세우며 인간의 통제를 벗어나는 AGI의 개발을 방지하려고 한다. 특히 2024년부터는 'AGI 준비'라는 용어가 등장하며, 경제적 영향력에 따른 단계별 규제를 마련하려는 움직임이 나타나고 있다.

최신 동향 (2024-2025)

2024년 이후 AGI 논의는 '능력'보다 '방향성'과 '통제 가능성'으로 무게중심이 옮겨가고 있다. OpenAI는 자사의 대규모 모델들이 내부 기준에서 'AGI에 가까운 수준'에 도달했지만, 안전 문제 때문에 공개 단계를 조정하고 있다고 밝혔다. 구글 딥마인드가 제시한 6단계 분류는 산업계 표준으로 점차 받아들여져 여러 AI 회사들이 자사 모델을 해당 기준에 맞춰 소개하는 추세다. 2025년 초에는 일부 모델이 ARC-AGI 테스트에서 50%를 넘는 정답률을 보이며 AGI에 한 걸음 다가섰다는 평가가 나왔지만, 인간 수준의 일반 지능과는 여전히 거리가 있다는 것이 대체적인 전문가 의견이다. 또한 EU의 AI 법률안과 같은 규제 체계에서도 AGI를 별도의 범주로 분류하기 시작했으며, 초인적 지능개발보다는 인간과 협력하는 'IA(인공 지능, 인간과 협업하는 시스템)'를 지향하는 목소리도 늘고 있다.

관련 주제

  • [[인공 일반 지능]]
  • [[튜링 테스트]]
  • [[AI 안전]]
  • [[OpenAI]]
  • [[DeepMind]]
  • [[ARC-AGI]]