Hacker News Goalposts: 인공지능 발전 추적과 AGI의 변하는 목표
인공 일반 지능(AGI)에 대한 탐구는 종종 '변하는 목표' 현상으로 특징지어진다. 즉, 한때 불가능하다고 여겨졌던 능력들이 일상화되면서 관찰자들이 성공의 정의를 재정의하게 된다. 최근 커뮤니티 프로젝트인 "Goalposts"는 Hacker News 사용자들이 설정한 역사적 도전 과제를 집계함으로써 이와 같은 진화와, 모델이 한 번은 작업을 수행할 수 있는 능력과 그 작업을 안정적으로 수행할 수 있는 능력 사이의 지속적인 격차를 부각시킨다.
인공지능 벤치마크의 진화
AI 벤치마크는 단순한 디지털 작업에서 복잡한 현실 세계 상호작용으로 이동했다. 2016년부터 2026년까지의 도전 과제를 분석한 결과, 커뮤니티가 '어려운 문제'라고 여기는 것에 대한 명확한 전환이 나타났다:
- 초기 도전 과제 (2016-2024): 주로 튜링 테스트, 기초 소프트웨어 공학, 간단한 에이전트 행동(예: "내 커피 주문해줘")에 초점이 있었다.
- 최근 도전 과제 (2026): 물리적 세계 상호작용(예: "물리적 문 열기"), 고도의 인지적 공감("사람의 소심함을 설득력 있게 묘사함"), 그리고 근본적인 과학적 발견("새로운 과학적 돌파구를 만듦")으로 이동했다.
이 전환은 디지털 모방과 코드 생성이 이미 대부분 해결된 것으로 내면화되었음을 시사하며, 인공지능 발전의 선두 영역이 월드 모델링과 자율적인 물리적 에이전시로 옮겨갔다는 것을 의미한다.
신뢰성 vs. 확률적 성공
모델이 브루트 포스 방식으로 결과를 달성할 수 있는 능력과 그 작업을 안정적으로 수행할 수 있는 능력 사이에 중요한 차이가 생겼다.
"많은 경우, 현재의 LLM이 무한한 계산 자원과 무한한 시도 횟수를 가진다면 최소한 한 번은 작업을 완료할 수 있을 것이라고 확신한다... 그러나 이러한 일부는 일상적인 일이 아니며, 모델은 지금 당장 해당 작업을 안정적으로 반복해서 완료할 수 없다."
이 격차는 몇 가지 구체적인 실패 유형에서 두드러진다:
- 공간 인식: 높은 투표 수로 성공이 제시되었지만, 사용자들은 선두 모델(예: Opus 5.5 및 5.6 Luna)이 여전히 ASCII 아트에서 어려움을 겪는다고 보고한다. 간단한 형태(예: 발을 기관차로 오인)를 잘못 식별하는 경우가 많다.
- 분야별 전문 지식: LLM은 훈련 데이터의 방대함으로 인해 코딩에서는 뛰어나지만, 농업, 건설, 기계 등 전문화된 물리적 업종에서는 종종 "재앙적인" 조언을 제공하거나 출처를 환상적으로 창출한다.
- 맥락적 미묘함: 인간처럼 직관이 필요한 작업, 예를 들어 체스 점수표의 실수를 플레이 수준에 따라 의도된 수를 추론하여 수정하는 작업 등에서 여전히 AI 도구는 어려움을 겪는다.
자율주행을 위한 '월드 모델' 요구
가장 논란이 많은 목표 중 하나는 자율주행 차량의 완전한 해결이다. 일부 기술 관측자들 사이에서는 자율주행이 패턴 인식만으로는 해결될 수 없으며, 예측을 위해 근본적인 "월드 모델"이 필요하다는 합의가 있다.
이 주장은, 무해한 물체(비어 있는 음료캔)와 치명적인 위험(벽돌)을 구분하는 능력이, 결과를 예측하고 실패를 피하기 위해 일반 지능(G in AGI)의 수준이 필요하다는 것을 시사한다. 포괄적인 월드 모델이 없으면, AI는 물리 세계의 예측 불가능성을 안정적으로 탐색할 수 없다.
튜링 테스트의 재정의
커뮤니티의 튜링 테스트에 대한 시각은 이진적인 통과/실패에서 인간의 인식에 대한 세밀한 논의로 진화했다. 일부는 테스트 자체가 본질적으로 결함이 있다고 주장한다. 왜냐하면 인간은 종종 정교한 "참새"와 감정을 가진 존재를 구분하지 못하기 때문에, 이 테스트는 인공지능 지능보다 인간의 믿음 쉽게 속는 성향을 측정하는 것일 뿐이다.
또한 표준 튜링 테스트와 "적대적" 튜링 테스트 사이의 구분이 이루어지고 있다. 여기서는 모델이 강한 감시 아래 장기간 동안 인간의 정체성을 유지해야 하며, 많은 사람들은 이것이 아직 달성되지 않았다고 믿는다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch