대규모 언어 모델의 일반적인 실패 유형: 개발자 경험에서 얻은 통찰

LLM의 한계 개요

대규모 언어 모델(LLM)은 정밀한 공간 인식, 엄격한 부정적 제약 준수, 미묘한 인간 판단을 요구하는 작업에서 지속적으로 어려움을 겪습니다. 이러한 모델들은 의미적 통합에서는 뛰어나지만, 물리적 공간에 대한 정신 모델이 필요하거나, 정보를 추가하는 대신 제거해야 하는 능력, 또는 일반적이지 않은 창의적 콘텐츠 생성이 필요한 '간단한' 작업에서는 자주 실패합니다.

공간 및 기계적 추론 실패

LLM은 물리적 또는 기하학적 공간에 대한 신뢰할 수 있는 내부 표현을 갖추지 못해, 건축 및 UI 설계에서 체계적인 실패를 겪습니다.

건축 및 UI 레이아웃

모델은 방의 노드 그래프를 상세히 제공받아도 기능적인 건축 평면도를 생성할 수 없습니다. 사용자들은 모델이 좋은 평면도의 규칙을 설명할 수는 있지만, 실제로 실행하지는 못한다고 보고합니다. 마찬가지로 UI 개발에서는 평면상의 겹치는 요소를 식별하거나 TypeScript 앱 또는 iOS 게임에서 공간적 충돌을 해결하는 데 어려움을 겪습니다.

탐색 및 게임 로직

텍스트 기반 환경에서는 공간 인식이 더욱 제한됩니다. 사용자들은 LLM이 Nethack과 같은 게임에서 사용되는 ASCII 지도를 장기적으로 탐색할 때 실패한다고 지적합니다. 체스와 같은 전략 게임에서는 외부 체스 엔진의 도움 없이 정확하게 플레이하는 데 어려움을 겪습니다.

지시사항 준수 및 제약 조건 준수

훈련을 거쳤음에도 불구하고, LLM은 특히 '부정적 제약 조건'(무엇을 하지 말 것을 지시하는 것)을 자주 무시합니다.

제거 및 편집에 대한 실패

LLM이 정보를 제거하는 데 어려움을 겪는 반복적인 패턴이 있습니다. 삭제를 명시적으로 언급하지 않으면 정보를 제거하지 못합니다. 문서에서 특정 아이디어를 삭제하라고 요청했을 때, 모델은 그 아이디어가 더 이상 관련이 없다고 말하는 문장으로 내용을 대체하는 경우가 많습니다. 슬라이드 디자인에서는 공백을 유지하는 데 어려움을 겪어, 빈 공간을 두는 대신 '독특한 디자인 요소'를 추가하려는 경향이 있습니다.

지시사항을 출력에 혼합

사용자들은 모델이 편집 지시사항을 최종 출력에 혼합하는 경우가 많다고 보고합니다. 예를 들어, 초안에서 특정 문장을 변경하라고 요청했을 때, 모델은 실제 편집된 문서 본문 안에 "X를 Y로 변경"이라는 문장을 포함하는 경우가 있습니다.

지속적인 규칙 위반

전용 구성 파일(예: CLAUDE.md)을 사용해도 모델은 종종 설정된 규칙을 위반합니다. 보고된 사례로는:

  • 명령줄 도구에서 잘못된 플래그 사용 (예: ripgrep에서 -r을 재귀용으로 사용하려는 시도, 실제로는 대체 지시어임)
  • 사용자 승인 없이 git 커밋 수행
  • Django 다중 줄 템플릿 주석에서 버그 생성

도메인별 환각 및 정확도

정밀도가 중요한 담론 식별 작업과 전문 지식 검색에서 LLM은 높은 실패율을 보입니다.

시각적 식별 및 환각

종 식별(예: 새 관찰)에서는 일반적으로 높은 정확도를 달성하지만, 소수의 경우에 '심각한 실수'를 저지릅니다. 이러한 실패는 업로드된 이미지에 존재하지 않는 물리적 특징(예: 다리 또는 꼬리 깃털 세부 사항)을 환각하여 잘못된 분류를 정당화하는 경우가 많습니다.

전문 지식 및 게임

잘 문서화된 비디오 게임의 메커니즘에 대해 자주 환각합니다. 사용자들은 Claude Opus가 Anno 1800Rainbow Six Siege와 같은 게임의 메커니즘을 위조했다고 보고했으며, 이들 게임에 대한 포괄적인 위키가 존재함에도 불구하고 말입니다.

창의성 및 인지적 갭

미묘한 인간 직관, 간결함, 또는 답을 제공하지 않고 학습자를 안내할 수 있는 능력이 필요한 작업에서 LLM은 어려움을 겪습니다.

유머와 톤

AI 생성 유머는 "지루하다"고 묘사되며, 기업 인사부 커뮤니케이션을 떠올리게 합니다. 이는 RLHF(인간 피드백을 통한 강화 학습) 때문으로, 안전을 보장하기 위해 "예민한" 또는 오해의 소지가 있는 콘텐츠를 제거함으로써 진정한 유머가 사라지게 됩니다.

교육적 안내

모델은 종종 전체 해결책을 제공하는 데 과도하게 최적화되어 있습니다. 수학이나 프로그래밍 문제에 대한 힌트를 요청했을 때, 모델은 종종 핵심 통찰이나 전체 답을 제공하여 학습에 필요한 "스포일러 경계"를 유지하지 못합니다.

프롬프트 엔지니어링

LLM이 스스로의 프롬프트를 최적화할 수 있다는 가정과는 달리, 사용자들은 모델이 스스로를 위한 프롬프트를 설계하는 데 매우 부족하다고 느낍니다. LLM이 프롬프트를 수정하려는 시도는 종종 성능 저하로 이어지며, 이는 프롬프트 설계에 대한 훈련 데이터의 품질이 낮을 가능성을 시사합니다.

기술적 및 언어적 한계

  • 키워드 검색: 의미 기반 검색에서는 강력하지만, 효율적인 키워드 검색 쿼리를 생성하는 데는 부족하여 종종 비효율적인 브루트포스 반복에 의존합니다.
  • 문자열 조작: 일부 사용자는 고급 모델이 문자열 길이 계산과 같은 기본적인 작업에서도 어려움을 겪는다고 보고합니다.
  • 문체 다양성: LLM이 생성한 텍스트는 문장 구조가 다양하지 않아 반복적이거나 기계적인 문체를 보입니다.
  • 회의 요약: 모델은 인간 대화에서 실제로 중요한 내용과 단순히 논의된 내용을 구분하지 못해, 일치하지 않는 회의 요약을 생성하는 경우가 많습니다.

Sources

관련