대규모 언어 모델 논쟁: LLM은 더 다재다능해지고 있는가, 아니면 더 전문화되고 있는가?
OpenAI
Anthropic
Alibaba/Qwen
Moonshot AI
Google DeepMind
전 OpenAI 직원인 앤드류 호(Andrew Ho)는 대규모 언어 모델의 일반화 능력에 의문을 품고 고품질 훈련 데이터를 위한 스타트업을 설립했습니다. 그의 회의론은 캠브리지와 구글 딥마인드 연구자들의 관찰에 의해 뒷받침되는데, 그들은 현재의 AI 시스템이 다재다능해지기보다는 더 전문화되고 있다고 지적합니다.
Andrew Ho는 8개월 만에 OpenAI를 떠났으며, 프로그래밍과 같이 자금이 충분히 투자된 분야에서조차 대규모 언어 모델의 일반화 성능이 부족하고 능력이 고르지 않다는 점을 이유로 들었습니다. 그는 문제가 훈련 데이터의 부족에 있다고 믿으며, 경제적으로 중요한 대부분의 기술이 기존 데이터 공급에 거의 포함되어 있지 않다고 말합니다. Ho는 스케일링만으로는 충분하지 않기 때문에 AI 연구소들이 표적 데이터 확보에 1000억 달러 이상을 지출해야 할 것이라고 추정합니다. 그는 또한 OpenAI와 Anthropic 같은 프런티어 연구소의 높은 평가 가치에 회의적이며, 이들이 만성적으로 수익을 내지 못하고 Qwen이나 Kimi 같은 저가 경쟁업체와 경쟁하기 위해 지속적으로 투자해야 한다고 지적합니다. 그의 첫 제품들은 생물정보학과 일상적인 실험실 작업을 위한 데이터 세트에 초점을 맞추고 있으며, GPT-5.6 Sol과 같은 현재 모델은 약 30%의 성공률만 달성합니다. 케임브리지의 Adam Hunt는 이러한 견해를 지지하며, 최신 모델들이 더 전문화되고 코딩과 복잡한 수학 분야에서는 성장하지만 다른 분야에서는 정체되어 있다고 관찰합니다. Google DeepMind의 Tom Zahavy는 언어 모델이 연역과 귀납을 마스터하지만 창의적 가추(abduction)에는 실패한다는 구조적 설명을 제공합니다. 그는 행동 제어 가능한 세계 모델(action-controllable world model)이 해결책이 될 수 있다고 제안합니다.
출처: The Decoder (DE) —
원문
