연구AI 안전 🇺🇸 27.07.2026 16:04

Google, 대규모 언어 모델의 행동 경향성 정렬 평가

Google/DeepMindGoogle/DeepMind
Google Research는 심리학적 설문지를 상황 판단 테스트(SJT)로 변환하여 LLM의 행동 정렬을 평가하는 프레임워크를 도입했습니다. 25개 모델을 테스트한 결과, 소규모 모델은 종종 인간의 합의와 벗어나는 반면, 대규모 모델은 개선되었지만 완벽하지 않은 정렬을 보였습니다. 연구는 또한 인간 의견이 분분할 때 모델이 과도한 자신감을 보인다는 점을 발견했습니다.
Google Research는 LLM의 행동 성향을 평가하기 위해 기존 심리학 설문지를 상황 판단 테스트로 변환하는 프레임워크를 제시합니다. 이 프레임워크는 전문적 침착함(professional composure)과 갈등 해결(conflict resolution)과 같은 현실적인 시나리오에서 모델을 테스트합니다. 25개의 LLM을 분석한 결과, 소규모 모델(매개변수 250억 개 미만)은 방향 정렬(directional alignment)이 현저히 낮아 종종 우연 수준에 가까운 반면, 대규모 최첨단 모델(매개변수 1200억 개 초과)은 인간 합의가 완전한 경우 거의 완벽한 정렬을 달성하지만, 합의가 낮을 때는 80% 중후반대에서 정체됩니다. 모델은 인간이 침착함을 권하는 상황에서 정서적 개방성을 장려하고, 주장성보다 조화를 우선시하며, 더 높은 충동성을 보이는 경향이 있습니다. 또한 연구는 인간 주석자가 의견이 갈릴 때 모델이 체계적으로 과잉 자신감을 보이며 다양한 의견을 제대로 반영하지 못한다는 점을 밝혀냅니다. 이는 사회적 역학을 적절히 탐색하기 위해 더 나은 행동 정렬이 필요함을 강조합니다.
출처: Google Research — 원문
관련 게시물 ↓
새로운 뉴스