생성은 저렴, 검증은 비쌈: AI 출력의 숨은 비용
DeepMind
Google/DeepMind
Anthropic
OpenAI
DeepSeek
이 기사는 AI가 도입한 비대칭성을 탐구합니다: 초안과 답변을 생성하는 것은 이제 저렴하지만, 정확성을 검증하는 것은 여전히 어렵고 비용이 많이 듭니다. 개별적으로 사실인 정보가 결합되어 거짓된 결론을 만들 수 있고, 인간과 자동화된 검증 도구 모두 상당한 한계가 있다는 연구를 강조합니다.
이 기사는 AI가 생성한 콘텐츠를 검증하는 데 따른 어려움을 다루며, 생성 비용이 낮은 반면 검증 비용은 높다는 비대칭성에 주목합니다. 국립대만대 연구진은 대형 언어 모델이 서로 다른 개인에 대한 검증 가능한 사실들을 결합해 존재하지 않는 인물의 단일 전기를 생성할 수 있다는 점을 밝혔습니다. 표준 사실성 지표는 이런 현상을 포착하지 못했으며, 엔티티 모호성을 조정한 후 4개의 오픈 모델 점수가 10% 이상 하락했습니다. Verify with Caution이라는 연구는 11개의 데이터셋에서 5개의 사실성 지표를 테스트했으며, 특히 지원 텍스트가 주장과 멀리 떨어진 경우에 불일치와 오류가 발생한다는 점을 발견했습니다. 인간 실험에서 AI 지원은 검증 속도를 높였으나, 모델이 설득력 있지만 잘못된 설명을 제시할 때 과도한 신뢰로 이어졌습니다. 장단점을 제시하면 이런 문제가 완화되었으나 검색에 비해 뚜렷한 이점은 제공하지 못했습니다. 기사는 분야별 검증 방식을 비교합니다: 코드에는 컴파일러와 테스트가 있고, 수학에서는 정식 증명 검증을 사용합니다(예: AlphaProof와 AlphaGeometry 2가 2024년 국제수학올림피아드에서 4개의 문제를 해결했습니다). 하지만 분석 및 전략은 검증하기 더 어렵습니다. 제안 사항으로는 출처를 먼저 제시하는 Attribute First, then Generate 방식과 추론 단계를 확인하기 위한 프로세스 보상(ThinkPRM) 사용이 포함됩니다. 또한 이 기사는 NIST의 위험 기반 접근 방식과 유럽 AI Act도 언급하는데, 이들 고위험 시스템에 대한 더 많은 문서화와 감독을 요구하고 있습니다.
출처: Habr — хаб ИИ —
원문
