연구애플리케이션 🇷🇺 03.08.2026 12:01

프롬프트 복사 두 번: '+76%' 트릭을 직접 테스트해 본 진실

Google/DeepMindGoogle/DeepMind
바이럴 라이프핵이 LLM에 프롬프트를 복사하면 정확도가 76% 향상된다고 주장합니다. 여러 Gemini 모델에서 3360개의 쿼리를 테스트한 결과, 이 효과는 실제로 존재하지만 제한적입니다. 이는 추론하지 않는 모델이 긴 목록에서 특정 실패를 겪는 문제를 해결할 뿐, 일반적인 지능 향상은 아닙니다. 유명한 +76%는 단일 스트레스 테스트 결과이며, 현대 추론 모델은 이 트릭에 영향을 받지 않습니다.
작성자는 Google Research의 사전 인쇄본 'Prompt Repetition Improves Non-Reasoning LLMs'에서 언급된 바이럴 프롬프트 중복 트릭을 테스트했습니다. 원문에서 프롬프트를 중복하면 비추론 모델이 70개 비교 중 47개에서 성능이 향상되었으며, +76% 수치는 이후 단종된 Gemini 2.0 Flash-Lite에 대한 단일 스트레스 테스트에서 나온 것입니다. 작성자는 gemini-2.5-flash-lite(추론 끔)와 gemini-3.5-flash-lite(사고 최소 및 높음)에서 3360개의 쿼리, 1.48달러로 자체 실험을 실행했습니다. 스트레스 스위트(NameIndex 및 MiddleMatch 작업)에서 프롬프트 중복은 2.5 모델의 정확도를 +38.8% 포인트 향상시켜 원래 효과를 재현했지만, 일상적인 작업에는 영향을 미치지 않았습니다. 세 번째 복사본은 +5% 포인트만 추가했으며 'Repeat:'와 같은 마커를 추가해도 차이가 없었습니다. 사고 최소로 설정된 3.5 모델에서는 효과가 지속되었지만(+36.3% 포인트), 사고 높음에서는 두 프롬프트 모두 정확도가 이미 100%였습니다. 이 트릭은 또한 비결정적 모델을 안정화했습니다. 그러나 작성자는 이 트릭이 특히 긴 목록에 대한 주의 누락을 해결하며 산술이나 기타 추론 결함은 해결하지 못한다고 지적하고, 결과가 특정 모델 ID와 날짜에 한정되며 데이터 세트가 자체 제작되었으므로 주의를 권고합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스