GPT-5.6이 스스로 최적화한다, 새로운 부트스트랩 접근법 등장
OpenAI
OpenAI의 기술 보고서에 따르면 GPT-5.6이 현재 프로덕션 환경에서 자기 자신의 런타임 환경을 최적화하는 데 적용되고 있습니다. 여기에는 트래픽 분석, 요청 라우팅 조정, 저수준 커널 재작성, 투기적 디코딩 최적화가 포함됩니다. 이러한 개선을 통해 엔드투엔드 서비스 비용이 20% 절감되었고 토큰 생성 효율이 15% 이상 증가했습니다. 한편, 인간의 감독은 계속 유지되며 최적화 목표와 배포 결정은 사람이 통제합니다.
오픈AI가 GPT-5.6에 적용된 RSI(Recursive Self-Improvement, 재귀적 자기 개선)에 대한 기술 보고서를 발표했습니다. 이 모델은 현재 프로덕션에 배포되어 트래픽을 분석하고, 라우팅을 조정하며, 트라이톤(Triton)과 글루온(Gluon) 커널을 다시 작성하고, 수백 번의 실험을 실행하여 자체 추측 디코딩 시스템을 최적화하며, 최적의 배포 파라미터(배칭, 샤딩, KV 캐시 관리)를 탐색합니다. 그 결과, 오픈AI의 엔드 투 엔드 서비스 비용이 20% 감소하고 토큰 생성 효율이 15% 이상 향상되었습니다. 주목할 만한 저자로는 트라이톤의 창시자인 필립 틸레(Philippe Tillet)가 포함되어 있습니다. 그러나 인간의 감독은 여전히 존재합니다. 인간이 최적화 목표, 도구 권한, 평가 지표 및 최종 배포 결정을 설정합니다. 또한, 오픈AI는 에이전트 루프의 반복적인 오버헤드를 줄이기 위해 러스트(Rust) 기반의 에이전트 하네스(Agent Harness)를 구축했으며, 지연된 도구 탐색(필요할 때만 도구 표시) 및 추가 전용 프롬프트 캐싱(컨텍스트 재사용 유지)과 같은 최적화를 적용했습니다. GPT-5.6 내부 테스트 기간 동안 활성 연구자당 일일 토큰 출력이 GPT-5.5 최고치 대비 두 배로 증가했으며, 내부 프로그래밍 추론을 위한 연구용 컴퓨팅은 6개월 만에 100배, 내부 에이전트 토큰 사용량은 약 22배 증가했습니다.
출처: QbitAI 量子位 —
원문
