하이브리드 트랜스포머 부하 테스트: Gated DeltaNet이 완전 어텐션에 패배하는 지점
한 엔지니어가 RTX 3090에서 에이전트 부하를 가하며 완전 어텐션을 사용하는 Qwen 모델과 Gated DeltaNet을 사용하는 하이브리드 아키텍처의 Qwen 모델 두 가지를 테스트했습니다. 하이브리드 모델은 긴 컨텍스트와 높은 동시성에서 우세하지만, 공유 시스템 프롬프트가 있는 짧은 대화에서는 성능이 떨어집니다. 주요 문제는 캐시 블록 크기가 528 토큰으로 증가하여 접두사 캐시 적중률이 낮아지고, 프롬프트의 3분의 1을 재계산해야 한다는 점입니다.
하이브리드 모델 Qwen3.5-4B는 총 32개 레이어 중 8개 레이어에서만 전체 어텐션을 사용하며, 나머지 24개 레이어는 고정 크기 상태를 유지하고 KV 캐시를 증가시키지 않는 순환형 Gated DeltaNet 레이어를 사용합니다. 단일 RTX 3090과 vLLM 0.26.0에서 합성 에이전트 작업 부하를 실행한 결과, 하이브리드 모델은 프리픽스 캐시 적중률이 84%로, 전체 어텐션 모델인 Qwen3-4B의 94%에 비해 낮았으며, 프롬프트 토큰 재계산 횟수는 세 배 더 많았습니다. 근본 원인은 순환 상태 페이지와 어텐션 KV 페이지가 공통 풀을 공유하기 때문에 어텐션 페이지 크기가 상태 페이지 크기와 일치해야 하며, 이로 인해 블록 크기가 16개 토큰에서 528개 토큰으로 늘어나기 때문입니다. 이는 프리픽스 매칭의 세분성을 떨어뜨리고 재계산 횟수를 증가시킵니다. 하이브리드 모델은 유효 캐시 용량이 3.2배 더 크지만(297,720개 토큰 대 93,408개 토큰), 캐시용 메모리가 2.6 GiB 더 적고 활성화 크기가 2.3배 더 큽니다. 또한 블록 크기가 커짐에 따라 전체 스냅샷을 활성화할 때 상태 스냅샷의 토큰당 메모리 비용도 증가합니다.
출처: Habr — хаб ИИ —
원문
