recursive llama.cpp 포크에서 Bonsai-27B 실행: 전체 설정 및 RTX 3050 실제 벤치마크
cubetitled-ui
recursive llama.cpp 포크에 관한 세 번째 기사에서는 약한 GPU에서 하이브리드 Bonsai-27B 모델(Delta-Net 선형 아키텍처)을 실행하는 방법을 다루며, 암호산술 과제에서 깊이 D=0과 D=12의 실제 벤치마크를 보여줍니다. 반복을 활성화하면(D=12) 모델이 SEND+MORE=MONEY를 풀었지만, 기본 엔진은 실패했습니다. 설정 명령과 반복 환경 변수가 제공됩니다.
저자는 llama.cpp의 재귀적 포크에 대한 시리즈의 세 번째 부분을 제시하며, 선형 Delta-Net 레이어와 전체 어텐션 레이어를 혼합한 하이브리드 모델인 Bonsai-27B에 초점을 맞춥니다. 재귀는 전체 어텐션 레이어에만 적용됩니다. Q1_0 양자화에서 모델 크기는 약 3.5GB로 6GB VRAM에 들어갑니다. 이 기사는 CUDA 및 CPU용 빌드 지침과 환경 변수 RECURRENT_D(깊이: 0, 12, 24), RECURRENT_LAYERS_COUNT 및 RECURRENT_KV를 사용한 사용 명령을 제공합니다. 시드 42와 온도 0.3으로 RTX 3050 Mobile 6GB에서 실제 벤치마크를 실행했으며, 수식 암호 퍼즐 SEND+MORE=MONEY에 대해 7000 토큰 제한으로 테스트했습니다. D=0은 문제를 풀지 못한 채 7000 토큰을 생성하여 길이 제한에 도달했습니다(finish_reason: length). D=12는 6594 토큰을 생성하고 S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2로 올바르게 풀어 9567+1085=10652를 검증하고 정상적으로 중지했습니다(finish_reason: stop). 생성 시간은 두 경우 모두 약 5.5분이었으며, 속도는 D=0에서 21.1 t/s, D=12에서 19.8 t/s로 약 6% 느려졌습니다. 이 기사는 재귀가 가중치를 변경하지 않고 추론 계산 그래프만 변경한다고 언급하며, Qwen3.5, Qwen2, Gemma 2, Mistral 3 및 Delta-Net(Bonsai)을 포함한 호환 모델을 나열합니다.
출처: Habr — хаб ИИ —
원문
