RTX 3050에서 재귀 llama.cpp 엔진: Qwen 32B 및 7B 코더 테스트 — 품질 3배 향상과 메모리 요구량
Mistral
이 글은 재귀 처리 모드를 추가한 llama.cpp 포크에 대한 기사의 두 번째 부분입니다. 저자는 RTX 3050 6 GB에서 Qwen 32B와 Qwen 2.5 Coder 7B를 테스트했으며, 표준 엔진(D=0)과 개선된 포크(D=12)를 비교했습니다. 재귀 엔진은 코드 품질을 크게 향상시켰지만(최대 3.1배 정확한 수정), 생성 속도가 약 11-13% 느려지고 VRAM 사용량이 증가했습니다.
기사의 저자는 표준 엔진(D=0)에 대해 재귀 모드(D=12로 지정)를 구현하는 llama.cpp의 포크 테스트를 계속하고 있습니다. 테스트는 RTX 3050 6GB 비디오 카드에서 실행되었으며, 모든 모델은 Q4 양자화로 설정되었습니다. 대형 Qwen 32B-A3B 모델의 경우, 쉬운 벤치마크 작업에서 두 엔진 모두 동일한 결과를 생성했지만 재귀 버전이 약간 더 느렸습니다. 어려운 부분에서는 재귀 엔진이 코드 검토 작업에서 거의 3.1배 더 많은 오류를 수정했지만, 시간은 17% 더 소요되었습니다. 저자는 재귀 엔진이 '게으른 코드 생성' 문제를 해결하여 분열된 스니펫 대신 완전한 모놀리식 스크립트를 생성한다고 언급합니다. Qwen 2.5 Coder 7B Instruct의 경우, 재귀 버전은 코드 검토에서 더 나은 성능을 보였고(버그 하나 더 발견), 풀스택 개발에서는 표준 버전이 충족하지 못한 요구 사항을 완전히 충족했으며, 2D 게임 테스트에서는 무승부였지만 재귀 엔진은 존재하지 않는 태그를 피하고 기본 게임 로직을 구현했습니다. Mistral 7B Instruct v0.2의 경우, 재귀 엔진은 보안을 크게 개선했고(98% 보호), 풀스택 플랫폼을 극적으로 개선했으며(2.2배 개선, 100% 비즈니스 로직), 더 깔끔한 게임 레이아웃을 생성했습니다. 주요 단점은 약 13%의 속도 저하와 증가된 VRAM 사용입니다. 저자는 포크 저장소와 상세 결과가 포함된 구글 드라이브 링크를 제공합니다.
출처: Habr — хаб ИИ —
원문
