Rekursive llama.cpp-Engine auf RTX 3050: Qwen 32B- und 7B-Coder-Tests — 3-fache Qualitätssteigerung und Speicherapps
Mistral
Dies ist der zweite Teil eines Artikels über einen Fork von llama.cpp, der einen rekursiven Verarbeitungsmodus hinzufügt. Der Autor testete Qwen 32B und Qwen 2.5 Coder 7B auf einer RTX 3050 6 GB und verglich die Standard-Engine (D=0) mit dem verbesserten Fork (D=12). Die rekursive Engine verbesserte die Codequalität erheblich (bis zu 3,1-fach korrekte Korrekturen), kostete jedoch etwa 11-13% Generierungsgeschwindigkeit und erhöhte den VRAM-Verbrauch.
Der Autor des Artikels testet weiterhin einen Fork von llama.cpp, der einen rekursiven Modus (Bezeichnung D=12) implementiert, gegen die Standard-Engine (D=0). Die Tests wurden auf einer RTX 3050 6 GB Grafikkarte durchgeführt, wobei alle Modelle in Q4-Quantisierung vorlagen. Für das große Qwen 32B-A3B-Modell lieferten beide Engines bei einfachen Benchmark-Aufgaben identische Ergebnisse, aber die rekursive Version war etwas langsamer. Im schwierigen Segment korrigierte die rekursive Engine fast 3,1-mal mehr Fehler bei der Code-Review-Aufgabe, obwohl sie 17% mehr Zeit benötigte. Der Autor stellt fest, dass die rekursive Engine das Problem der 'faulen Codegenerierung' löst, indem sie vollständige monolithische Skripte anstelle von fragmentierten Schnipseln erzeugt. Für Qwen 2.5 Coder 7B Instruct schnitt die rekursive Version bei der Code-Review besser ab (fand einen weiteren Fehler), erfüllte in der Fullstack-Entwicklung die Anforderungen vollständig, während die Standardversion dies nicht tat, und im 2D-Spieltest war es ein Unentschieden, wobei die rekursive Engine nicht existierende Tags vermied und die grundlegende Spiellogik implementierte. Für Mistral 7B Instruct v0.2 verbesserte die rekursive Engine die Sicherheit erheblich (98% geschützt), verbesserte die Fullstack-Plattform dramatisch (2,2-fache Verbesserung, 100% Geschäftslogik) und erzeugte ein saubereres Spiellayout. Der Hauptnachteil ist eine Geschwindigkeitsreduktion von etwa 13% und ein erhöhter VRAM-Verbrauch. Der Autor verlinkt das Fork-Repository und Google Drive mit detaillierten Ergebnissen.
Quelle: Habr — хаб ИИ —
Original
