ХарнесыОткрытый код 🇺🇸 22.07.2026 13:02

Unsloth vs Axolotl vs TRL vs LLaMA-Factory: сравнение фреймворков для тонкой настройки ИИ по скорости, видеопамяти и многопроцессорной работе

UnslothUnsloth Hugging Face (TRL)Hugging Face (TRL) LLaMA-Factory (hiyouga)LLaMA-Factory (hiyouga)
Четыре open-source фреймворка для дообучения больших языковых моделей — Unsloth, Axolotl, TRL и LLaMA-Factory — сравниваются по трём ключевым параметрам: пропускная способность, пиковое потребление видеопамяти и масштабирование на несколько GPU. Unsloth лидирует в скорости на одном GPU и контекстной длине, Axolotl предлагает наиболее гибкие стратегии параллелизма, TRL является базовым слоем, а LLaMA-Factory — рекордсмен по охвату моделей и удобству для начинающих.
Четыре open-source проекта доминируют сегодня в дообучении больших языковых моделей: Unsloth, Axolotl, TRL и LLaMA-Factory. Все они основаны на едином стеке PyTorch и Hugging Face, но различаются в инженерных подходах. Unsloth переписывает вычислительные ядра (kernels), Axolotl компонует стратегии параллелизма, TRL определяет API тренеров, а LLaMA-Factory оптимизируется под широкий охват моделей и работу без кода. Сравнение проведено по трём метрикам: скорость обучения, пиковое потребление видеопамяти (VRAM) и масштабирование на несколько GPU. Unsloth показал до 2-кратного ускорения на Llama 3.1 8B и 3.3 70B и 7.3-кратного на MoE-модели gpt-oss-20b при контексте 8K, но его преимущество снижается с уменьшением длины последовательности. Axolotl, заимствовав ядра Unsloth, даёт до 1.45x ускорения и 30% экономии памяти на Qwen3.5-35B-A3B при LoRA. TRL остаётся эталоном для сравнения и поддерживает техники FlashAttention, Liger Kernel и интеграцию с Unsloth. LLaMA-Factory использует чужие ядра через конфигурационные флаги (use_unsloth: true, enable_liger_kernel: true). По потреблению VRAM Unsloth позволяет обучать 8B-модель всего на 6 ГБ в 4-bit QLoRA и 70B — на 41 ГБ, а также достигать контекста 342 тыс. токенов на GPU с 80 ГБ. LLaMA-Factory для 4-bit QLoRA требует 6 ГБ для 7B, 24 ГБ для 30B и 48 ГБ для 70B. В части многопроцессорной работы лидирует Axolotl с поддержкой DeepSpeed ZeRO, FSDP, TP, CP и EP, и поддержкой связи через torchrun и Ray. TRL предлагает два бэкенда для разделения последовательности: Ring Attention (для последовательностей >1M токенов) и ALST/Ulysses (для NVLink/InfiniBand). LLaMA-Factory поддерживает DDP, DeepSpeed, FSDP и Megatron-core, но конфигурация распределённой работы происходит в YAML и CLI, а не в веб-интерфейсе. Unsloth официально поддерживает multi-GPU через Accelerate/DeepSpeed, но настройка сложна, и полноценной документации по параллелизму пока нет.
Сокращения
GPU = Graphics Processing Unit — графический процессор
VRAM = Video Random Access Memory — видеопамять
QLoRA = Quantized Low-Rank Adaptation — квантованная низкоранговая адаптация
LoRA = Low-Rank Adaptation — низкоранговая адаптация
MoE = Mixture of Experts — смесь экспертов
FSDP = Fully Sharded Data Parallelism — полноценный шардированный параллелизм данных
DDP = Distributed Data Parallelism — распределенный параллелизм данных
TP = Tensor Parallelism — тензорный параллелизм
CP = Context Parallelism — контекстный параллелизм
EP = Expert Parallelism — параллелизм экспертов
SP = Sequence Parallelism — параллелизм последовательностей
CLI = Command Line Interface — интерфейс командной строки
YAML = YAML Ain't Markup Language — YAML (формат данных)
Источник: MarkTechPost — оригинал

Наши прошлые публикации по теме

Есть свежие новости