Понимание и реализация Qwen3 с нуля
Alibaba/Qwen
DeepSeek
Moonshot AI
Anthropic
Себастьян Рашка подробно разбирает архитектуру Qwen3 — одной из самых популярных открытых LLM. Статья содержит практический код на PyTorch, объясняет ключевые компоненты модели и причины её популярности, включая лицензию Apache 2.0, высокую производительность и разнообразие размеров.
Себастьян Рашка, автор книги «Машинное обучение на Python», выпустил статью, в которой на практике разбирает архитектуру Qwen3 — одной из самых популярных открытых языковых моделей 2025 года. Он отмечает, что Qwen3 привлекает разработчиков благодаря лицензии Apache 2.0 без дополнительных ограничений, отличной производительности (версия 235B-Instruct занимает 8-е место в рейтинге LMArena, уступая только значительно более крупным DeepSeek 3.1 и Kimi K2) и широкому выбору размеров — от 0,6B-параметрических плотных моделей до 480B-параметрических Mixture-of-Experts. 5 сентября 2025 года компания Qwen выпустила закрытую версию «max» с 1 триллионом параметров, которая превзошла Kimi K2, DeepSeek 3.1 и Claude Opus 4 по всем основным бенчмаркам. В статье автор приводит код на чистом PyTorch, шаг за шагом реализующий ключевые компоненты архитектуры Qwen3, чтобы читатели могли понять их работу изнутри и адаптировать для собственных проектов.
- Сокращения
- LLM = Large Language Model — большая языковая модель
Источник: Sebastian Raschka —
оригинал
