Лучшие вопросы для собеседования по NLP: архитектуры LLM, инференс и оптимизация
Эта статья представляет чек-лист ключевых тем и вопросов для технических собеседований по современным архитектурам LLM и оптимизации инференса. Она охватывает архитектурные отличия от ванильного Transformer (Pre-Norm, RMSNorm, SwiGLU, RoPE, GQA/MQA, MoE), объясняет, почему инференс LLM дорог, и описывает батчинг, KV-кэш, квантизацию и другие методы ускорения.
Современные генеративные LLM (large language model, большие языковые модели) в основном представляют собой трансформеры только с декодером (decoder-only), при этом такие семейства, как GPT, LLaMA, Mistral, Qwen и Gemma, различаются по степени открытости, количеству параметров (от сотен миллионов до сотен миллиардов), деталям архитектуры (Dense против MoE, mixture of experts — смесь экспертов),
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
