ИсследованияМодели 🇷🇺 20.07.2026 13:04

Топ вопросов с NLP собеседований: обучение LLM, prompt-engineering и alignment

OpenAIOpenAI DeepSeekDeepSeek
Статья представляет собой чеклист по GPT-подобным моделям, промпт-инженирингу, этапам обучения LLM и alignment. Рассматриваются ключевые понятия от истории развития до современных практик, включая SFT и RLHF.
Статья охватывает полный жизненный цикл современной LLM: от предобучения (pretraining) на задачу next token prediction до alignment через RLHF. Описана эволюция от ванильной GPT до ChatGPT и современных моделей с reasoning-токенами (например, DeepSeek-R1). Подробно разобраны техники промпт-инжениринга: zero-shot, few-shot, Chain-of-Thought, role prompting, structured output prompting, decomposition, self-check и tool-use prompting. Также объяснены три этапа обучения LLM: pretraining, Supervised Fine-Tuning (SFT) и alignment (preference tuning). Рассмотрены проблемы подготовки данных для претрена: дубликаты, низкое качество, токсичный контент, а также методы дедупликации (exact, near, semantic).
Сокращения
LLM = Large Language Model — большая языковая модель
RLHF = Reinforcement Learning from Human Feedback — обучение с подкреплением на основе обратной связи от человека
RAG = Retrieval-Augmented Generation — генерация с дополнением извлечением
SFT = Supervised Fine-Tuning — контролируемая донастройка
GPU = Graphics Processing Unit — графический процессор
JSON = JavaScript Object Notation — формат обмена данными на основе JavaScript
ISO = International Organization for Standardization — Международная организация по стандартизации
CoT = Chain of Thought — цепочка рассуждений
Источник: Habr — хаб NLP — оригинал

Наши прошлые публикации по теме

Есть свежие новости