предпочтений пользователя разработчики теперь создают алгоритмы, прогнозирующие такие действия, как открытие, просмотр или покупка. Однако проблема «холодного старта» до сих пор не решена: у новых пользователей и товаров нет истории взаимодействий. Помогают рекомендации в реальном времени (real-time), которые анализируют даже первые клики и используют агрегированные данные о поведении аудитории. Сергей Кузнецов, руководитель разработки платформы рекомендаций MWS, рассказал о сложностях применения больших языковых моделей (LLM, Large Language Model): задержка (latency) — желательны 200-300 миллисекунд, но LLM требуют секунд; стоимость из-за дорогих графических процессоров (GPU, Graphics Processing Unit); а также проблемы с надёжностью. Были представлены три жизнеспособных сценария применения LLM: офлайн-обогащение признаков с помощью эмбеддингов, офлайн-генерация кандидатов для решения проблемы холодного старта и онлайн-диалоговые сценарии, где LLM выступает в роли агента. Для диалоговых сценариев в MWS выбрали модель Gemma, пожертвовав частью качества в пользу скорости и стоимости, чтобы обрабатывать больше запросов в секунду (RPS, Requests Per Second). Ключевые метрики успеха включают удержание пользователей (retention), коэффициент «прилипчивости» (stickiness factor) и снижение числа обращений в поддержку, но в конечном счёте всё сводится к деньгам. Внедрение LLM часто требует своего рода прыжка веры, поскольку экономика может не сработать сразу, однако ожидается, что затраты будут снижаться. Индустрия движется в сторону систем, которые ведут диалог с пользователем и понимают его непосредственные намерения, оценивая успех по тому, насколько хорошо они экономят время пользователя.