документация: около 120 страниц регламентов, включая коды ответов эквайринга, правила повторов, маршрутизацию платежей, лимиты и исключения. Он составил 30 вопросов трёх типов: фактологические, синтетические (требующие синтеза из разных разделов) и форматные (следование шаблону внутреннего отчёта об инциденте). Для промптинга он поместил весь регламент в контекст (128 тысяч токенов) и получил в целом 20 правильных ответов, но столкнулся с проблемой 'потерянного в середине' и высокой задержкой. Для RAG он использовал разбиение на чанки (500 токенов с перекрытием), эмбеддинги BAAI/bge-m3 и векторную базу данных Qdrant, извлекая топ-5 чанков. RAG достиг 9/10 по фактологическим вопросам и предоставлял ссылки на источники, но не справился с синтетическими вопросами и не смог выучить внутреннюю терминологию. Для QLoRA он сгенерировал около 800 пар вопрос-ответ с помощью более сильной модели, вручную их вычистил и обучил LoRA-адаптер примерно за 40 минут. Тонко настроенная модель отлично справилась с форматными вопросами (10/10) и улучшила результаты на синтетических вопросах (8/10), но не справилась с обновлёнными фактами, отвечая старыми лимитами из датасета. Автор заключает, что эти подходы не конкуренты, а слои: начните с промптинга, затем добавьте RAG для фактической точности и ссылок на источники, и используйте тонкую настройку, когда нужно, чтобы модель переняла определённый стиль или терминологию. В исследовании также упоминается, что Unsloth Studio и H2O LLM Studio предлагают тонкую настройку с графическим интерфейсом, а исследование LoRA Land от Predibase показало, что тонко настроенные модели могут превзойти GPT-4 в узких задачах.