обеспечивает прозрачности для аудита того, почему модель выбрала конкретный фрагмент. Вместо этого предлагается использовать файл-индекс (идея llms.txt), который служит оглавлением: модель сначала читает индекс, затем подындекс, и только потом обращается к конкретному разделу документа. Автор создал инструмент DocShelf — MCP-сервер, который преобразует PDF в Markdown, очищает его, разбивает на разделы, создаёт index.md и subindex.md, хранит всё в Git и подключается к модели. Конвейер выглядит следующим образом: PDF в Markdown, затем разбиение на разделы, затем построение индекса, затем сохранение в Git, затем через MCP-сервер к LLM. Модель потребляет лишь малую часть всего архива: в примере с полкой на 85 МБ было использовано около 16,5 КБ контекста. В статье также выделены типичные ловушки: проблемы с парсингом PDF, искажение кириллицы, плохая структура Markdown, и приведена таблица устранения неполадок. Доступны два конвертера: pymupdf4llm (быстрый, не требует GPU) и marker-pdf (для сложных случаев, но тяжёлый). DocShelf поддерживает Git как хранилище, версионирование и ревью, и может работать в закрытых сетях. Автор заключает, что этот подход является жизнеспособной альтернативой классическому RAG в сценариях, где требуется аудит и корпус документов локален.