извлечение информации из документов смешанного формата. Для классификации заболеваний используется Retrieval Augmented Generation (RAG): сначала Amazon Textract извлекает текст, затем данные разбиваются на клинически осмысленные сегменты, векторизуются с помощью Amazon Titan Text Embeddings V2 и сохраняются в Amazon DynamoDB. После предварительной фильтрации по типу документа, давности и контексту пациента выполняется k-NN поиск, затем Amazon Nova 2 Lite отсеивает очевидные несоответствия, и на финальном этапе Amazon Nova Pro производит мультимодальное распознавание по сырым байтам PDF, возвращая окончательную классификацию с привязкой к конкретной странице. Для обработки PDF-документов Guardoc Health использует Amazon Nova Pro, который показал улучшенную интерпретацию макетов, состояние флажков и рукописные аннотации. Распознавание рукописного текста критически важно для полей врачебных заверений и разделов симптомов, сообщаемых пациентами. Для извлечения данных о лекарствах применяется гибридный пайплайн: Amazon Textract выполняет OCR для чистых таблиц, а Amazon Nova Pro обрабатывает сложные случаи, такие как рукописные дополнения и нестандартные форматы. Это сократило ошибки документации на 46%, уменьшило количество штрафов при аудите на 70% и обеспечило годовой возврат инвестиций более $400 000 на одно учреждение.