Исследования RSS

Как переводить смешанный русский-казахский и не сойти с ума

Исследователи из MWS AI и университетов предложили метод генерации синтетического датасета для машинного перевода смешанного русско-казахского текста (код-свитчинг). Их модель, обученная на синтетике, обошла коммерческие системы по ручной оценке, хотя уступала им по автоматическим метрикам.

Habr — хаб ML24.07 · 10:01

Как построить сквозной пайплайн OCR с Baidu Unlimited-OCR для изображений высокого разрешения и многополосных PDF

В руководстве показан полный рабочий процесс для запуска модели Unlimited-OCR от Baidu на одностраничных изображениях и многополосных PDF. Настроена среда GPU, загружена 3B-параметрическая модель, протестированы режимы Gundam и Base, а также реализована обработка многостраничных PDF с помощью infer_multi().

BaiduBaidu
MarkTechPost24.07 · 09:02
Свежие новости