Investigación 🇷🇺 14.08.2026 14:02

Rusia patenta IA que lee textos como un humano

Un equipo de investigación de la Universidad de Innopolis ha recibido tres patentes para sistemas de IA que predicen movimientos oculares durante la lectura en 13 idiomas, evalúan dichos modelos y aceleran el entrenamiento de modelos de lenguaje. La tecnología integra datos de mirada con aprendizaje por refuerzo con retroalimentación humana, mejorando la eficiencia y precisión.
A los investigadores se les han concedido patentes para un sistema que predice la mirada humana durante la lectura. Pronostica cómo leerá una persona un texto en inglés, coreano, alemán y otros diez idiomas, basándose en una única arquitectura de red neuronal que combina un modelo multilingüe y un transformador entrenado con registros de movimientos oculares de hablantes nativos. El sistema genera secuencias sintéticas de fijación de la mirada y las evalúa según la probabilidad de omitir palabras, el número de fijaciones durante la primera lectura y otros criterios. Ilya Pershin, jefe del Laboratorio de IA en Medicina de la Universidad de Innopolis, explicó que los datos sintéticos suelen ser la única solución cuando las grabaciones reales de seguimiento ocular son escasas, lo que abarata el entrenamiento y permite tareas antes imposibles. En un estudio, este enfoque mejoró la precisión de la predicción de la mirada en imágenes de rayos X en un 20-30%. La segunda patente cubre un protocolo unificado para evaluar la generación de movimientos oculares durante la lectura, comparando trayectorias de mirada por características espaciales y temporales, y analizando rasgos a nivel de texto completo, palabra y oración. La tercera patente describe un método para entrenar modelos de lenguaje con trayectorias de mirada sintéticas, integrando datos de atención visual en el aprendizaje por refuerzo con retroalimentación humana. Ivan Stebakov, especialista del laboratorio, dijo que un modelo de recompensa se entrena con preferencias humanas reales para evaluar automáticamente las respuestas de un modelo de lenguaje grande, acelerando el entrenamiento entre 1,5 y 2 veces, reduciendo los costos computacionales, logrando una precisión del 93% en la reproducción de patrones de atención humana y funcionando incluso para idiomas con pocos recursos.
Fuente: Hightech.fm — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas