Rússia patenteia IA que lê textos como um humano
A equipe de pesquisa da Universidade Innopolis recebeu três patentes para sistemas de IA que preveem movimentos oculares durante a leitura em 13 idiomas, avaliam esses modelos e aceleram o treinamento de modelos de linguagem. A tecnologia integra dados de olhar com aprendizado por reforço a partir de feedback humano, melhorando eficiência e precisão.
Os pesquisadores obtiveram patentes para um sistema que prevê o olhar humano durante a leitura. Ele prevê como uma pessoa lerá texto em inglês, coreano, alemão e outras dez línguas, com base em uma única arquitetura de rede neural que combina um modelo multilíngue e um transformador treinado em gravações de movimentos oculares de falantes nativos. O sistema gera sequências sintéticas de fixação do olhar e as avalia por probabilidade de pular palavras, número de fixações durante a primeira leitura e outros critérios. Ilya Pershin, chefe do Laboratório de IA em Medicina da Innopolis University, explicou que dados sintéticos são frequentemente a única solução quando gravações reais de rastreamento ocular são escassas, tornando o treinamento mais barato e permitindo tarefas antes impossíveis. Em um estudo, essa abordagem melhorou a precisão da previsão do olhar em imagens de raios-X em 20–30%. A segunda patente cobre um protocolo unificado para avaliar a geração de movimentos oculares durante a leitura, comparando trajetórias do olhar por características espaciais e temporais e analisando características nos níveis de texto inteiro, palavra e frase. A terceira patente descreve um método para treinar modelos de linguagem com trajetórias sintéticas do olhar, integrando dados de atenção visual ao aprendizado por reforço com feedback humano. Ivan Stebakov, especialista do laboratório, disse que um modelo de recompensa é treinado em preferências humanas reais para avaliar automaticamente as respostas de um modelo de linguagem grande, acelerando o treinamento em 1,5–2 vezes, reduzindo custos computacionais, alcançando 93% de precisão na reprodução de padrões de atenção humana e funcionando até para línguas com poucos recursos.
Fonte: Hightech.fm —
original
