L'Université Innopolis obtient trois brevets pour des solutions d'IA pour l'attention textuelle et visuelle
L'Université Innopolis a obtenu trois brevets pour des développements en IA dans le traitement de texte et le suivi du regard. Les inventions permettent de prédire les mouvements oculaires lors de la lecture de textes en 13 langues, d'évaluer des modèles de génération de trajectoires de regard de médecins, et d'accélérer l'apprentissage des modèles de langage.
Les chercheurs du Centre de recherche en IA de l'Université d'Innopolis ont obtenu trois brevets pour des solutions d'IA liées à l'attention textuelle et visuelle. Le premier brevet couvre un système de prédiction du regard humain pendant la lecture, capable de prévoir les mouvements oculaires pour des textes en anglais, coréen, allemand et dix autres langues grâce à une architecture de réseau neuronal unifiée. Il combine un modèle de langue multilingue et un modèle transformer pour prédire les fixations du regard, entraîné sur des enregistrements d'eye-tracking de locuteurs natifs de différentes langues. Le système génère des séquences de fixations synthétiques et les évalue selon la probabilité de saut de mots et le nombre de fixations lors de la première lecture. Le deuxième brevet concerne l'évaluation de la génération du regard pendant la lecture, répondant au manque de protocoles unifiés pour comparer les fixations séquentielles sur du texte produites par des modèles génératifs. L'approche proposée compare les trajectoires du regard selon des caractéristiques spatiales et temporelles et évalue différentes caractéristiques de mouvements oculaires au niveau du texte entier, des mots individuels et des phrases. Le troisième brevet porte sur une méthode d'entraînement de modèles de langue avec des trajectoires de regard synthétiques, intégrant des données d'attention visuelle dans l'apprentissage par renforcement à partir de retours humains. L'invention comprend la génération de séquences de fixations synthétiques et de caractéristiques d'attention visuelle, ainsi que la mise en œuvre d'un algorithme d'apprentissage par renforcement basé sur les retours humains qui tient compte des schémas d'attention humains. Selon l'université, cette technologie accélère l'entraînement de l'IA de 1,5 à 2 fois, réduit les coûts de calcul, reproduit les schémas d'attention humains avec une précision allant jusqu'à 93 %, et fonctionne même pour les langues avec de faibles volumes de données.
Source: CNews —
original
