Uni-Bond : comment un projet d'école d'été de deux semaines est devenu un article de workshop à l'ICML 2026
Uni-Bond est un modèle de prédiction de graphes de liaisons moléculaires qui surpasse l'état de l'art précédent (YuelBond) d'environ 20 fois en taux d'erreur de correspondance exacte. Développé lors d'un projet d'école d'été à l'AIRI, il a ensuite été affiné et accepté au workshop Graph Foundation Models à l'ICML 2026. Le modèle utilise un encodeur Uni-Mol gelé avec une tête MLP légère sur des représentations atomiques par paires.
Le projet a débuté lors de l'école d'été AIRI à l'Université d'État de Tomsk en 2025. L'équipe (Stepan Pavlenko, Pavel Maslov, Ivan Burov) visait initialement à générer des chaînes SMILES à partir de coordonnées atomiques 3D à l'aide de LLMs avec un réglage fin par apprentissage par renforcement, mais s'est réorientée vers la prédiction de graphes de liaisons après trois jours. En utilisant un encodeur géométrique pré-entraîné Uni-Mol (~47 millions de paramètres) et une tête MLP légère (~74 000 paramètres entraînables), ils ont obtenu un macro F1 de 0,9997 et une correspondance exacte de 99,53 % sur le benchmark GEOM (partition par échafaudage moléculaire), contre un F1 de 0,975 et une correspondance exacte de 83,2 % pour YuelBond — soit une réduction du taux d'erreur d'environ 20 fois. Le modèle évite également les fausses liaisons dans les dimères, contrairement à YuelBond. Une piste parallèle a utilisé Galactica-1,3B avec réglage fin LoRA et tokenisation des coordonnées (comme BindGPT) pour la génération directe de SMILES, atteignant une validité supérieure à 99,7 % sur des données intra-distribution, mais une correspondance exacte quasi nulle sur des peptides hors domaine. Le travail a été accepté à l'atelier Graph Foundation Models lors de la conférence ICML 2026 à Séoul.
Source: Habr — хаб ИИ —
original
