Uni-Bond: Hoe een tweeweeks zomerschoolproject uitgroeide tot een ICML 2026 Workshop Paper
Uni-Bond is een moleculair bindingsgraafvoorspellingsmodel dat de vorige state-of-the-art (YuelBond) met ongeveer 20 keer verslaat in exacte matchfoutpercentage. Ontwikkeld tijdens een zomerschoolproject bij AIRI, werd het later verfijnd en geaccepteerd op de Graph Foundation Models-workshop op ICML 2026. Het model gebruikt een bevroren Uni-Mol-encoder met een lichtgewicht MLP-hoofd op paarsgewijze atomaire representaties.
Het project startte tijdens de AIRI-zomerschool aan de Tomsk State University in 2025. Het team (Stepan Pavlenko, Pavel Maslov, Ivan Burov) had oorspronkelijk als doel om SMILES-strings uit 3D-atoomcoördinaten te genereren met behulp van Large Language Models (LLM's) en reinforcement learning finetuning, maar schakelde na drie dagen over op het voorspellen van bindingsoverzichten. Met behulp van een voorgetrainde geometrische encoder Uni-Mol (~47 miljoen parameters) en een lichtgewicht MLP-kop (~74.000 trainbare parameters) behaalden ze een macro F1-score van 0,9997 en een exacte match van 99,53% op de GEOM-benchmark (scaffold split), vergeleken met YuelBond's F1-score van 0,975 en exacte match van 83,2% — een reductie van de foutmarge met een factor ~20. Het model voorkomt ook valse bindingen in dimeren, in tegenstelling tot YuelBond. Een parallelle track gebruikte LoRA-finetuned Galactica-1.3B met coördinatentokenisatie (zoals BindGPT) voor directe SMILES-generatie, wat leidde tot >99,7% validiteit op in-distribution data, maar bijna nul exacte match op out-of-domain peptiden. Het werk werd geaccepteerd voor de Graph Foundation Models workshop op ICML 2026 in Seoul.
Bron: Habr — хаб ИИ —
origineel
