Uni-Bond:一个两周暑期学校项目如何演变为ICML 2026 workshop论文
Uni-Bond是一种分子键图预测模型,在精确匹配错误率上比之前的SOTA(YuelBond)提升了约20倍。该模型最初在AIRI的一次暑期学校项目中开发,随后经过完善,被ICML 2026的图基础模型workshop接收。模型使用冻结的Uni-Mol编码器,并在成对原子表示上添加了一个轻量级MLP头。
该项目始于2025年托木斯克国立大学举办的AIRI暑期学校。团队(斯捷潘·帕夫连科、帕维尔·马斯洛夫、伊万·布罗夫)最初旨在利用带强化学习微调的大型语言模型从三维原子坐标生成SMILES字符串,但三天后转向了键图预测。使用预训练几何编码器Uni-Mol(约4700万参数)和一个轻量级MLP头(约7.4万可训练参数),他们在GEOM基准测试(脚手架分割)上实现了宏F1分数0.9997和精确匹配率99.53%,而YuelBond的F1分数为0.975,精确匹配率为83.2%——错误率降低了约20倍。该模型还避免了诸如YuelBond在二聚体中出现的假键。并行路线使用LoRA微调的Galactica-1.3B(约13亿参数)结合坐标分词(如BindGPT)直接生成SMILES,在分布内数据上实现了超过99.7%的有效性,但针对域外肽的精确匹配率接近零。该工作被2026年在首尔举行的国际机器学习大会(ICML)的图基础模型研讨会接收。
来源: Habr — хаб ИИ —
原文
