Uni-Bond: Dự án trường hè hai tuần phát triển thành bài báo hội thảo ICML 2026
Uni-Bond là mô hình dự đoán đồ thị liên kết phân tử, vượt trội hơn so với mô hình SOTA trước đó (YuelBond) khoảng 20 lần về tỷ lệ lỗi khớp chính xác. Được phát triển trong một dự án trường hè tại AIRI, sau đó được tinh chỉnh và chấp nhận tại hội thảo Graph Foundation Models tại ICML 2026. Mô hình sử dụng bộ mã hóa Uni-Mol đông lạnh kết hợp với đầu MLP nhẹ trên các biểu diễn nguyên tử theo cặp.
Dự án bắt đầu từ trường hè AIRI tại Đại học Tomsk State vào năm 2025. Nhóm nghiên cứu (Stepan Pavlenko, Pavel Maslov, Ivan Burov) ban đầu nhằm mục tiêu tạo chuỗi SMILES từ tọa độ nguyên tử 3D bằng cách sử dụng mô hình ngôn ngữ lớn (LLM) với tinh chỉnh học tăng cường (RL finetuning), nhưng đã chuyển hướng sang dự đoán đồ thị liên kết sau ba ngày. Sử dụng bộ mã hóa hình học được huấn luyện trước Uni-Mol (khoảng 47 triệu tham số) và một đầu MLP nhẹ (khoảng 74 nghìn tham số huấn luyện), họ đạt được F1 macro là 0,9997 và khớp chính xác (exact match) 99,53% trên chuẩn GEOM (phân tách scaffold), so với F1 0,975 và khớp chính xác 83,2% của YuelBond — giảm tỷ lệ lỗi khoảng 20 lần. Mô hình cũng tránh được các liên kết giả trong dimer, không giống như YuelBond. Một hướng song song sử dụng Galactica-1.3B được tinh chỉnh LoRA với tokenization tọa độ (giống BindGPT) để tạo trực tiếp SMILES, đạt độ hợp lệ >99,7% trên dữ liệu trong phân phối (in-distribution) nhưng khớp chính xác gần như bằng 0 trên các peptide ngoài phân phối (out-of-domain). Công trình đã được chấp nhận tại hội thảo Graph Foundation Models thuộc ICML 2026 ở Seoul.
Nguồn: Habr — хаб ИИ —
bản gốc
