1 700 лигандов. Точность, сопоставимая с расчётами свободной энергии free energy perturbation (FEP, возмущение свободной энергии) — «золотым стандартом» расчёта сродства, который считает одну молекулу сутки. Без симуляций. Без дорогой физики. Дообучение открытой модели на своих данных.
Boltz-2 — открытая foundation-модель (базовая модель, обучаемая на огромных данных) от MIT и Recursion, предсказывающая структуру и сродство связывания белок-лиганд в 1 000 раз быстрее FEP. Но у неё был один дефект: публичного «рецепта» дообучения не существовало. Свои измерения в модель не встроишь.
В конце мая команда под руководством Самaда Амини опубликовала препринт, который закрывает этот пробел — Affinity Fine-Tuning of Boltz-2.
Что именно открыли
Фреймворк не трогает всю сеть. Он адаптирует только affinity-компоненты (блок оценки сродства) — блок, который выдаёт число сродства. Общая структурная интуиция модели остаётся нетронутой, а узкие физико-химические нюансы конкретной цели и серии лигандов модель учит заново.
Это тот же паттерн, что в дообучении LLM: базовое понимание уже есть, нужна специализация. В lead optimization (оптимизации лидов-кандидатов) данные прибывают постоянно — новые измерения, новые конгенерические серии. Закрытый рецепт превращал Boltz-2 в модель, которую нельзя развивать под свой проект.
Масштаб однотаргетного исследования
Дообученный Boltz-2 улучшил корреляцию с экспериментом относительно версии «из коробки»; в ряде случаев — на уровне FEP.
Два исследования
Авторы проверили фреймворк дважды. Сначала ретроспективный мультитаргетный бенчмарк: 172 соединения, четыре цели, сравнение с физическими и ML-базлайнами. Затем глубокая проверка на одном таргете с выборкой до 1 700 лигандов.
В обоих случаях дообученная модель превзошла исходную по корреляции с экспериментальными данными. А в отдельных задачах — догнала FEP, который считают эталоном точности.
Почему это важно?
Раньше точную оценку сродства получали двумя путями: медленным и дорогим (FEP) либо быстрым, но грубым (докинг). Boltz-2 дал третий путь — быстрый и точный. Теперь этот путь можно адаптировать под конкретную программу.
Команда lead optimization получает открытый пайплайн: свои данные → дообучение affinity-головы → предсказания уровня FEP за минуты, а не дни. Код на GitHub под MIT-лицензией — академическое и коммерческое использование свободное.
Ограничение честно признаётся в самом препринте: это не «лекарства за неделю». Это открытая инструкция, как сделать общий инструмент специфичным для своей задачи. Кто-то уже делает похожее — как мы писали в июле про perceptic-ai-drug-discovery, рынок ИИ-платформ для создания лекарств плотнеет.
Вопрос, который остаётся за кадром: воспроизведут ли внешние команды те же цифры, что и внутренние исследования авторов? Дообучение на своих данных — самый быстрый способ проверить это.