1 700 лигандов. Точность, сопоставимая с расчётами свободной энергии free energy perturbation (FEP, возмущение свободной энергии) — «золотым стандартом» расчёта сродства, который считает одну молекулу сутки. Без симуляций. Без дорогой физики. Дообучение открытой модели на своих данных.

Boltz-2 — открытая foundation-модель (базовая модель, обучаемая на огромных данных) от MIT и Recursion, предсказывающая структуру и сродство связывания белок-лиганд в 1 000 раз быстрее FEP. Но у неё был один дефект: публичного «рецепта» дообучения не существовало. Свои измерения в модель не встроишь.

В конце мая команда под руководством Самaда Амини опубликовала препринт, который закрывает этот пробел — Affinity Fine-Tuning of Boltz-2.

Что именно открыли

Фреймворк не трогает всю сеть. Он адаптирует только affinity-компоненты (блок оценки сродства) — блок, который выдаёт число сродства. Общая структурная интуиция модели остаётся нетронутой, а узкие физико-химические нюансы конкретной цели и серии лигандов модель учит заново.

Это тот же паттерн, что в дообучении LLM: базовое понимание уже есть, нужна специализация. В lead optimization (оптимизации лидов-кандидатов) данные прибывают постоянно — новые измерения, новые конгенерические серии. Закрытый рецепт превращал Boltz-2 в модель, которую нельзя развивать под свой проект.

1 700 лигандов, один таргет

Масштаб однотаргетного исследования

Дообученный Boltz-2 улучшил корреляцию с экспериментом относительно версии «из коробки»; в ряде случаев — на уровне FEP.

Два исследования

Авторы проверили фреймворк дважды. Сначала ретроспективный мультитаргетный бенчмарк: 172 соединения, четыре цели, сравнение с физическими и ML-базлайнами. Затем глубокая проверка на одном таргете с выборкой до 1 700 лигандов.

В обоих случаях дообученная модель превзошла исходную по корреляции с экспериментальными данными. А в отдельных задачах — догнала FEP, который считают эталоном точности.

Почему это важно?

Раньше точную оценку сродства получали двумя путями: медленным и дорогим (FEP) либо быстрым, но грубым (докинг). Boltz-2 дал третий путь — быстрый и точный. Теперь этот путь можно адаптировать под конкретную программу.

Что это значит на практике

Команда lead optimization получает открытый пайплайн: свои данные → дообучение affinity-головы → предсказания уровня FEP за минуты, а не дни. Код на GitHub под MIT-лицензией — академическое и коммерческое использование свободное.

Ограничение честно признаётся в самом препринте: это не «лекарства за неделю». Это открытая инструкция, как сделать общий инструмент специфичным для своей задачи. Кто-то уже делает похожее — как мы писали в июле про perceptic-ai-drug-discovery, рынок ИИ-платформ для создания лекарств плотнеет.

Вопрос, который остаётся за кадром: воспроизведут ли внешние команды те же цифры, что и внутренние исследования авторов? Дообучение на своих данных — самый быстрый способ проверить это.

Affinity Fine-Tuning of Boltz-2: открытый фреймворк для предсказания активности
Препринт Амини, Шиаболы и Вана: как адаптировать affinity-компоненты Boltz-2 под данные конкретного проекта lead optimization.
Первоисточник исследования — препринт, ещё не прошедший рецензирование.
Boltz-2: предсказание сродства с точностью FEP в 1000 раз быстрее
Официальное описание модели от MIT Jameel Clinic: первый ИИ, приблизившийся к точности FEP в оценке сродства белок-лиганд.
Контекст: что такое Boltz-2 и почему его открыли как foundation-модель.
Репозиторий Boltz на GitHub
Код, веса и данные моделей Boltz-1/Boltz-2 под MIT-лицензией — включая фреймворк дообучения, описанный в препринте.
Инструмент, к которому фреймворк из препринта добавляет открытый «рецепт обучения».