Способна ли машина предсказать, где произойдёт следующий научный прорыв — за годы до того, как мир заметит результат?
В 2025 году Google DeepMind представил AI co-scientist (ИИ-соисследователь) — мультиагентную систему на базе Gemini 2.0, которая за недели сгенерировала гипотезы, на годы опередившие экспериментальные исследования. В 2026 году группа из Женевского университета и CERN пошла дальше: они построили модель для предсказания структурных предшественников прорывов — новых связей между научными концепциями.
Замена философии: вместо «ИИ-учёного» — «ИИ-радар».
От библиометрии к динамике сетей
Идея предсказывать науку через её структуру не нова. Ещё в 2010 году работы Barabási и соавторов показали, что цитационные сети подчиняются степенным распределениям — одни работы собирают почти все ссылки, остальные остаются на периферии. К 2021 году Min с коллегами из Нанкинского университета научились предсказывать прорывы по вариациям структуры знаний — но точность оставалась низкой, а модели — чёрными ящиками.
Перелом наступил с появлением OpenAlex.
В 2022 году некоммерческая организация OurResearch запустила открытый каталог научных работ, который к 2026 году индексирует более 250 млн публикаций с семантической разметкой концептов. В отличие от Scopus или Web of Science, OpenAlex доступен без лицензии и предоставляет размеченный граф знаний — концепты как узлы, их совместная встречаемость в публикациях как рёбра.
Для прогнозирования это оказалось важнее, чем любой алгоритм.
59 признаков, две стадии, одна архитектура
Работа Maillart, Chataing и коллег из Университета Женевы, CERN и armasuisse, опубликованная на arXiv в июне 2026 года, объединяет две задачи, которые раньше решались раздельно: предсказание появления новой связи между концептами и предсказание её силы.
Модель использует 59 семантических и топологических признаков для каждого узла графа знаний — от меры Adamiс-Adar (вероятность связи через общих соседей) до центральности по посредничеству. Двухстадийный LightGBM сначала оценивает, появится ли связь вообще, а затем — насколько она усилится.
Результаты впечатляют: ROC-AUC от 0.954 до 0.967 на четырёх технологических и биомедицинских доменах без перенастройки под каждый. Для сравнения — предшествующие модели давали около 0.90. При этом все прогнозы объяснимы: каждое предсказание опирается на структурные, аудитируемые признаки, а не на непрозрачные эмбеддинги.
Главный вывод авторов: прорывы — это результат плотных, когезивных субсетей, сформированных кластеризацией и избирательным связыванием. Те же структурные паттерны доминируют на всех горизонтах — от года до пяти лет.
Проверка на квантовых материалах
Два кейса авторы разбирают особенно подробно: квантовый annealing (отжиг) и AI-архитектуры для квантовых вычислений. В обоих случаях модель выявила нарастающую близость между концептами Computer Architecture и Quantum Algorithms за 1–2 года до того, как это направление стало самостоятельным исследовательским фронтом.
Основа предсказания — паттерны утолщения связей, которые в OpenAlex видны как рост ко-оккурренсов (co-occurrence, совместная встречаемость) в публикациях.
Как мы писали в июле, алгоритмы уже автоматизируют стратегический форсайт. Модель Майара и Шатена идёт глубже: она вскрывает механизм — показывает, через какие структурные изменения в графе знаний прорыв становится возможным.
Трёхуровневая архитектура для политики
Авторы не ограничились моделью. Они предложили трёхуровневую архитектуру принятия решений: Detection (автоматическое сканирование патентов, публикаций и грантов), Translation (экспертная валидация), Integration (встраивание в циклы инвестиционного и научно-технического планирования).
Это прямое замыкание контура между data science (наукой о данных) и research policy (научно-технической политикой).
Для венчурных фондов и корпоративных R&D-отделов такой инструмент означает сдвиг от реактивного к предиктивному управлению портфелем. Вместо вопроса «какие стартапы уже в топе» — «какие направления станут горячими через 2–3 года и где формируются новые исследовательские кластеры, которые пока никто не отслеживает».
Но есть и риски.
Модель наследует смещения OpenAlex — особенно в областях с недавней публикационной активностью или в национальных научных системах, слабо представленных в англоязычных журналах. Китайская наука, например, генерирует больше патентов, чем статей в международных журналах — а модель обучается на публикациях. Российские исследовательские группы в материаловедении и ядерной физике публикуются в национальных журналах, которые OpenAlex индексирует с задержками.
Авторы честно фиксируют эти ограничения: порог концепт-скоров и 90-й перцентиль ко-оккурренсов — консервативные, но не нейтральные выборы.
Значение и горизонт
Работа Maillart et al. не первая попытка предсказать науку алгоритмически. Это первая модель, которая одновременно достигает высокой точности (AUC > 0.95) и полной объяснимости — на открытых данных, с воспроизводимым кодом, без привязки к проприетарным источникам.
Что это значит для рынка:
Конвергенция трёх трендов — открытых графов знаний (OpenAlex), объяснимого машинного обучения (LightGBM) и растущего институционального спроса на предиктивную аналитику — создаёт условия, в которых прогнозирование прорывов перестаёт быть академическим экспериментом и становится управленческим инструментом.
Во-первых, снижение информационной асимметрии в R&D. Корпорации и фонды, которые интегрируют такие модели в свои процессы, получают 2–5 лет форы перед конкурентами, всё ещё полагающимися на экспертные панели.
Во-вторых, сдвиг в самом определении «прорыва». Если прорыв предсказуем по структурным предшественникам, то меняется подход к финансированию науки: вместо «поддержим самых ярких» — «профинансируем связи, ведущие к новым комбинациям».
В-третьих, появление нового класса продуктов — prediction-as-a-service (прогнозирование как сервис) для научно-технической политики. Авторы уже выложили код на GitHub под открытой лицензией. Следующий шаг — коммерциализация через спин-аут или интеграцию в существующие платформы стратегического форсайта.
Регистрация спин-аута командой Maillart / Chataing — первый признак коммерциализации
Интеграция модели в OpenAlex API — сделает прогнозы доступными для тысяч университетов
Появление регуляторных стандартов для «алгоритмического форсайта» — особенно в ЕС и Великобритании
Конкурирующие подходы от крупных игроков: Elsevier (Scopus) и Digital Science (Dimensions) располагают сопоставимыми графами знаний
Что дальше
Главный вопрос — не технический. Возможность предсказывать прорывы уже доказана. Спрос смещается к распределению доступа: кто получит эти прогнозы, как быстро институты адаптируют архитектуру принятия решений под новый тип информации.
Технологии для предиктивной science policy уже существуют. Институциональные привычки — пока нет. Разрыв между возможностью алгоритмического форсайта и готовностью институтов встраивать его в циклы принятия решений — сейчас главное узкое место.
Следующие 12 месяцев покажут: работа женевской группы станет единичным академическим результатом или началом целой индустрии алгоритмического форсайта и предиктивного управления наукой.