Способна ли машина предсказать, где произойдёт следующий научный прорыв — за годы до того, как мир заметит результат?

В 2025 году Google DeepMind представил AI co-scientist (ИИ-соисследователь) — мультиагентную систему на базе Gemini 2.0, которая за недели сгенерировала гипотезы, на годы опередившие экспериментальные исследования. В 2026 году группа из Женевского университета и CERN пошла дальше: они построили модель для предсказания структурных предшественников прорывов — новых связей между научными концепциями.

Замена философии: вместо «ИИ-учёного» — «ИИ-радар».

От библиометрии к динамике сетей

Идея предсказывать науку через её структуру не нова. Ещё в 2010 году работы Barabási и соавторов показали, что цитационные сети подчиняются степенным распределениям — одни работы собирают почти все ссылки, остальные остаются на периферии. К 2021 году Min с коллегами из Нанкинского университета научились предсказывать прорывы по вариациям структуры знаний — но точность оставалась низкой, а модели — чёрными ящиками.

Перелом наступил с появлением OpenAlex.

В 2022 году некоммерческая организация OurResearch запустила открытый каталог научных работ, который к 2026 году индексирует более 250 млн публикаций с семантической разметкой концептов. В отличие от Scopus или Web of Science, OpenAlex доступен без лицензии и предоставляет размеченный граф знаний — концепты как узлы, их совместная встречаемость в публикациях как рёбра.

Для прогнозирования это оказалось важнее, чем любой алгоритм.

59 признаков, две стадии, одна архитектура

Работа Maillart, Chataing и коллег из Университета Женевы, CERN и armasuisse, опубликованная на arXiv в июне 2026 года, объединяет две задачи, которые раньше решались раздельно: предсказание появления новой связи между концептами и предсказание её силы.

Модель использует 59 семантических и топологических признаков для каждого узла графа знаний — от меры Adamiс-Adar (вероятность связи через общих соседей) до центральности по посредничеству. Двухстадийный LightGBM сначала оценивает, появится ли связь вообще, а затем — насколько она усилится.

Результаты впечатляют: ROC-AUC от 0.954 до 0.967 на четырёх технологических и биомедицинских доменах без перенастройки под каждый. Для сравнения — предшествующие модели давали около 0.90. При этом все прогнозы объяснимы: каждое предсказание опирается на структурные, аудитируемые признаки, а не на непрозрачные эмбеддинги.

Главный вывод авторов: прорывы — это результат плотных, когезивных субсетей, сформированных кластеризацией и избирательным связыванием. Те же структурные паттерны доминируют на всех горизонтах — от года до пяти лет.

Проверка на квантовых материалах

Два кейса авторы разбирают особенно подробно: квантовый annealing (отжиг) и AI-архитектуры для квантовых вычислений. В обоих случаях модель выявила нарастающую близость между концептами Computer Architecture и Quantum Algorithms за 1–2 года до того, как это направление стало самостоятельным исследовательским фронтом.

Основа предсказания — паттерны утолщения связей, которые в OpenAlex видны как рост ко-оккурренсов (co-occurrence, совместная встречаемость) в публикациях.

Как мы писали в июле, алгоритмы уже автоматизируют стратегический форсайт. Модель Майара и Шатена идёт глубже: она вскрывает механизм — показывает, через какие структурные изменения в графе знаний прорыв становится возможным.

Трёхуровневая архитектура для политики

Авторы не ограничились моделью. Они предложили трёхуровневую архитектуру принятия решений: Detection (автоматическое сканирование патентов, публикаций и грантов), Translation (экспертная валидация), Integration (встраивание в циклы инвестиционного и научно-технического планирования).

Это прямое замыкание контура между data science (наукой о данных) и research policy (научно-технической политикой).

Для венчурных фондов и корпоративных R&D-отделов такой инструмент означает сдвиг от реактивного к предиктивному управлению портфелем. Вместо вопроса «какие стартапы уже в топе» — «какие направления станут горячими через 2–3 года и где формируются новые исследовательские кластеры, которые пока никто не отслеживает».

Но есть и риски.

Модель наследует смещения OpenAlex — особенно в областях с недавней публикационной активностью или в национальных научных системах, слабо представленных в англоязычных журналах. Китайская наука, например, генерирует больше патентов, чем статей в международных журналах — а модель обучается на публикациях. Российские исследовательские группы в материаловедении и ядерной физике публикуются в национальных журналах, которые OpenAlex индексирует с задержками.

Авторы честно фиксируют эти ограничения: порог концепт-скоров и 90-й перцентиль ко-оккурренсов — консервативные, но не нейтральные выборы.

Значение и горизонт

Работа Maillart et al. не первая попытка предсказать науку алгоритмически. Это первая модель, которая одновременно достигает высокой точности (AUC > 0.95) и полной объяснимости — на открытых данных, с воспроизводимым кодом, без привязки к проприетарным источникам.

Что это значит для рынка:

Конвергенция трёх трендов — открытых графов знаний (OpenAlex), объяснимого машинного обучения (LightGBM) и растущего институционального спроса на предиктивную аналитику — создаёт условия, в которых прогнозирование прорывов перестаёт быть академическим экспериментом и становится управленческим инструментом.

Во-первых, снижение информационной асимметрии в R&D. Корпорации и фонды, которые интегрируют такие модели в свои процессы, получают 2–5 лет форы перед конкурентами, всё ещё полагающимися на экспертные панели.

Во-вторых, сдвиг в самом определении «прорыва». Если прорыв предсказуем по структурным предшественникам, то меняется подход к финансированию науки: вместо «поддержим самых ярких» — «профинансируем связи, ведущие к новым комбинациям».

В-третьих, появление нового класса продуктов — prediction-as-a-service (прогнозирование как сервис) для научно-технической политики. Авторы уже выложили код на GitHub под открытой лицензией. Следующий шаг — коммерциализация через спин-аут или интеграцию в существующие платформы стратегического форсайта.

📊
Ключевые сигналы для отслеживания

Регистрация спин-аута командой Maillart / Chataing — первый признак коммерциализации

Интеграция модели в OpenAlex API — сделает прогнозы доступными для тысяч университетов

Появление регуляторных стандартов для «алгоритмического форсайта» — особенно в ЕС и Великобритании

Конкурирующие подходы от крупных игроков: Elsevier (Scopus) и Digital Science (Dimensions) располагают сопоставимыми графами знаний

Что дальше

Главный вопрос — не технический. Возможность предсказывать прорывы уже доказана. Спрос смещается к распределению доступа: кто получит эти прогнозы, как быстро институты адаптируют архитектуру принятия решений под новый тип информации.

Технологии для предиктивной science policy уже существуют. Институциональные привычки — пока нет. Разрыв между возможностью алгоритмического форсайта и готовностью институтов встраивать его в циклы принятия решений — сейчас главное узкое место.

Следующие 12 месяцев покажут: работа женевской группы станет единичным академическим результатом или началом целой индустрии алгоритмического форсайта и предиктивного управления наукой.

Explainable Forecasting of Scientific Breakthroughs from Concept Network Dynamics
Исходная работа Maillart, Chataing et al. — открытый код, данные OpenAlex, полная воспроизводимость
Основной источник статьи — именно этот препринт лежит в основе всего анализа