Данные не предупреждают, когда ломаются. Хуже того: самая опасная поломка выглядит как нормальная работа. Внутри инвестбанка ежедневно исполняется процедура, которая определяет расчёт капитала, кредитные лимиты и отчётность перед регулятором. Если в конвейер попадает «замерзший» поток — вчерашние цифры, повторённые слово в слово, — статистический контроль его не заметит. Потому что замерзшие данные неотличимы от настоящих.
Это не гипотеза. В июне 2026 года на arXiv вышел препринт «Как находить выбросы» (2606.20079): Даниил Пейсахович из UBS и Рафал Серадзки из NYU Stern разобрали проприетарные данные крупного глобального банка по кредитным деривативам — 183 сделки, 129 торговых дней. Вывод обманчиво прост. Одиночный алгоритм аномалий не справляется. Ансамбль из них справляется лучше, но всё равно не заменяет детерминированные правила, которые в риске должны быть зашиты вручную.
ХРОНИКА: КАК БАНКИ УЧАТСЯ ВИДЕТЬ ЗАМОРОЖЕННЫЕ ДАННЫЕ
─────────────────────────────────────────────────────────────
2013 ──────── 2019 ──────── 03.2026 ──────── 06.2026 ──────── 07.2026
██████████ ██████████ ██████████ ◉ СЕЙЧАС ██████████
BCBS-239: FRTB: США: Basel III 18.06 EQAF- RBI: проект
принципы финальный консультация, препринт на правил по
качества стандарт внедрение arXiv, 2606. данным и
данных рыночного крупных форм 20079, F1 модели
риска 2013/19 61–79% риск
Авторская хронология по материалам BIS, Европарламента, ECB и препринта EQAF
Хронология здесь не случайна. С 2013 года регуляторы требовали от банков качества данных через BCBS-239, затем — автоматических аудируемых контролей через FRTB. В 2026 году обе линии сошлись: автоматизация риск-расчетов стала нормой, и одновременно выяснилось, что её страховка — детекторы аномалий — слепа там, где ошибка страшнее всего.
Конвейер, в котором ошибка молчит
Риск-модель банка — это конвейер. Утром приходят цены, волатильности и кривые; по ним пересчитывается стоимость портфеля; вечером итог уходит в расчёт капитала и к регулятору. На любом из этих шагов возможен сбой: отказ поставщика данных, неправильная конфигурация модели, сбой системы. Проблема в том, что сбой можно спрятать. Большинство детекторов аномалий обучены находить «странные» значения — слишком большие, слишком резкие. А есть отдельный класс ошибок, который они не видят по построению.
Это аномалии stale-value (заморозка значения): поток, в котором сегодняшняя оценка численно совпадает со вчерашней и позавчерашней. Для статистического алгоритма это не выброс, а точное попадание в прошлое — то есть ничего аномального. Цена не двинулась, значит, всё спокойно. Именно поэтому чисто статистические методы системно проваливают их детекцию, и это показано в эксперименте EQAF с контролируемой инъекцией аномалий в восемь реалистичных сценариев.
Что даёт ансамбль
Авторы построили EQAF — Ensemble Quality Assessment Framework: слоистую ненаблюдаемую архитектуру, которая комбинирует дополняющие друг друга методы поиска выбросов и мониторит целостность риск-расчётов в реальном времени. Они сравнивали её с лучшим одиночным методом на четырёх наборах риск-метрик.
| Параметр | Лучший одиночный метод | Ансамбль EQAF |
|---|---|---|
| F1-мера | 6–66% | 61–79% |
| AUC-ROC | базовый | +4–6 п.п. (устойчиво к порогам) |
| Данные | 183 сделки, 129 торговых дней, 8 сценариев инъекции | |
arXiv 2606.20079, 2026
Разброс в 6–66% у одиночных методов — это не калибровочная проблема, а свойство выборки: разные типы аномалий ловятся разными инструментами. Точковый выброс находит один метод, контекстный — другой, коллективный — третий. Ни один не покрывает всё. Ансамбль сглаживает провалы, но, по данным исследования, прирост AUC в 4–6 п.п. сохраняется при любом пороге — улучшение структурное, а не подогнанное.
Статистические детекторы структурно слепы к аномалиям stale-value — ошибке, при которой вчерашняя цифра повторяется как сегодняшняя.
Ансамбль поднимает F1 до 61–79% против 6–66% у лучшего одиночного метода.
Детерминированные доменные правила остаются незаменимыми: машинный слой их дополняет, а не заменяет.
Регуляторы догоняют автоматизацию
Выводы EQAF пришлись на момент, когда регуляторы одновременно ужесточили требования к данным и временно ослабили требования к самому расчёту. 4 июня 2026 года Еврокомиссия приняла делегированный акт C(2026)3647 — трёхлетнюю приостановку части правил FRTB по рыночному риску согласно CRR; Европарламент рассматривал его 23 июня. В марте того же года американские банковские агентства опубликовали консультационный пакет по завершению имплементации Базеля III. ECB в отчёте за первый квартал публикует агрегированные таблицы качества данных надзорной отчётности, где прослеживается доля ошибок по каждому банку.
Индия пошла дальше всех: в июле 2026 года RBI выпустила сразу два проекта документов — инструкцию по управлению цифровыми данными (с фокусом на качество, происхождение и lineage данных, до конца линии третьих сторон) и руководство по модельному риску, охватывающее и классические статистические, и AI/ML-модели. Общий знаменатель: от банков требуют автоматических, аудируемых контролей качества внутренних моделей. EQAF даёт именно такие — и показывает их границу.
Слепое пятно архитектурное
Самая важная мысль препринта лежит не в цифрах, а в типологии. Точковый выброс — это опечатка в данных; его легко найти. Контекстный — значения, нормальные по величине, но странные по обстоятельствам; замороженный поток относится сюда. Коллективный — группа наблюдений, аномальная вместе. Авторы фиксируют: вероятность, что статистика увидит замерзание, падает именно потому, что фид «правильно» повторяет историю. Это не недостаток конкретного алгоритма — это архитектурная слепота класса методов.
Отсюда практическое следствие для тех, кто принимает решения. Растущая автоматизация риск-функций (в банках уже внедряется GenAI-тестирование моделей и LLM-как-судья для валидации) снижает стоимость обнаружения резких ошибок, но ничего не делает со слепотой к медленным. Дополнение машинного слоя детерминированными правилами — проверка заморозки веток данных, сравнение с ожидаемым числом обновлений, явный аудит фидов — остаётся обязательным. Судя по эксперименту EQAF, именно гибрид ансамбля и правил даёт результат, на который регуляторы и ориентируются.
Банк, который заменит правила ансамблем, выиграет в скорости и проиграет в точности на самом дорогом классе ошибок. Банк, который оставит только правила, утонет в ручных переключениях. Решение — в слоистости: статистика ловит резкое, код проверяет факт обновления, человек отвечает за то, что расхождение между двумя слоями не молчит. Именно такой слой описывает EQAF: он не «умнее» детекторов, он устроен так, чтобы между слоями не оставалось зоны тишины.
Показательно другое: тот же принцип — несколько дополняющих взглядов вместо одного «правильного» — месяцами ранее всплыл в самой риск-функции. Параллельно с моделью валидации банки строят управление GenAI-моделями и переводят команды модель-риска с ручной документации на автоматизированный мониторинг. Общая логика одна: риск-инфраструктура перестаёт полагаться на один источник правды. Синтез напрашивается сам. Когда банки начинают доверять рекомендациям агентных систем и LLM-ассистентов в скоринге и валидации, они переносят ту же задачу на другой масштаб: подтверждать, что данные «живые», а решения не застряли в прошлой конфигурации модели. Gartner в своих трендах аналитики на 2026 год добавляет decision governance — это та же идея слоистого контроля, только для советующих алгоритмов. И здесь EQAF даёт готовую типологию: каталог доменных правил плюс ансамбль статистических детекторов плюс явная проверка, что каждый слой реально изменился.
Замороженные данные — это напоминание: в автоматизированном мире самая дешёвая защита не та, что ловит всё, а та, что не даёт ошибке молчать.