Модуль 25. Как устроена область¶
Чему вы научитесь в этом модуле
- Описывать путь работы: идея → препринт на arXiv → конференция → рецензирование → сборник.
- Объяснять, что рецензирование ловит, а что нет, и почему это фильтр, а не доказательство.
- Объяснять, что такое бенчмарк и лидерборд и почему это плохой источник истины.
- Показывать, каким образом гонка за первое место дообучает всё сообщество на публичном тесте.
- Пользоваться лидербордом как картой, а не как приговором.
Время: около недели. Пререквизиты: модуль 24, модуль 7 и модуль 16.
Ноутбук: открыть в Colab · notebooks/25-how-the-field-is-organised.ipynb
Зачем нужен этот модуль¶
В модуле 24 вы научились проверять одну статью. Но статьи не висят в пустоте: у них есть конвейер, который определяет, что вы вообще увидите, и бенчмарки, которые определяют, что считается прогрессом. Понимать этот механизм — значит понимать, в каких местах он теряет истину.
Путь работы¶
arXiv — это препринт-сервер: работу выкладывают без рецензирования и практически мгновенно. Это ускоряет обмен знаниями, но означает главное: препринт — это заявка, а не проверенный факт. Половина громких результатов живёт только на arXiv и дальше не проходит.
Рецензирование — два-четыре человека читают работу и решают, принять ли её на конференцию. Рецензирование ловит явные дыры: отсутствие базы, необоснованный вывод, кривую постановку задачи. Однако оно почти никогда не воспроизводит результат: рецензент не запускает код, не перепроверяет числа, не ловит подгонку случайного зерна. Рецензия — это фильтр качества изложения, а не доказательство правоты. Статья, прошедшая рецензирование, по-прежнему требует проверки из модуля 24.
Бенчмарки и лидерборды¶
Чтобы сравнивать методы между собой, область заводит бенчмарк — общий тестовый набор с фиксированной метрикой. Результаты выстраивают в лидерборд — рейтинг. Это удобно, и это плохой источник истины сразу по нескольким причинам.
- Публичный тест утекает через повторные подачи. Все настраиваются на один и тот же набор, и он постепенно перестаёт измерять обобщение — это закон Гудхарта из модуля 16: бенчмарк, ставший целью, перестаёт быть мерой.
- Первое место — часто «лучший из многих». Гонка за SOTA — это отбор зерна из модуля 24 в масштабе целого сообщества: из сотни попыток верх займёт самая удачная, а не самая надёжная.
- Одно число прячет провалы по срезам. Лидерборд ранжирует по среднему, а средний балл прячет регресс ровно как в модуле 23.
- Насыщение. Когда все у потолка, число перестаёт различать методы: +0.1% наверху ничего не значит.
Порядок рассыпается¶
Главное следствие — на демонстрации ниже. Возьмём лидерборд и прогоним те же методы на свежем тесте, которого никто не видел.
Слева — гонка за первое место на публичном бенчмарке. Нажмите «показать свежий тест». На новых данных порядок рассыпается: метод A, первый на бенчмарке, откатывается на четвёртое место, а наверх выходит метод C, который был лишь третьим. Сообщество дообучилось на публичном тесте — и лидерборд перестал измерять то, ради чего он был заведён. Пользоваться им можно, но как картой, а не приговором: он показывает, где искать, а не что является истинным.
Лидерборд — это закон Гудхарта из модуля 16 в масштабе целого сообщества. Там метрику набивал один агент; здесь на публичный тест настраиваются тысячи исследователей разом, и он перестаёт измерять обобщение — та же отложенная выборка из модуля 7, только протёртая до дыр коллективной подгонкой. Мера, ставшая целью сразу для всех, изнашивается быстрее, чем для одного.
Практическая часть¶
Часть 1. Работа с ноутбуком¶
Откройте notebooks/25-how-the-field-is-organised.ipynb. Только numpy и matplotlib.
Что содержится внутри:
- Утечка бенчмарка: сообщество подаёт сотни методов на один публичный тест. Балл лидера ползёт вверх, а результат на свежем тесте стоит на месте. Разрыв между ними — это переобучение на бенчмарк.
- Гонка за SOTA: из множества шумных методов «лучший на публичном тесте» систематически хуже на свежем — регрессия к среднему.
- Насыщение: когда все у потолка, разница между первым и десятым местом уходит в шум — рейтинг перестаёт различать.
Часть 2. Собственная область¶
Возьмите бенчмарк из вашей темы (лидерборд с сайта, таблица из обзора).
- Как давно он существует и насколько близко лидеры к потолку?
- Публичный ли тест? Сколько раз в год на него подают?
- У первого места открыт код? Насколько его отрыв от второго превышает шум?
- Есть ли свежая версия бенчмарка — и падают ли на ней прежние лидеры?
Задание¶
- Смоделируйте лидерборд из N методов с истинным качеством плюс шум и публичный тест, на котором выбирают лучший. Постройте балл лидера и его же результат на свежем тесте по мере роста числа подач.
- Покажите, что разрыв между публичным и свежим баллом растёт с числом попыток — это и есть переобучение на бенчмарк.
- Возьмите насыщенный бенчмарк (все у потолка) и покажите, что порядок мест почти полностью определяется шумом.
- Сравните ранжирование по среднему и по худшему срезу и найдите метод, который является лидером по среднему и провальным по срезу.
- Постройте «честный» лидерборд с доверительными интервалами и покажите, сколько верхних мест статистически неразличимы.
Проверка усвоения¶
- Что такое arXiv и почему препринт — это заявка, а не факт?
- Что рецензирование ловит, а что нет?
- Назовите четыре причины, по которым лидерборд является плохим источником истины.
- Каким образом гонка за первое место дообучает сообщество на публичном тесте?
- Почему на насыщенном бенчмарке +0.1% наверху ничего не значит?
- С каким модулем рифмуется утечка бенчмарка и с каким — гонка за SOTA?
- Как всё-таки правильно пользоваться лидербордом?
Что дальше¶
Вы поняли, где область теряет истину. В модуле 26 — что с этим делать: воспроизведение как единственная настоящая проверка. Не «прошло рецензию» и не «наверху лидерборда», а «я взял статью, запустил и получил тот же результат — или не получил».
Препринт — это заявка, а не факт; рецензия — фильтр изложения, а не доказательство правоты; лидерборд ранжирует по числу, которое сообщество постепенно переобучает. Пользоваться лидербордом можно, но как картой, а не приговором: он показывает, где искать, а не что является истинным.
Принцип
Механизм, который распространяет результаты, и механизм, который их проверяет, — это разные механизмы, и второй слабее первого. Поэтому место в рейтинге — это повод посмотреть внимательнее, а не окончательный итог.