Перейти к содержанию

Модуль 25. Как устроена область

Чему вы научитесь в этом модуле

  • Описывать путь работы: идея → препринт на arXiv → конференция → рецензирование → сборник.
  • Объяснять, что рецензирование ловит, а что нет, и почему это фильтр, а не доказательство.
  • Объяснять, что такое бенчмарк и лидерборд и почему это плохой источник истины.
  • Показывать, каким образом гонка за первое место дообучает всё сообщество на публичном тесте.
  • Пользоваться лидербордом как картой, а не как приговором.

Время: около недели. Пререквизиты: модуль 24, модуль 7 и модуль 16. Ноутбук: открыть в Colab · notebooks/25-how-the-field-is-organised.ipynb

Зачем нужен этот модуль

В модуле 24 вы научились проверять одну статью. Но статьи не висят в пустоте: у них есть конвейер, который определяет, что вы вообще увидите, и бенчмарки, которые определяют, что считается прогрессом. Понимать этот механизм — значит понимать, в каких местах он теряет истину.

Путь работы

идея препринт arXiv подача рецензия сборник заявка, не факт фильтр, не доказательство

arXiv — это препринт-сервер: работу выкладывают без рецензирования и практически мгновенно. Это ускоряет обмен знаниями, но означает главное: препринт — это заявка, а не проверенный факт. Половина громких результатов живёт только на arXiv и дальше не проходит.

Рецензирование — два-четыре человека читают работу и решают, принять ли её на конференцию. Рецензирование ловит явные дыры: отсутствие базы, необоснованный вывод, кривую постановку задачи. Однако оно почти никогда не воспроизводит результат: рецензент не запускает код, не перепроверяет числа, не ловит подгонку случайного зерна. Рецензия — это фильтр качества изложения, а не доказательство правоты. Статья, прошедшая рецензирование, по-прежнему требует проверки из модуля 24.

Бенчмарки и лидерборды

Чтобы сравнивать методы между собой, область заводит бенчмарк — общий тестовый набор с фиксированной метрикой. Результаты выстраивают в лидерборд — рейтинг. Это удобно, и это плохой источник истины сразу по нескольким причинам.

потолок быстрый рост насыщение время · число поданных методов балл
  • Публичный тест утекает через повторные подачи. Все настраиваются на один и тот же набор, и он постепенно перестаёт измерять обобщение — это закон Гудхарта из модуля 16: бенчмарк, ставший целью, перестаёт быть мерой.
  • Первое место — часто «лучший из многих». Гонка за SOTA — это отбор зерна из модуля 24 в масштабе целого сообщества: из сотни попыток верх займёт самая удачная, а не самая надёжная.
  • Одно число прячет провалы по срезам. Лидерборд ранжирует по среднему, а средний балл прячет регресс ровно как в модуле 23.
  • Насыщение. Когда все у потолка, число перестаёт различать методы: +0.1% наверху ничего не значит.

Порядок рассыпается

Главное следствие — на демонстрации ниже. Возьмём лидерборд и прогоним те же методы на свежем тесте, которого никто не видел.

Слева — гонка за первое место на публичном бенчмарке. Нажмите «показать свежий тест». На новых данных порядок рассыпается: метод A, первый на бенчмарке, откатывается на четвёртое место, а наверх выходит метод C, который был лишь третьим. Сообщество дообучилось на публичном тесте — и лидерборд перестал измерять то, ради чего он был заведён. Пользоваться им можно, но как картой, а не приговором: он показывает, где искать, а не что является истинным.

Лидерборд — это закон Гудхарта из модуля 16 в масштабе целого сообщества. Там метрику набивал один агент; здесь на публичный тест настраиваются тысячи исследователей разом, и он перестаёт измерять обобщение — та же отложенная выборка из модуля 7, только протёртая до дыр коллективной подгонкой. Мера, ставшая целью сразу для всех, изнашивается быстрее, чем для одного.

Практическая часть

Часть 1. Работа с ноутбуком

Откройте notebooks/25-how-the-field-is-organised.ipynb. Только numpy и matplotlib.

Что содержится внутри:

  1. Утечка бенчмарка: сообщество подаёт сотни методов на один публичный тест. Балл лидера ползёт вверх, а результат на свежем тесте стоит на месте. Разрыв между ними — это переобучение на бенчмарк.
  2. Гонка за SOTA: из множества шумных методов «лучший на публичном тесте» систематически хуже на свежем — регрессия к среднему.
  3. Насыщение: когда все у потолка, разница между первым и десятым местом уходит в шум — рейтинг перестаёт различать.

Часть 2. Собственная область

Возьмите бенчмарк из вашей темы (лидерборд с сайта, таблица из обзора).

  1. Как давно он существует и насколько близко лидеры к потолку?
  2. Публичный ли тест? Сколько раз в год на него подают?
  3. У первого места открыт код? Насколько его отрыв от второго превышает шум?
  4. Есть ли свежая версия бенчмарка — и падают ли на ней прежние лидеры?

Задание

  1. Смоделируйте лидерборд из N методов с истинным качеством плюс шум и публичный тест, на котором выбирают лучший. Постройте балл лидера и его же результат на свежем тесте по мере роста числа подач.
  2. Покажите, что разрыв между публичным и свежим баллом растёт с числом попыток — это и есть переобучение на бенчмарк.
  3. Возьмите насыщенный бенчмарк (все у потолка) и покажите, что порядок мест почти полностью определяется шумом.
  4. Сравните ранжирование по среднему и по худшему срезу и найдите метод, который является лидером по среднему и провальным по срезу.
  5. Постройте «честный» лидерборд с доверительными интервалами и покажите, сколько верхних мест статистически неразличимы.

Проверка усвоения

  1. Что такое arXiv и почему препринт — это заявка, а не факт?
  2. Что рецензирование ловит, а что нет?
  3. Назовите четыре причины, по которым лидерборд является плохим источником истины.
  4. Каким образом гонка за первое место дообучает сообщество на публичном тесте?
  5. Почему на насыщенном бенчмарке +0.1% наверху ничего не значит?
  6. С каким модулем рифмуется утечка бенчмарка и с каким — гонка за SOTA?
  7. Как всё-таки правильно пользоваться лидербордом?

Что дальше

Вы поняли, где область теряет истину. В модуле 26 — что с этим делать: воспроизведение как единственная настоящая проверка. Не «прошло рецензию» и не «наверху лидерборда», а «я взял статью, запустил и получил тот же результат — или не получил».

Препринт — это заявка, а не факт; рецензия — фильтр изложения, а не доказательство правоты; лидерборд ранжирует по числу, которое сообщество постепенно переобучает. Пользоваться лидербордом можно, но как картой, а не приговором: он показывает, где искать, а не что является истинным.


Принцип

Механизм, который распространяет результаты, и механизм, который их проверяет, — это разные механизмы, и второй слабее первого. Поэтому место в рейтинге — это повод посмотреть внимательнее, а не окончательный итог.