Перейти к содержанию

Модуль 19. Петли обратной связи и внимание

Чему вы научитесь в этом модуле

  • Объяснять петлю обратной связи: система обучается на данных, которые сама же и порождает.
  • Показывать, каким образом оптимизация вовлечения формирует пузырь фильтров, и описывать способы его размыкания.
  • Объяснять, почему вовлечение — это прокси, и связывать это с законом Гудхарта из модуля 16.
  • Различать два значения слова «внимание»: механизм внутри нейронной сети и дефицитный ресурс человека.
  • Называть психологическую цену оптимизации вовлечения и кто её оплачивает.

Время: около двух недель. Пререквизиты: модуль 18 и модуль 16. Ноутбук: открыть в Colab · notebooks/19-feedback-loops-and-attention.ipynb

Зачем нужен этот модуль

В модуле 18 смещение логов было проблемой измерения. Здесь оно замыкается в петлю и становится проблемой реального мира. Рекомендатель показывает то, что считает подходящим; пользователь взаимодействует только с тем, что ему показали; на этих взаимодействиях рекомендатель обучается заново — и показывает ещё больше того же самого. Система учится на данных, которые сама и породила, и с каждым оборотом петли всё сильнее подтверждает собственные решения.

Рекомендатель Пользователь показывает клики обучают заново

Пузырь фильтров

У петли есть неизбежное следствие. Что показывают чаще, с тем чаще взаимодействуют; с чем чаще взаимодействуют, то показывают ещё чаще. Малейший начальный перекос усиливается сам собой, и лента, начавшись разнообразной, постепенно сползает к узкому набору наиболее цепляющих тем. Это пузырь фильтров, и он является не чьим-то злым умыслом, а прямым свойством петли.

Нажимайте «следующий раунд». Лента начинается ровной, но темы т1 и т2 цепляют чуть сильнее, поэтому их показывают чуть больше, поэтому с ними взаимодействуют чуть чаще — и через несколько раундов они занимают почти всё пространство, а разнообразие обваливается. Включите «исследование»: система подмешивает случайное содержимое, и пузырь перестаёт схлопываться. Петля размыкается тем же приёмом, каким в модуле 4 SGD не застревал в первом локальном минимуме, — щепоткой случайности.

Вовлечение — это прокси

Почему система вообще усиливает цепляющее, а не полезное? Потому что она оптимизирует то, что умеет измерить: вовлечение — клики, время просмотра, досмотры. Вовлечение легко посчитать, а «польза» или «благополучие пользователя» — нет. И тут возвращается модуль 16: вовлечение — это прокси, и оптимизировать его до конца опасно.

Оптимизатор, которому задали вовлечение, находит в человеке те же щели, что агент находил в награде. Автовоспроизведение, бесконечная лента, сенсационные и возмущающие заголовки удерживают внимание эффективнее, чем то, что человек выбрал бы сам в спокойном состоянии. Система не «хочет зла» — она нашла максимум заданной метрики, и этот максимум оказался не там, где находится польза. Это reward hacking из модуля 16, только жертва — не симулированный робот, а миллиарды реальных людей.

Два смысла слова «внимание»

Здесь курс сводит вместе два «внимания», о которых до сих пор говорил порознь.

В модуле 10 внимание — это механизм внутри нейронной сети: распределение ограниченной массы весов по элементам последовательности. Здесь внимание — это ресурс человека: ограниченный, дефицитный, и за него борется лента рекомендаций. Совпадение неслучайно: и в том, и в другом случае «внимание» — это распределение ограниченного ресурса между множеством объектов, и ключевой вопрос один — кто и подо что его перераспределяет. Разница в том, кому этот ресурс принадлежит и кто на нём зарабатывает.

Отсюда психологическая цена. Внимание конечно; час, проведённый в ленте, оптимизированной на удержание, не возвращается. Система, обученная максимизировать вовлечение, по самому своему устройству работает против намерения пользователя закрыть приложение. Это не побочный эффект, а буквально её целевая функция.

«Оптимизируют не то» — в третий раз. В модуле 16 агент взламывал награду в лабораторных условиях. Здесь лента взламывает вовлечение на живых людях. В модуле 25 исследователи будут взламывать лидерборд. Один закон Гудхарта, три масштаба: симулятор, общество, наука. А смещение логов из модуля 18 — это первый оборот той самой петли, которая здесь раскрутилась до пузыря.

Практическая часть

Часть 1. Работа с ноутбуком

Откройте notebooks/19-feedback-loops-and-attention.ipynb. Только numpy и matplotlib, вычисления занимают секунды.

Что содержится внутри:

  1. Пузырь фильтров: петля усиливает цепляющее содержимое, разнообразие (энтропия) обваливается по раундам. Добавление исследования его удерживает.
  2. Богатый богатеет: малое случайное преимущество товара компаундируется в полное доминирование. Концентрация растёт — эффект Матфея.
  3. Вовлечение против пользы: петля максимизирует вовлечение (прокси), а охват настоящих интересов пользователя проходит пик и начинает падать — закон Гудхарта внутри петли.

Часть 2. Собственная лента

Возьмите любую ленту, которой вы пользуетесь.

  1. Что она оптимизирует — и как вы это определили по тому, что она показывает?
  2. Заметен ли пузырь: сузился ли ваш поток за последние месяцы?
  3. Где в ленте видно, что вовлечение — это прокси, а не польза?
  4. Что разомкнуло бы петлю, не разрушив рекомендации полностью?

Задание

  1. Смоделируйте петлю: показ → вовлечение → пересчёт показа. Постройте энтропию ленты по раундам с исследованием и без. Найдите значение \(\varepsilon\), при котором пузырь перестаёт схлопываться.
  2. Смоделируйте эффект Матфея: товары стартуют практически равными, но вовлечение усиливает лидеров. Постройте коэффициент Джини по раундам.
  3. Разведите вовлечение и настоящий интерес пользователя как две отдельные величины. Покажите, что петля увеличивает первое и снижает второе.
  4. Добавьте разнообразие в целевую функцию и покажите, чем расплачивается вовлечение за размыкание пузыря.
  5. Опишите одно реальное последствие петли обратной связи в формате модуля 1: что оптимизировали, что подразумевали, где щель.

Проверка усвоения

  1. Что такое петля обратной связи и почему она подтверждает собственные решения?
  2. Каким образом из петли формируется пузырь фильтров и чем его размыкают?
  3. Почему вовлечение — это прокси, и с каким модулем это рифмуется?
  4. Назовите два значения слова «внимание» в курсе и что у них общего.
  5. В чём заключается психологическая цена оптимизации вовлечения и кто её оплачивает?
  6. Что такое эффект Матфея в рекомендациях?
  7. Почему система, максимизирующая вовлечение, работает против намерения пользователя?

Что дальше

В модуле 20 — как вообще установить, что рекомендатель действительно что-то улучшил, а не просто раскрутил петлю: A/B-тесты и причинность. Корреляция против причины, рандомизация, подглядывание в промежуточные результаты и множественные сравнения — тот же арсенал модуля 1, но теперь применённый к эксперименту на живых пользователях.

Петля обратной связи обучает систему на данных, которые она сама создала, и превращает вовлечение — прокси внимания — в пузырь. Внимание человека конечно, и лента, оптимизированная на удержание, работает против него по самому своему устройству.


Принцип

Система, которой задали вовлечение как награду, найдёт в человеке те же щели, что агент нашёл в симуляции. Разница в том, что цена ошибки здесь измеряется не в игровых очках, а в часах чужой жизни.