Модуль 19. Петли обратной связи и внимание¶
Чему вы научитесь в этом модуле
- Объяснять петлю обратной связи: система обучается на данных, которые сама же и порождает.
- Показывать, каким образом оптимизация вовлечения формирует пузырь фильтров, и описывать способы его размыкания.
- Объяснять, почему вовлечение — это прокси, и связывать это с законом Гудхарта из модуля 16.
- Различать два значения слова «внимание»: механизм внутри нейронной сети и дефицитный ресурс человека.
- Называть психологическую цену оптимизации вовлечения и кто её оплачивает.
Время: около двух недель. Пререквизиты: модуль 18 и модуль 16.
Ноутбук: открыть в Colab · notebooks/19-feedback-loops-and-attention.ipynb
Зачем нужен этот модуль¶
В модуле 18 смещение логов было проблемой измерения. Здесь оно замыкается в петлю и становится проблемой реального мира. Рекомендатель показывает то, что считает подходящим; пользователь взаимодействует только с тем, что ему показали; на этих взаимодействиях рекомендатель обучается заново — и показывает ещё больше того же самого. Система учится на данных, которые сама и породила, и с каждым оборотом петли всё сильнее подтверждает собственные решения.
Пузырь фильтров¶
У петли есть неизбежное следствие. Что показывают чаще, с тем чаще взаимодействуют; с чем чаще взаимодействуют, то показывают ещё чаще. Малейший начальный перекос усиливается сам собой, и лента, начавшись разнообразной, постепенно сползает к узкому набору наиболее цепляющих тем. Это пузырь фильтров, и он является не чьим-то злым умыслом, а прямым свойством петли.
Нажимайте «следующий раунд». Лента начинается ровной, но темы т1 и т2 цепляют чуть сильнее, поэтому их показывают чуть больше, поэтому с ними взаимодействуют чуть чаще — и через несколько раундов они занимают почти всё пространство, а разнообразие обваливается. Включите «исследование»: система подмешивает случайное содержимое, и пузырь перестаёт схлопываться. Петля размыкается тем же приёмом, каким в модуле 4 SGD не застревал в первом локальном минимуме, — щепоткой случайности.
Вовлечение — это прокси¶
Почему система вообще усиливает цепляющее, а не полезное? Потому что она оптимизирует то, что умеет измерить: вовлечение — клики, время просмотра, досмотры. Вовлечение легко посчитать, а «польза» или «благополучие пользователя» — нет. И тут возвращается модуль 16: вовлечение — это прокси, и оптимизировать его до конца опасно.
Оптимизатор, которому задали вовлечение, находит в человеке те же щели, что агент находил в награде. Автовоспроизведение, бесконечная лента, сенсационные и возмущающие заголовки удерживают внимание эффективнее, чем то, что человек выбрал бы сам в спокойном состоянии. Система не «хочет зла» — она нашла максимум заданной метрики, и этот максимум оказался не там, где находится польза. Это reward hacking из модуля 16, только жертва — не симулированный робот, а миллиарды реальных людей.
Два смысла слова «внимание»¶
Здесь курс сводит вместе два «внимания», о которых до сих пор говорил порознь.
В модуле 10 внимание — это механизм внутри нейронной сети: распределение ограниченной массы весов по элементам последовательности. Здесь внимание — это ресурс человека: ограниченный, дефицитный, и за него борется лента рекомендаций. Совпадение неслучайно: и в том, и в другом случае «внимание» — это распределение ограниченного ресурса между множеством объектов, и ключевой вопрос один — кто и подо что его перераспределяет. Разница в том, кому этот ресурс принадлежит и кто на нём зарабатывает.
Отсюда психологическая цена. Внимание конечно; час, проведённый в ленте, оптимизированной на удержание, не возвращается. Система, обученная максимизировать вовлечение, по самому своему устройству работает против намерения пользователя закрыть приложение. Это не побочный эффект, а буквально её целевая функция.
«Оптимизируют не то» — в третий раз. В модуле 16 агент взламывал награду в лабораторных условиях. Здесь лента взламывает вовлечение на живых людях. В модуле 25 исследователи будут взламывать лидерборд. Один закон Гудхарта, три масштаба: симулятор, общество, наука. А смещение логов из модуля 18 — это первый оборот той самой петли, которая здесь раскрутилась до пузыря.
Практическая часть¶
Часть 1. Работа с ноутбуком¶
Откройте notebooks/19-feedback-loops-and-attention.ipynb. Только numpy и matplotlib, вычисления занимают секунды.
Что содержится внутри:
- Пузырь фильтров: петля усиливает цепляющее содержимое, разнообразие (энтропия) обваливается по раундам. Добавление исследования его удерживает.
- Богатый богатеет: малое случайное преимущество товара компаундируется в полное доминирование. Концентрация растёт — эффект Матфея.
- Вовлечение против пользы: петля максимизирует вовлечение (прокси), а охват настоящих интересов пользователя проходит пик и начинает падать — закон Гудхарта внутри петли.
Часть 2. Собственная лента¶
Возьмите любую ленту, которой вы пользуетесь.
- Что она оптимизирует — и как вы это определили по тому, что она показывает?
- Заметен ли пузырь: сузился ли ваш поток за последние месяцы?
- Где в ленте видно, что вовлечение — это прокси, а не польза?
- Что разомкнуло бы петлю, не разрушив рекомендации полностью?
Задание¶
- Смоделируйте петлю: показ → вовлечение → пересчёт показа. Постройте энтропию ленты по раундам с исследованием и без. Найдите значение \(\varepsilon\), при котором пузырь перестаёт схлопываться.
- Смоделируйте эффект Матфея: товары стартуют практически равными, но вовлечение усиливает лидеров. Постройте коэффициент Джини по раундам.
- Разведите вовлечение и настоящий интерес пользователя как две отдельные величины. Покажите, что петля увеличивает первое и снижает второе.
- Добавьте разнообразие в целевую функцию и покажите, чем расплачивается вовлечение за размыкание пузыря.
- Опишите одно реальное последствие петли обратной связи в формате модуля 1: что оптимизировали, что подразумевали, где щель.
Проверка усвоения¶
- Что такое петля обратной связи и почему она подтверждает собственные решения?
- Каким образом из петли формируется пузырь фильтров и чем его размыкают?
- Почему вовлечение — это прокси, и с каким модулем это рифмуется?
- Назовите два значения слова «внимание» в курсе и что у них общего.
- В чём заключается психологическая цена оптимизации вовлечения и кто её оплачивает?
- Что такое эффект Матфея в рекомендациях?
- Почему система, максимизирующая вовлечение, работает против намерения пользователя?
Что дальше¶
В модуле 20 — как вообще установить, что рекомендатель действительно что-то улучшил, а не просто раскрутил петлю: A/B-тесты и причинность. Корреляция против причины, рандомизация, подглядывание в промежуточные результаты и множественные сравнения — тот же арсенал модуля 1, но теперь применённый к эксперименту на живых пользователях.
Петля обратной связи обучает систему на данных, которые она сама создала, и превращает вовлечение — прокси внимания — в пузырь. Внимание человека конечно, и лента, оптимизированная на удержание, работает против него по самому своему устройству.
Принцип
Система, которой задали вовлечение как награду, найдёт в человеке те же щели, что агент нашёл в симуляции. Разница в том, что цена ошибки здесь измеряется не в игровых очках, а в часах чужой жизни.