Дофаминовые нейроны и ошибка предсказания награды¶
Дофаминовые нейроны среднего мозга у макаки разряжаются по схеме, похожей на ошибку временных разностей. Сходство настолько близкое, что алгоритм, опубликованный в 1988 году, в общих чертах предсказал, что электрод запишет в 1997-м. Поэтому результат важен — и поэтому же его переоценивают: яркое совпадение теории и замера подталкивает читателя их отождествить, а бо́льшая часть последующих работ занята тем, почему отождествлять их нельзя.
Этот разбор о том, что установили записи 1997 года, что они оставили открытым и какие более поздние результаты действительно двигают вывод, а не украшают его.
Алгоритм появился раньше¶
Обучение временных разностей не выведено из нейронауки. Саттон предложил его для чисто вычислительной задачи: как научиться предсказывать отложенный исход, не дожидаясь этого исхода каждый раз.
Постановка такая. Агент движется по состояниям и держит оценку V(s) — сколько
суммарной будущей награды доступно из состояния s. На каждом шаге он видит
непосредственную награду r и следующее состояние s′ и составляет ошибку
где γ дисконтирует будущую награду. Слагаемое r + γV(s′) — свежая оценка
того, сколько стоило состояние s: один шаг реального опыта плюс текущая догадка
обо всём, что после. V(s) — старая оценка. Их разность и есть неожиданность, и
алгоритм сдвигает V(s) к свежей оценке пропорционально ей.
Дальше важны три свойства δ, и все три следуют из определения, а не
приделаны сверху:
Положительна при неожиданной награде. Если награда пришла там, где её не
предсказывали, r велико, а V(s) нет, значит δ положительна.
Обнуляется, когда предсказание точное. Когда V обучилась, свежая оценка
совпадает со старой и разность исчезает. Идеально предсказанная награда не даёт
никакой ошибки: сигнал про непредсказанную часть, а не про награду.
Смещается назад во времени. Когда сигнал надёжно предшествует награде,
ценность самого сигнала растёт, и ошибка появляется на сигнале, а не на награде.
Это не отдельное правило: так работает γV(s′), переносящий ценность на шаг
назад при каждом посещении.
Что показали записи¶
Шульц, Даян и Монтегю записывали одиночные нейроны среднего мозга у обезьян, обучающихся условным задачам, и описали три схемы.
Непредсказанная награда даёт всплеск. Сок, поданный без предупреждения, вызывает короткое резкое повышение частоты разрядов над базовой линией.
Когда сигнал начинает предсказывать награду, всплеск переходит на сигнал. После обучения тот же сок в ожидаемый момент не даёт ничего. Всплеск переехал на самый ранний надёжный предсказатель.
Пропущенная награда даёт провал. Если сигнал был, а награды нет, частота падает ниже базовой линии — причём падает в тот момент, когда награда должна была прийти, а не в конце пробы.
Составьте это с тремя свойствами выше — совпадение идёт один в один, включая
деталь, которую труднее всего получить случайно: момент провала. У нейрона,
который просто сообщает «случилось что-то хорошее», нет причин делать хоть что-то
в момент, когда не случилось ничего. У нейрона, сообщающего δ, причина есть: в
этот момент V(s) предсказывает награду, а наблюдение это опровергает.
Что отсюда следует, а что нет¶
Соответствие — сильное свидетельство того, что дофамин несёт информацию, похожую на ошибку предсказания. Оно не является свидетельством того, что дофамин и есть эта ошибка, и расстояние между этими двумя утверждениями — то место, где живут все последующие работы.
Исходный дизайн корреляционный¶
Нейроны записывают, пока животное учится. Ничего не воздействуют, поэтому дизайн
не отличает сигнал, который управляет обучением, от сигнала, который его лишь
сопровождает. Сигнал, скоррелированный с δ, согласуется и с тем, что дофамин
транслирует обучающий сигнал, и с тем, что дофамин сообщает нечто с ним
скоррелированное.
Этот разрыв закрыли позже, и стоит быть точным в том, как именно: это шаг, который повышает статус утверждения, а не повторяет его.
Стейнберг с соавторами использовали парадигму блокировки. При блокировке
второй сигнал, введённый рядом с уже предсказывающим первым, обычно не
выучивается: первый уже предсказывает исход, поэтому ошибки, способной чему-то
научить, не остаётся. Объяснение блокировки в теории ровно такое — δ равна
нулю.
Дальше они оптогенетически активировали дофаминовые нейроны в момент награды,
ровно там, где по теории ошибка должна быть нулевой, — и животные всё равно
выучили заблокированный сигнал. Искусственная δ, вставленная туда, где её не
было, произвела обучение, которое произвела бы настоящая.
Это причинный результат, и проверка тоньше, чем кажется сначала: воздействие не делает животное вообще внимательнее и не делает награду приятнее. Оно подаёт одну конкретную величину в один конкретный момент, а следующее за этим поведение — именно то, которое предсказывает уравнение.
Популяцию считают одним сигналом¶
Изложение 1997 года говорит о дофаминовых нейронах так, будто они сообщают один скаляр, широко разосланный по мозгу. Две более поздние работы усложняют это, и в разные стороны.
Что меняет прочтение¶
Популяция неоднородна¶
Мацумото и Хикосака нашли две группы дофаминовых нейронов, которые ведут себя по-разному и расположены в разных местах.
Одна группа возбуждается на сигналы, предсказывающие награду, и тормозится на аверсивные — то самое кодирование ценности, которого ждёт объяснение через ошибку предсказания. Вторая возбуждается и на приятные, и на аверсивные события, а это уже не ценность вовсе. Это ближе к значимости: «происходит нечто важное» — независимо от знака.
Группы разделимы анатомически: кодирующие ценность сосредоточены более вентромедиально, похожие на значимость — более дорсолатерально.
Исходный результат это не отменяет: группа, кодирующая ценность, ведёт себя как описано. Отменяется другое — право говорить про тот самый дофаминовый сигнал. Как минимум одна крупная популяция занята чем-то другим, и эксперимент, который берёт нейроны среднего мозга без учёта места записи, усреднит обе и выдаст смесь за одну величину.
Разброс — не шум¶
Дабни с соавторами задались вопросом, что означает разброс между дофаминовыми нейронами. При скалярном объяснении отдельные нейроны — зашумлённые копии одной величины, а различия между ними суть ошибка измерения, которую надо усреднить.
Распределённое объяснение говорит иначе. Нейроны систематически различаются тем, насколько асимметрично относятся к положительным и отрицательным ошибкам: одни усиливают положительную неожиданность относительно отрицательной, другие наоборот. Нейрон с такой асимметрией сходится не к среднему будущей награды. Он сходится к квантили распределения награды, а к какой именно — задаётся тем, насколько сильно он взвешивает каждое направление.
Значит, популяция с разбросом асимметрий кодирует разброс квантилей — то есть представление всего распределения будущей награды, а не его среднего. В работе приводится и асимметрия по записанным нейронам, и декодирование получающегося из неё распределения.
При таком прочтении в 1997 году записали среднее популяционного кода и назвали это среднее кодом. Исходное наблюдение уцелело; сузилось то, свидетельством чего оно является.
Нарастание остаётся неудобным¶
Хоу с соавторами измеряли дофамин в стриатуме методом быстросканирующей циклической вольтамперометрии, пока крысы бежали лабиринт за наградой, и нашли медленные нарастания: дофамин плавно рос по мере приближения к цели, на масштабе секунд.
Чистая ошибка предсказания так вести себя не должна. Когда путь выучен, каждый шаг предсказан, и ошибка должна держаться около нуля на всём протяжении. Сигнал, который ровно растёт с приближением, похож скорее на саму ценность, чем на ошибку о ценности.
Согласования предлагались: нарастание как производная функции ценности при определённых допущениях о представлении состояния и дисконтировании, либо как отдельный сигнал, который тот же переносчик несёт на более медленном масштабе. Здесь важно другое: нарастание — это замер, находящийся в напряжении с простой версией истории, сделанный другим методом на другом масштабе, и переформулировкой теории он не растворился.
Что изменит этот разбор¶
Демонстрация того, что популяции ценности и значимости разделимы по своим мишеням, а не только по месту записи, заметно ужесточила бы картину: она превратила бы анатомическую корреляцию в утверждение о том, для чего каждый сигнал.
Результат, показывающий, что описанная Дабни асимметрия — артефакт записи или процедуры подгонки, вернул бы популяцию к скалярному коду и отменил бы этот раздел целиком.
Объяснение нарастания, которое предсказывает новые замеры, а не подгоняется под существующие, закрыло бы незакрытый конец, который разбор пока обязан оставить.
Почему это лежит в репозитории по машинному обучению¶
Влияние идёт в обе стороны, и легко перепутать, в какую именно оно идёт сейчас.
Обучение временных разностей не копировали с мозга. Оно выросло из работ Саттона о предсказании, а биология пришла позже как подтверждение. Распределённое RL повторило тот же порядок: алгоритмическая идея, развитая по внутренним причинам обучения с подкреплением, затем поиск нейронного следа, который затем нашли.
Поэтому честная формулировка уже той, что в ходу, — и интереснее именно тем, что уже. Обучение с подкреплением не выучило свои алгоритмы, глядя на мозг. Оно произвело теории, достаточно точные, чтобы мозгом можно было их проверить. Это труднее и это лучшая причина, чтобы ими интересоваться.
Связи¶
Пока никаких. Разбор распределённого RL как алгоритма — квантильная регрессия, асимметричная функция потерь, дающая эффект, и что предсказание распределения даёт сверх предсказания среднего — просится рядом с этим и позволил бы здесь перестать объяснять алгоритмическую половину мимоходом.