Дофаминовые нейроны и ошибка предсказания награды¶
Дофаминовые нейроны среднего мозга у макаки разряжаются по схеме, похожей на ошибку временных разностей. Соответствие настолько близкое, что алгоритм, написанный в 1988 году, предсказал, что электрод запишет в 1997-м. Поэтому результат важен — и поэтому же его переоценивают.
Что утверждает статья¶
Шульц, Даян и Монтегю описывают три схемы разряда дофаминовых нейронов у обезьян, обучающихся условной задаче:
- Неожиданная награда даёт всплеск.
- Когда сигнал начинает надёжно предсказывать награду, всплеск переходит на сигнал, а сама выдача награды не даёт ничего.
- Ожидаемая награда, которую не выдали, даёт провал ниже базовой линии, точно в тот момент, когда награда должна была прийти.
Это ровно знаки ошибки δ = r + γV(s′) − V(s): положительная при неожиданности, нулевая при предсказанном, отрицательная при пропуске. Утверждение статьи в том, что дофамин транслирует эту ошибку и что нижележащие структуры учатся именно на ней.
Что показывают данные¶
Записи подтверждают форму соответствия: знак и момент меняются так, как требует теория. Это сильный результат, и он многократно воспроизведён.
Чего записи не устанавливают — так это равенства. Сигнал, ведущий себя как ошибка предсказания в этих условиях, согласуется с тем, что дофамин её несёт; но не исключает, что он несёт нечто с ней скоррелированное. Различие сохраняется, потому что воздействия здесь корреляционные: нейроны записывают во время обучения, а не выключают, чтобы посмотреть, каким обучение станет без них.
Что изменит прочтение¶
Две более поздние работы уже изменили.
Дофаминовые нейроны — не одна популяция. Мацумото и Хикосака нашли нейроны, возбуждающиеся и на аверсивные стимулы тоже, анатомически отделённые от тех, что кодируют ценность. Один скалярный обучающий сигнал не объясняет обе группы; как минимум одна из них кодирует что-то ближе к значимости, чем к ценности.
Разброс — не шум. Дабни с соавторами показали, что дофаминовые нейроны систематически различаются по тому, насколько оптимистично или пессимистично они отвечают, и что разброс по популяции кодирует распределение будущей награды, а не её среднее. При таком прочтении в 1997 году записали среднее популяционного кода и назвали его кодом.
Ни то, ни другое не отменяет исходного наблюдения. Оба меняют, свидетельством чего оно является: находка в том, что дофамин несёт информацию, похожую на ошибку предсказания, а не в том, что дофамин и есть эта ошибка.
Почему это лежит в репозитории по машинному обучению¶
Влияние идёт в обе стороны, и легко перепутать, в какую именно оно идёт сейчас. Обучение временных разностей выведено не из нейронауки: оно выросло из работ Саттона о предсказании, а биология пришла позже как подтверждение. Распределённое RL повторило тот же порядок — сначала алгоритмическая идея, потом найденный нейронный след.
Поэтому честная формулировка уже той, что в ходу. Обучение с подкреплением не копировало мозг. Оно дало теорию, достаточно точную, чтобы её можно было проверить на мозге.
Связи¶
Пока никаких. Когда появится разбор распределённого RL как алгоритма, а не как находки, его место здесь.