Мозг не реагирует на награду. Он реагирует на то, что ты ошибся в прогнозе
Одно из самых воспроизводимых открытий в нейронауке последних тридцати лет звучит контринтуитивно: дофаминовые нейроны почти не реагируют на саму награду. Они реагируют на разницу между тем, что ты ожидал, и тем, что получил.
Эксперимент, который изменил всё
Классические записи активности дофаминовых нейронов у обезьян, сделанные Вольфрамом Шульцем в 1990-х, показали закономерность, которую сначала приняли за артефакт. Когда награда (капля сока) появлялась неожиданно — дофаминовые нейроны давали яркий всплеск активности. Когда обезьяна уже научилась, что перед соком всегда загорается определённый сигнал, всплеск смещался на сам сигнал, а не на награду — к моменту, когда сок реально появлялся, нейроны уже почти не реагировали, потому что событие стало полностью предсказуемым. А если сигнал прозвучал, но награда не пришла — происходило нечто третье: активность дофаминовых нейронов резко падала ниже базового уровня, ровно в тот момент, когда награда должна была появиться, но не появилась.
Это и есть сигнал ошибки предсказания награды (reward prediction error, RPE): дофаминовый нейрон каждую миллисекунду вычисляет не «сколько награды», а «на сколько реальность отличается от прогноза», и передаёт именно эту разницу.
Почему это не просто красивая находка
Дело в том, что этот сигнал идеально совпадает с математической конструкцией из совершенно другой области — обучения с подкреплением (reinforcement learning), где системы учатся методом временных различий (temporal difference learning). Питер Дайан, Рид Монтегю и Вольфрам Шульц показали в 1997 году, что активность дофаминовых нейронов количественно ведёт себя ровно так, как предсказывает эта математическая модель. Это редкий случай в нейронауке, когда абстрактная вычислительная теория и реальная физиология клетки совпали почти идеально — не примерно похоже, а именно количественно, с конкретными числами. Байер и Глимчер в 2005 году уточнили это ещё точнее, показав, что сигнал не просто похож на ошибку предсказания, а является её количественным, линейным отражением.
Что это значит для записи весов
Именно эта разница, а не абсолютная величина награды, и есть тот сигнал, который физически укрепляет или ослабляет синапсы в системе, о которой шла речь в предыдущей статье. Если событие оказалось лучше ожидаемого — синапс, который к этому привёл, укрепляется. Если хуже — ослабляется. Если ровно как ожидалось — почти ничего не меняется, потому что мозгу нечему учиться: прогноз и так был верным.
Почему это объясняет привыкание к хорошему
Отсюда прямо следует эффект, знакомый каждому: одно и то же действие со временем перестаёт «радовать» так, как в первый раз — не потому что вкус изменился, а потому что прогноз мозга подтянулся к реальности, и ошибка предсказания стремится к нулю. Дофаминовый отклик даёт не сам факт хорошего события, а именно его неожиданность. Это же объясняет, почему нерегулярное, непредсказуемое подкрепление (переменный график вознаграждения) закрепляет поведение сильнее и устойчивее, чем стабильная, ожидаемая награда каждый раз — ошибка предсказания в первом случае просто не успевает упасть до нуля.
Практический вывод
Если хочешь, чтобы мозг записал что-то как ценное, важна не столько абсолютная величина результата, сколько момент, в который результат оказался лучше, чем ты рассчитывал. Заниженные ожидания перед маленьким шагом — не самообман, а буквально способ гарантировать положительную ошибку предсказания там, где высокая планка её съедала бы заранее.
Источники
Schultz, W., Dayan, P., & Montague, P. R. (1997). A neural substrate of prediction and reward. Science, 275(5306), 1593–1599.
Bayer, H. M., & Glimcher, P. W. (2005). Midbrain dopamine neurons encode a quantitative reward prediction error signal. Neuron, 47(1), 129–141.
Schultz, W. (1998). Predictive reward signal of dopamine neurons. Journal of Neurophysiology, 80(1), 1–27.