Случайные вознаграждения обогащают классические идеи теории игр.
Игры могут быть жизнью без всех её сложностей, но они позволяют изучать, почему люди делают тот или иной выбор. Традиционные игры обычно проводятся на статичном фоне: вознаграждение за каждый результат постоянно. Это ограничивает их применимость к поведению, поскольку в реальной жизни вознаграждение и последствия стратегических решений постоянно меняются. Теперь исследователи использовали математическую модель для изучения серии игр, включающих развивающиеся стратегии и случайные изменения результатов.

Немного истории
Пожалуй, самым известным примером из области теории игр является дилемма заключенного. В этой дилемме двое воров были задержаны и по отдельности допрашиваются полицией. Если оба замолчат, их накажут за менее тяжкое преступление. Если один из заключенных заключит сделку (перебежит), то он выйдет на свободу, а другой получит более суровое наказание. Если оба заключат сделку, то оба получат промежуточное наказание.
Ведущий игры может начать её с различными вознаграждениями за сотрудничество и предательство, чтобы исследовать, как оптимальная стратегия меняется в зависимости от вознаграждения и риска, что игроки могут определить, варьируя стратегии в течение нескольких раундов. В зависимости от баланса между вознаграждением за молчание (сотрудничество) и предательство, игра стабилизируется, и все предают всех. В этой простой ситуации проигрывают все.
Подобная динамика наблюдается в таких играх, как «Кто хочет перекусить», «Камень-ножницы-бумага» и многих других. Эволюция стратегий может приводить к стабильным популяциям, бистабильным популяциям (когда популяция переключается между двумя стабильными стратегиями) или предельным циклам, когда популяция непрерывно переходит между несколькими стратегиями.
Существует также богатая история изменений, происходящих в процессе игры. Обычно это внутриигровые вариации. Например, можно установить ограничение на количество доступного вознаграждения, поэтому стратегии развиваются, учитывая все более ограниченные ресурсы по мере увеличения количества раундов. Другими словами, большая часть этих более ранних работ изучала ситуации, когда поведение игрока в текущем раунде изменяло ресурсы или вознаграждения, доступные в следующем раунде.
Ваше влияние ограничено.
В реальной жизни, однако, нами управляют внешние факторы, которые от нас не зависят. Кролик не контролирует дождь, затопляющий его нору, или засуху, уничтожающую его пищу. Игра меняется в каждом раунде, потому что риски и выгоды каждой стратегии меняются со временем. Исследователи поняли, что включение этой динамики в математическую модель может выявить новые модели поведения. И они не ошиблись.
Дилемма заключенного, описанная выше, имеет только одну устойчивую точку (все проигрывают). Модель быстро сходится к этой точке, где все игроки в течение нескольких раундов принимают одну и ту же стратегию. Но в новой работе было обнаружено, что если вознаграждения меняются со временем (даже незначительно), то из модели появляется вторая устойчивая точка, позволяющая сосуществовать как сотрудничающим, так и дезертирам. При еще больших изменениях точка дезертирства становится неустойчивой, что означает существование только сотрудничающих.
В случае с «курицей» результаты модели немного пугают: при отсутствии изменений в вознаграждениях стабильной точкой является то, что все сворачивают с пути, и мы все выживаем. Добавьте лишь немного вариаций, и появится популяция, которая не сворачивает с пути. Добавьте больше шума, и появится бистабильное переключение между выживанием и крахом. (Учитывая, что «курица» была, по сути, стратегией холодной войны, я еще больше поражен тем, что мы все выжили, чтобы столкнуться со следующим экзистенциальным вызовом.)
В случае с игрой «камень-ножницы-бумага» возникает еще более сложная динамика. С точки зрения стабильных и нестабильных точек, в обычной игре «камень-ножницы-бумага» стабильных точек нет — стратегия никогда не устанавливается таким образом, чтобы все выбирали, например, камень. Вместо этого все постоянно переворачивают один из трех вариантов. Однако если награды меняются случайным образом в каждом раунде, возникают новые стабильные и нестабильные точки. В зависимости от случая это может привести к более быстрому развитию стратегии переворачивания или к формированию предельного цикла. Предельные циклы возникают, если награды неравномерны (например, игра «камень против ножниц» дает победителю больший выигрыш, чем игра «бумага против камня»). В этом случае популяция постоянно циклически меняется, а вероятность выбора «камень против бумаги против ножниц» предсказуемо и стабильно изменяется со временем.
Из всех этих рассуждений об играх следует вывод, что, хотя поведенческие тенденции игроков могут влиять на игру, изменяющаяся игровая среда может оказать огромное влияние на оптимальную стратегию.
Жизнь раскрывается через простые правила.
Если рассматривать дилемму заключенного как классический инструмент теории игр, то можно прийти к печальному выводу: сотрудничество — проигрышная стратегия. Однако даже в условиях, заданных дилеммой заключенного, мы наблюдаем сотрудничество. Почему? Потому что на вознаграждение влияют внешние факторы — заключенный, который предает свои принципы и выходит на свободу, вполне может подвергнуться преследованию при несколько иных обстоятельствах, а не при других. Следовательно, вероятно, возникнет более сложная комбинация стратегий.
Однако всё же было удивительно увидеть, что относительно небольшое изменение в структуре вознаграждения может привести к таким сильным изменениям в поведении.
Модели теории игр также часто используются для понимания экономического поведения. Я всегда скептически (возможно, даже чрезмерно скептически) относился к выводам, полученным из этих игр, и думаю, что эта статья ясно показывает, почему я не доверяю этим моделям. Но результаты, представленные здесь, также указывают путь вперед, где более сложная динамика, которую мы наблюдаем в реальной жизни, воспроизводится в играх, которые все еще достаточно просты.





















0 комментариев