5.1. Обучение и эволюция
Исследование ограниченно рационального процесса приспособления к равновесию по Нэшу стало полем активных исследований последних лет. Появляющуюся литературу можно весьма условно разделить на две категории: обучение и эволюцию. В литературе по обучению обычно предполагается, что игроки могут вычислить наилучший ответ и проверить, как игроки совершенствуют свои представления о стратегиях своих оппонентов в фиксированном «матче».
Напротив, эволюционный подход не предполагает обязательную способность оптимизировать и анализирует эволюцию поведения через пробы и ошибки и естественный отбор в популяции игроков.Как мы уже отмечали, хотя равновесный анализ доминирует в исследованиях стратегических игр, очень многих не удовлетворяет и беспокоит предположение о том, что игроки немедленно и безошибочно идентифицируют и играют определенный набор равновесных стратегий. Изучение процесса обучения является альтернативным и в некотором смысле дополняющим подходом к анализу поведения в играх. Типичный анализ рассматривает игру, разыгрываемую «повторно» (неоднократно), и постулирует некоторые специфические правила, в соответствии с которыми игроки формируют ожидания, касающиеся того, каким будет текущий выбор игроков как функция предыдущих розыгрышей. Далее предполагается, что игроки пытаются максимизировать свои текущие
выигрыши при данных ожиданиях; это определяет динамический процесс, порождающий последовательность розыгрышей, и анализ концентрируется на изучении поведения этой последовательности. Сходится ли такая последовательность розыгрышей? Если да, то приводит ли этот подход к поведению, предсказываемому равновесным анализом?
Этот подход столь же почтенен, как и сам равновесный анализ: исследование Курно дуополии (Cournot, 1838), по существу, «явило миру» и равновесие по Нэшу, и специфический процесс обучения (см. раздел 1.9). Курно исходил из того, что в каждом «раунде» каждая фирма выбирает объемы производства, которые максимизируют ее прибыль в предположении («гипотеза Курно»), что конкурент продолжает выпускать тот же объем продукции, что и в предыдущем раунде. Называемая теперь «динамикой лучшего ответа», эта динамика до сих пор привлекает внимание как одна из моделей обучения в играх (Bernheim, 1984; Moulin, 1986). В то же время представляется неразумным предполагать, что реальные фирмы будут вести себя таким специфическим образом, как это описано у Курно. Это относится к ситуации, когда динамика лучшего ответа приводит к несходящемуся, циклическому поведению, что может случиться при некоторых специфических функциях затрат и спроса.
Циклы — это не единственная проблема, возникающая в моделях обучения.
Например, Фуденберг и Крепе показали, что модели типа стационарного Байесова обучения, в соответствии с которым игроки анализируют прошлые наблюдения, как если бы поведение их конкурентов было стационарным, порождают такую последовательность, которая может сходиться, но к набору стратегий, отличному от любого совершенного равновесия (Fudenberg, Kreps, 1988).В действительности «рациональность» каждого процесса обучения ситуативна: алгоритм, ведущий себя хорошо в некоторых ситуациях, может в других ситуациях работать скверно. Другим важным аспектом существующих моделей обуче- ния является то, что они, по сути дела, «вынуждают» игроков не быть «искушенными», то есть игроки могут использовать только информацию о прошлой игре, не придавая никакого значения информации относительно информации конкурентов, выигрышей, рациональности. Подход, основанный на равновесии по Нэшу или рационализуемости, напротив, придает значение только информации о выигрышах. Реальные же игроки часто используют оба типа информации.
Обратимся к играм двух лиц. Естественной точкой отсчета можно считать двух игроков, разыгрывающих игру повторяющимся образом и пытающихся предсказать игру соперника, исходя из предшествующей игры. Такую модель можно назвать моделью с фиксированными игроками (мы следуем здесь Fudenberg, Levine, 1998). В подобного рода ситуации игроки должны рассматривать не только то, каким образом будет играть в будущем оппонент, но также возможность того, что их собственная игра будет влиять на будущую игру оппонента. Например, игроки могут думать, что если они «ведут себя хорошо», то будут вознаграждены «хорошим поведением» оппонентов в будущем, или что они могут «научить» своих оппонентов играть лучший ответ на определенное действие, разыгрывая его снова и снова.
Рассмотрим следующую игру (рис. 1.):
L R и / (1,0) (3,2) \ d ^ (2,1) (4,0) )
Рис. 1.
Практически во всех моделях обучения игрок 1, игнорирующий повторяющееся разыгрывание, будет играть d, поскольку d — доминирующая стратегия, а потому максимизирует текущий ожидаемый выигрыш первого игрока при любых представлениях относительно оппонентов.
Если, а это представляется правдоподобным, игрок 2 в конце концов«выучит», что игрок 1 играет d, то система сойдется к (d, L) , причем выигрыш игрока 1 будет 2. Но если игрок 1 терпелив и знает, что второй «наивно» выбирает в каждом периоде ход, максимизирующий выигрыш в этом периоде при условии прогнозирования вторым игроком хода первого игрока, то игрок 1 может добиться большего, всегда играя и, что в конце концов «вынудит» второго играть R, давая первому игроку 3.
Теория обучения, как правило, абстрагируется от такого рода рассмотрений, экплицитно или имплицитно опираясь на модель, в которой стимул к попытке изменить будущую игру оппонентов слишком мал. Один класс моделей этого типа — это тот, в котором игроки ограничены в своем выборе41, а дисконтирующие множители малы в сравнении с максимальной скоростью, с которой система может приспосабливаться. Второй класс моделей — это модели с большим числом игроков, взаимодействующих относительно анонимно, причем размер популяции (игроков) велик по сравнению с множителем дисконтирования.
Мы можем погрузить игру двух (или п) лиц в такую «обстановку», уточняя механизм, в соответствии с которым пары игроков из популяции выбираются для разыгрывания этой игры. Здесь есть целый ряд моделей.
Модель с одной парой. В каждом периоде одна пара игроков выбирается случайным образом для разыгрывания игры. В конце раунда ходы игроков становятся известными всем. Здесь, если популяция велика, то, скорее всего, игроки, играющие сегодня, долгое время будут оставаться неактивными. Даже для терпеливых игроков не будет целесообразным жертвовать текущим выигрышем, чтобы повлиять на будущую игру оппонентов, если размер популяции достаточно велик в сравнении с дисконтирующим множителем. Совокупная статистическая модель. В каждом периоде все игроки случайным образом разбиваются на пары. В конце раунда объявляется совокупный выигрыш популяции. Если популяция велика, каждый игрок незначительно влияет на выигрыш популяции, а следовательно, мало влияет на будущую игру. Игрокам нет смысла отклоняться от близорукого поведения.
Модель случайного выбора пар. В каждом периоде все игроки случайным образом разбиваются на пары. В конце раунда каждый игрок наблюдает только исход своего собственного матча. То, как игрок играет сегодня, будет влиять на то, как его оппонент будет играть завтра, но маловероятно, чтобы игрок снова попал в пару к своему текущему оппоненту или кому-то, кто играл с текущим оппонентом. Снова близорукая игра «почти» оптимальна в конечной, но большой по сравнению с дисконтирующим множителем, популяции. Этот подход наиболее часто используется в теоретико-игровых экспериментах.
С технической точки зрения есть два типа обычно используемых моделей больших популяций — конечные популяции и континуальные популяции. Важный модельный момент связан с тем, каким образом популяции, из которых выбираются игроки, соотносятся с числом «игровых ролей» в игре. Можно различать агента в игре, соответствующего определенной роли игрока, и действительного игрока, принимающего на себя роль агента в конкретном матче. Если игра симметрична, то можно считать, что есть одна популяция, из которой выбираются два агента. В этом случае говорят об однородной популяции. С другой стороны, мы можем считать, что каждый агент выбирается из отдельной популяции. В этом случае говорят об асимметричной популяции.
В симметричной игре, в дополнение к крайним случаям однородных и неоднородных популяций, можно также рассматривать смесь этих двух случаев, когда каждый игрок имеет какие-то шансы встретиться в матче с оппонентом из другой
популяции и какие-то шансы — с оппонентом из той же популяции.
Мы остановимся сейчас (весьма кратко) на одном специфическом процессе динамического приспособления — так называемом фиктивном разыгрывании, полностью основанном на идее обучения, а затем перейдем к модели, основанной на идее эволюции.
В процессе фиктивного разыгрывания агенты ведут себя так, как будто они считают, что они сталкиваются со стационарным, но неизвестным распределением на множестве стратегий агентов.
Итак, предположим, что мы имеем бескоалиционную игру {{1, 2}, {Si, S2} , {ui, и2}} ? Модель фиктивного разыгрывания предполагает, что игроки выбирают свои ходы в каждом периоде из условия максимизации ожидаемого выигрыша в этом периоде при данной их оценке распределения действий оппонента в этом периоде, причем эта оценка имеет следующий специальный вид: у игрока i есть экзогенно заданная начальная функция весов кг0 : S_; —> IR+ . Эти веса модифицируются путем добавления 1 каждой стратегии оппонента каждый раз, как только эта стратегия играется, то есть
k\(8-i) = kUs-i) + \1' еСЛИ5-"1=^'
[0, в противном случае.
Вероятность того, что игрок i предсказывает оппоненту игру s_i в момент t, есть
ft(s_i) = .
kt(s-i)
Фиктивное разыгрывание — это правило p\{lt) 1 так что Ptilt) ? BR(yl) (здесь BR — best response). Важно заметить, что такое правило может быть не единственным, поскольку может существовать более одного лучшего ответа на каждую оценку. Ключевой вопрос, возникающий здесь, состоит в том, сходится ли такой процесс.
Состояние процесса фиктивного разыгрывания есть вектор оценок игроков, а не стратегии, играемые в период t, поскольку их хватает для определения будущей эволюции системы. Тем не менее, несколько пренебрегая формальностями терминологии, будем говорить, что набор стратегий является устойчивым состоянием, если он играется в каждом периоде начиная с некоторого конечного момента времени Т.
Предложение 5.1.1. (Fudenberg, Kreps, 1990). 1) Если s — строгое равновесие по Нэшу42 и s играется в момент t в процессе фиктивного разыгрывания, то s будет играться далее всегда. 2) Любое устойчивое состояние фиктивного разыгрывания в чистых стратегиях должно быть равновесием по Нэшу.
Упомянем здесь еще один вариант фиктивного разыгрывания. Милгром и Роберте (Milgrom, Roberts, 1991) рассматривают адаптивное обучение. Прогноз (относительно выбора стратегий оппонентом) называется адаптивным, если этот прогноз приписывает очень малую вероятность любой стратегии оппонента, которая не игралась длительное время. Формально прогноз адаптивен, если для любого е > 0 и любого t существует T(e,t) такой, что для любого t' > T(e,t) и любой истории до момента t', прогноз у\ приписывает вероятность не больше е множеству чистых стратегий оппонента игрока i, которые не игрались между моментами tut'. Для адаптивного прогноза сохраняется второе утверждение предложения 5.1: если прогнозы адаптивны и разыгрывание сходится к набору чистых стратегий, то этот набор должен быть равновесием по Нэшу.
Перейдем теперь от моделей, базирующихся на обучении к моделям, связанным с идеей эволюции.
Основная идея эволюционного подхода состоит в том, что агенты могут не оптимизировать сознательно, но вести себя так, как если бы они были рациональны, поскольку (экономическая) конкуренция отберет оптимизирующих агентов.
Существенным толчком к исследованию таких процессов послужила биология. Мейнард Смит и Прайс (Maynard Smith, Price, 1973) ввели понятие эволюционно устойчивой стратегии и пришли к выводу о том, что наблюдаемые черты поведения животных и растений можно объяснить с помощью равновесия по Нэшу в соответствующим образом определенной игре. Идея состоит в том, что комбинация естественного отбора и мутации приводит популяцию к эволюционно устойчивому состоянию в длительном периоде. Эта точка зрения была подтверждена многочисленными полевыми исследованиями. Здесь «как если бы» — это вполне реальное описание действительности. Вдохновленные успехом биологии, многие экономисты включились в активные исследования эволюционной теории игр. Почему же эволюционная теория привлекает такое внимание?
Только после глубоких и длительных исследований теория игр прояснила, что значит рациональность в стратегических ситуациях и каковы ее последствия. Рациональность сама по себе не оправдывает равновесие по Нэшу, и нужно искать что- то другое, что объясняло бы равновесное поведение.
Кроме того, необходимость равновесного отбора, которая стала доминирующей темой в многочисленных приложениях теории игр к многообразию конкретных задач, это то, чего предшествующая литература по динамике приспособления не учитывала.
Еще по теме 5.1. Обучение и эволюция:
- Обучение по контракту
- Особенности обучения менеджменту
- Обучение новых работников
- Счет за обучение
- Качество обучения
- Качество обучения
- 26.9. Статистика профессионального обучения
- Существующие методы обучения
- Как фактор 3 влияет нахарактерпроцесса обучения?
- Оплата труда сотрудников, совмещающих работу с обучением
- Обучение
- Методы обучения — наставничество, тренинг
- Обучение и совершенствование
- Формы и содержание процесса обучения менеджера