4.3.2. Сравнение, подгонка и идентификация моделей
р(5, §є=?>, (4.43)
т. е. вместо поиска S, удовлетворяющей условию (4.34), рассматривалась задача (4.40) — задача подгонки модели под эмпирические данные. Эта подмена задач — подгонка вместо идентификации — и вынуждает решать задачу проверки, сравнения моделей.
Задача идентификации может быть решена, если все Xt — конечные множества. Зарегистрировав все допустимые, т. е. удовлетворяющие (4.33), значения переменных Xt, можно получить информацию о множестве S', если просмотрены все значения переменных, то будет просто
[ s = s*.
Простейший пример — это идентификация модели в множестве допустимых моделей, которое состоит из всех матриц вида \\Ьи\:
1, если предприятие і поставляет продукцию предприятию /';
0, в противном случае.
Матрица || btj || — описание хозяйственных связей между промышленными предприятиями; индексы і и / пробегают примерно 43 тысячи значений. Положим в (4.33) п = N'2, где N —- количество предприятий, пронумеруем все элементы матрицы || Ьи\ по схеме
I = (І - 1 )N +-}, так что
і = entier {l/N) + 1,
] = I — N-entier {l\N)>
где entier {UN) — целая часть от деления I на N\ и, таким образом, каждому Ъц сопоставим переменную Хи которая принимает одно из двух значений: 0 или 1. Множество допустимых моделей D — все произведение Ц Xt;
і
его мощность 2n. Множество S состоит из одного элемента — истинной структуры хозяйственных связей.
Просмотрев все пары предприятий, получаем п оценкуS* = . ...., хп)},
где х* — зарегистрированное значение переменной Хг.
Далее, решаем задачу идентификации, просто положив
§ = S*.
Если ошибок регистрации нет, то S = S,
так как при отсутствии ошибок регистрации S* = S.
В данном случае задача идентификации полностью совпадает с задачей описания фактического положения дел. Но все становится значительно сложнее (в методологическом плане), если множество значений одной или нескольких переменных Xi бесконечно. Теперь по выборке конечного объема нельзя так просто идентифицировать модель. Ситуация значительно усложняется и в том случае, когда есть ошибки регистрации. Идентификация сводится к простому описанию, если только, и только если множество переменных и множества значений всех переменных конечны и нет ошибок регистрации. Мы можем, таким образом, дать определение довольно расплывчатому термину «описательная наука». Речь идет о науке, которая идентифицирует модели в конечном множестве допустимых моделей; множества переменных конечно, и все переменные принимают конечное множество значений, причем ошибки регистрации отсутствуют (или могут быть элиминированы). Описательными науками были: география во времена Великих географических открытий, астрономия во времена Коперника и Галилея. В экономической науке есть описательные фрагменты, вроде приведенного выше, которые играли и играют важную роль. Но вся экономическая наука описательной быть не может; точ- ность и надежность регистрации ограниченна, хотя бы даже все модели строились без использования переменных, принимающих бесконечное количество значений (эффективность таких моделей была бы крайне низкой в силу их громоздкости — в связи с этим замена инфинито- земальных описаний фреймами, хотя и любопытна, но, видимо, неосуществима).
Здесь необходимо сделать одно замечание. В любом случае существует тривиальное решение задачи идентификации. Дело в том, что на выбор множества допустимых моделей D трудно наложить разумные ограничения: но множество D можно, конечно, варьировать.
Тривиальная идентификация (в силу своей тривиальности не такая уж редкая) сводится к следующему. Регистрируются значения переменных модели Xt\ таким образом получается множество 5*. После этого определяется множество допустимых моделей D:D = {5*}, (4.44)
так как множество допустимых моделей состоит только из одного элемента S*, сразу имеем
S = S*.
Формально здесь нет никакой ошибки, но модель (теория) сводится к простой констатации фактов. Установление фактов может быть важным делом, но только если на основе этих факторов делаются выводы, строятся прогнозы, планы и т. д. Схема (4.44), напоминающая описательную науку, этого сделать не позволяет.
Схема (4.44) позволяет строить наилучшую подгонку относительно конкретных данных S*, но желательно, чтобы модель была бы валидной при разнообразных данных, в идеальном случае — при любых эмпирических данных. А для этого необходимо расширить множество D, вводить стохастику, т. е. надо идти на риск построения фальсифицируемых моделей.
Введение стохастики формально мало что изменяет в схеме (4.33—4.35), но в содержательном плане это означает, что следует идентифицировать функцию распределения или же оператор преобразования функций распределения. Разделим переменные в (4.33) на контролируемые, т. е. на такие, которым можно придавать произвольные значения, и на неконтролируемые. Здесь есть аналогия (но не более) с входными и выходными переменными, так как входные переменные могут быть только частично контролируемы и т. д. Пусть неконтролируемые щ первых переменных; задав соответствующим образом сигма-
алгебру на введем множество функций распределе-
i
п1
ни я наДХ^; обозначим его . Совместную функцию і
распределения случайных переменных обозначим как F ..., є= .
Мы получаем схему (4.33), записав
S с: х ... X Хп. (4.45)
Если пг = п, то получаем схему корреляционного анализа или так называемую регрессию I [459], [343]. При тії — 0 возвращаемся к детерминированной модели.
Если множество допустимых моделей параметризиро- ванно, то задача заключается в том, чтобы по конечному числу наблюдений сделать вывод о значении параметров модели.
Но практически параметризация D возможна только в редких случаях (например, щ = п = 1 и заведомо известно, что ST — множество нормальных распределений). Поэтому задача решается в несколько этапов. Выбирается некоторое подмножество D' a D, причем D не обязательно задавать в явном виде. По эмпирическим данным S* решается задача подгонки в D'. Случайность S* обусловливает случайность S] случайным, следовательно, является и значение меры соответствия p(S, S*). Неравенство (4.35) выполняется с некоторой вероятностьюР rob {р (5, S*) < р (5, S*)} = а (?'), (4.46)
S є D\ S* может принадлежать или не принадлежать D'. a{D') указывает на то, что эта вероятность зависит от выбора множества D'. Так, в случае тривиальной идентификации D' = {S*} эта вероятность равна 1.
Аналогичным образом неравенство (4.34) выполняется с некоторой вероятностью, зависящей от Д' (D' здесь играет роль априорной информации).
Определение наилучшего S (в среднем или с заданной вероятностью и т. п.) не является, как уже отмечалось, конечной целью: нужна не подгону а идентификация.
Абсолютно точно и надежпо эту задачу в случаях, не сводящихся к простому описанию, решить, как уже отмечалось, нельзя. Но на основе решения задачи подгонки, т. е. на основе сведений о S, можно проверить гипотезу
S a: S.
По определению, S а ?Г X Хп X ... X Хп, следовательно,
Р rob [S а ^ X X ... ХХп} = 1.
Надежность абсолютная, но точность равна нулю. В то же время
Prob{SczS*}&0;
точность здесь максимальная, но надежность совершенно отсутствует. S является компромиссом между этими крайними случаями. Если вероятность того, что «вычисленное» множество S накрывает истинную систему S, достаточно велика, то задача идентификации решена.
Таким образом, подгонка и проверка результатов подгонки — это две последовательные процедуры идентификации в нетривиальном случае, когда множество значений хотя бы одной переменной модели бесконечно и возможны ошибки регистрации. Вырожденным случаем этой схемы является проверка произвольной гипотезы. Результат подгонки — это гипотеза {S a S}, которая должна быть проверена. Но проверять можно не только гипотезу {S с S}, но и сколь угодно большое количество других гипотез, например {S a S}, где SGD". В конце концов откуда появилась гипотеза, как она выдвинута, неважно; история гипотезы не влияет (не должна влиять, точнее) на результаты проверки — в этом смысле проверка должна быть беспристрастной. Но это не означает, что этап подгонки бесполезен. На этом этапе отсеиваются гипотезы с малой конкурентоспособностью.
Если результат подгонки (предполагая, что он существует) определен однозначно, то о результате проверки этого сказать нельзя. Теория статистической проверки гипотез — один из важнейших разделов математической статистики. Ключевыми словами в ней являются: «ошибка первого рода» и «ошибка второго рода».
Ошибка первого рода допускается, когда отвергается истинная гипотеза; ошибка второго рода — не отвергнута ложная гипотеза. При конечном числе наблюдений вероятности этих ошибок нельзя сделать равными (или сколь угодно близкими нулю) одновременно. 11о даже в том случае, когда вероятность события равна нулю, нельзя утверждать, что это событие невозможно. Справедливо только обратное утверждение: вероятность невозможного события равна нулю. Поэтому то, что гипотеза не отвергнута, не означает, что она истина, и наоборот: то, что гипотеза отвергнута, не обязательно отвержение проверяемой гипотезы. Но не означает, следовательно, что следует принять ее отрицание (обстоятельство, на котором К. Поппер построил свой принцип фальсифицируемости). Логика статистической проверки гипотез в этом плане похожа на интуиционистскую логику, отрицающую закон исключенного третьего: либо Но — истина, либо отрицание Н0 — истина [112]. Привлечение интуиционистской логики к анализу методологических проблем теории статистической проверки гипотез представляется весьма интересным, но необходимым оно не является. Противоречия не возникает и в рамках традиционной логики, признающей закон исключенного третьего: отрицанием гипотезы Но является ДИЗЪЮНКЦИЯ простых гипотез Hi V Н2 V Поэтому непринятие гипотезы {S a S} не влечет за собой принятие конкурирующей гипотезы {S a S} (здесь, конечно, имеется в виду, что S П S = 0).
Процедуры идентификации выполнены тем лучше, чем больше информации «выжато» из эмпирических данных S* [78]. Существуют различные мнения о допустимости повторного использования эмпирических данных: первый раз — для подгонки модели, второй — для проверки. В ряде методов идентификации эмпирические данные делятся на две части — «обучающую» и проверочную ([63], [161], [380] и др.). Теоретико-вероятностное обоснование этой процедуры в схемах эволюционного (адаптивного и т. п.) моделирования не приводится. Существует, конечно, естественное разделение данных на две части: 1 — данные, имеющиеся к моменту идентификации, и 2 — данные, полученные после идентификации. Нет сомнений, что модели следует адаптировать к новым данным. Но данные, имеющиеся к моменту идентификации модели, следует, видимо, использовать полностью. Ни точность, ни надежность идентификации не снижаются от того, что одни и те же эмпирические данные используются и для подгонки и для проверки ее результатов, так как проверка модели должна основываться только на эмпирических данных, а не на истории построения модели.
Переход от схемы (4.33) к схеме (4.45) требует выдвижения гипотезы о множестве распределений 2Г или выдвижения дополнительных гипотез о множестве D, если У — просто множество всех функций распределения на Хх X Х2 X ... X Хп. Например, часто предполагают, что случайные величины Xt (і = 1, п) независимы в совокупности
= {F(xt, ...,хп)\Р(х±, ...,хп) = = F^Ffa) ...Fni(zni)}.
В любом случае какие-то гипотезы о свойствах случайных величин, введенных в модель, делать необходимо. Часто эти гипотезы выдвигаются в форме гипотез о распределении случайных ошибок в схемах моделей вида
у = ф(ж, а) + в, (4.47)
где х — независимые переменные, у — зависимая переменная, а — параметры модели, ф(.,.) — заданная схема функций, параметризированная а, в—случайная ошибка.
Если нет никакой информации о случайных ошибках в, выдвижение гипотезы о законе их распределения вызывает затруднения. Отметим, что, учитывая допустимость вырождения двухшаговой процедуры идентификации, гипотезы можно выдвигать любые; важно, чтобы они затем были подвергнуты проверке на эмпирическом материале. Решение задачи идентификации не заканчивается вычислением оценок параметра а в (4.47); процедура проверки неустранима. Существуют, однако, подходы к выдвижению гипотез о распределении случайных ошибок. Наибольшее внимание этим вопросам уделяется в рамках теоретико-информационных и байесовских методов оценивания и идентификации, где требуется вводить в модель априорную функцию распределения ([41], [175], [499] и др.).
Альтернативой методам, основанным на функции правдоподобия, и в более общем плане — альтернативой идентификации является прагматическое оценивание параметров модели, в явном виде учитывающее потери от ошибок оценивания. Эти методы, развиваемые в рамках теории статистических решений ([141], [371], [372] и др.) и теории статистических игр [141], [261], весьма перспективны. Правда, серьезной проблемой становится проверяемость выбора решения; при таком подходе она возможна только после реализации решения, так как оценки оптимального решения в общем случае могут оказаться смещенными. В ряде случаев прагматическое оценивание позволяет сформулировать требования к характеристикам оценок, в частности к их точности и надежности. В простейшем, но достаточно важном случае получаются традиционные требования классических стандартов математической статистики. Пусть, например, зависимость эффективности решения от оцениваемого, по эмпирическим данным, параметра а описывается непрерывной, по крайней мере дважды дифференцируемой по ос функцией, а потери — вследствие неточного оценивания аналогичной функцией W(ос — а), причем 1^(0) = 0 (а — оценка параметра а). Разлагая функцию потерь в окрестности точки А = (а — а) = 0 в ряд Тейлора и отбрасывая члены высшего порядка малости, получаем
Пусть а — несмещенная оценка параметра а : Ма = а. Тогда математическое ожидание потерь вследствие неточности оценивания будет в первом приближении равно
MW {а - а) « 4- ^ (а ~ = 4" ^Sr
где Da — дисперсия оценки а.
Из этого следует, что наилучшей в первом приближении оценкой параметра а будет та, дисперсия которой минимальна. В случае линейной регрессии дисперсии оценок параметров пропорциональны дисперсии случайной ошибки, которая оценивается суммой квадратов остатков; прагматический подход, таким образом, совпадает в этом случае с оцениванием методом наименьших квадратов.
Еще по теме 4.3.2. Сравнение, подгонка и идентификация моделей:
- 4.3. Идентификация экономико-математических моделей 4.3.1. Основные проблемы и методы идентификации
- 4.2. Регулирование эволюции национальной экономики на базе вычислимой модели общего равновесия с сектором знаний 4.2.1. Описание модели, параметрическая идентификации и ретроспективный прогноз Агенты модели
- 4.3. Регулирование эволюции национальной экономики на базе вычислимой модели общего равновесия с теневым сектором 4.3.1. Описание модели, параметрическая идентификации и ретроспективный прогноз.
- 4.3.3. Проблемы идентификации модели межотраслевого баланса и матрицы Леонтьева
- 4.1. Макроэкономический анализ и параметрическое регулирование эволюции национальной экономики на базе вычислимой модели общего равновесия отраслей экономики 4.1.1. Описание модели, параметрическая идентификация и ретроспективный прогноз
- Сравнение моделей риска рыночной ликвидности
- Идентификация
- Сущность идентификации
- Сущность идентификации
- 7. RFID – технологии радиочастотной идентификации