Введение
В широком смысле под «риском» понимают возможную опасность какого-либо неблагоприятного исхода [1, с. 11]. В своей простейшей форме величина риска – это общая величина ожидаемых результатов, вероятность, умноженная на последствия [2, с. 27]. При этом моделирование риска сводится к выделению опасных исходов, количественному заданию последствий от их наступления и оцениванию вероятностей этих исходов. Если последствия опасных исходов с требуемой степенью достоверности оценить заранее невозможно, то ограничиваются оцениванием вероятностей их возникновения.
Мониторинг риска позволяет своевременно обнаруживать возникновение неисправностей. Он является одним из важнейших инструментов при оценке надежности систем [3; 4]. Однако мониторинг риска реальных систем обычно сопряжен с рядом затруднений. Перечислим их.
Во-первых, множество факторов риска, которые могут быть коррелированными [5]. Это повышает вероятность одновременного проявления факторов риска, что может приводить к более значительным последствиям при возникновении неисправностей.
Во-вторых, стохастическая неоднородность данных. Это проявляется в их гетерогенности и наличии выбросов. Гетерогенность может быть вызвана влиянием неучтенных факторов и ограниченностью выборки при многомерности данных [6; 7]. Выбросы в данных могут возникать по объективным причинам из-за эффекта развития процессов деградации в системе [8]. Также можно отметить, что распределения анализируемых выборок в риск-анализе обычно являются унимодальными.
В-третьих, мониторинг риска предназначен прежде всего для оперативного обнаружения изменений в работе системы, кроме этого, часто у факторов риска могут наблюдаться тренды. Это приводит к необходимости оценки риска на малых выборках, при этом используемая математическая модель должна быть достаточно простой.
Известен подход к моделированию многомерного риска на основе представления его факторов в виде гауссова вектора [9]. Он учитывает малые выборки данных, многомерность и коррелированность факторов риска. Однако присутствие в выборке даже малой доли выбросов завышает оценки дисперсий и ковариаций. В результате чего оценка риска также завышается. Отметим, что обычно анализируемые выборки достаточно малы, а факторы риска формируются за счет влияния многих причин. В результате гауссова аппроксимация выборочного многомерного распределения без учета выбросов достаточно точно описывает случайный вектор факторов риска. Эту особенность отмечают многие авторы [10, с. 15–26; 11, с. 24–38].
Указанные особенности мониторинга риска реальных систем накладывают требования к методам анализа риска: 1) риск-анализ должен учитывать многомерность и стохастическую неоднородность данных; 2) малые размеры выборок, необходимость учета коррелированности факторов риска и требование оперативности анализа затрудняют использование негауссовых распределений.
Цель исследования – предложить и апробировать на тестовых примерах подход к многомерному риск-анализу в условиях стохастической неоднородности данных.
Материалы и методы исследования
Мониторинг риска должен опираться на адекватную математическую модель. В [9; 12] предложен подход к моделированию риска, согласно которому стохастическую систему S представляют в виде гауссова вектора
, а в качестве управляющих переменных используют его числовые характеристики – вектор средних
и ковариационную матрицу ΣX. Компоненты вектора X – это факторы риска, характеризующие состояние системы S.
Вместо выделения всех опасных ситуаций зададим геометрическую область D неблагоприятных исходов, которая определяется на основе имеющейся априорной информации и может выглядеть произвольным образом в зависимости от конкретной задачи. Для определенности опишем предлагаемый подход на примере распространенной концепции нежелательных событий как больших и маловероятных отклонений гауссова вектора X относительно безопасного состояния системы S.
Область безопасных состояний G можно описать различными способами. Наиболее оправданным с геометрической точки зрения представляется задать ее в виде внутренней области m-осного эллипсоида как
, (1)
где
, bj – центр и полуоси эллипсоида, внутренняя область которого задает безопасные состояния системы.
Попадания в области G и

являются противоположными событиями. Тогда вероятность неблагоприятного исхода определим как вероятность непопадания случайного вектора X в область безопасных состояний системы
, (2)
где px(x) – плотность вероятности вектора X.
Формула (2) позволяет оценить только вероятность неблагоприятного исхода и не учитывает последствий его наступления. Если включить в формулу (2) функцию последствий от опасных ситуаций (функцию риска) g(x), то получим модель для количественной оценки риска
. (3)
Отметим, что формула (2) является частным случаем выражения (3). Действительно, если в (2) принять

то r(X) = P(D), то есть в этом случае риск будет равен вероятности неблагоприятного исхода.
Для задания функции g(x) не требуется знания фактических последствий от наступления неблагоприятного исхода в анализируемой системе. Достаточно лишь количественно описать в условных единицах зависимость последствий от значений факторов риска. Это можно сделать следующим образом.
1. Считаем, что функция g(x) является неотрицательной и непрерывной всюду на ℝm функцией, причем g(Θ) = 0.
2. Считаем, что функция g(x) не убывает по любому направлению из точки Θ.
3.
.
Например, указанным выше условиям удовлетворяет параболоид
.
На ранней стадии проведения анализа риска системы сложно достаточно точно описать функцию g(x). Поэтому вероятность P(D) является удобным начальным приближением модели риска. Также вероятность P(D) может использоваться в качестве оценки риска для прогнозирования наступления неблагоприятного исхода. В данной статье рассматривается вопрос использования модели многомерного риска в условиях стохастической неоднородности данных. В этом случае без потери общности результатов достаточно рассмотреть поведение оценок вероятности P(D).
Практическое использование модели многомерного риска требует знания или задания плотности вероятности случайного вектора X значений факторов риска. В качестве базового будем использовать гауссово распределение с плотностью вероятности
,
где a – вектор математических ожиданий, ΣX – ковариационная матрица X.
Использование гауссова распределения для случайного вектора X основано на следующих аргументах: 1) справедливость центральной предельной теоремы; 2) анализируемая выборка является малой, что не позволяет оценить закон распределения случайного вектора; 3) в данной задаче нет необходимости идентифицировать фактический закон распределения px(x), так как нас интересует только вероятность P(D).
Оценка риска осуществляется следующим образом: 1) задаем в (1) параметры безопасных состояний системы; 2) по выборке данных размера n определяем вектор средних a и ковариационную матрицу ΣX; 3) по формуле (2) определяем риск P(D).
Наряду с риском данная модель позволяет оценить вклад в общий риск его составляющих Xj как
,
где
, Dj–– область неблагоприятных исходов D после исключения фактора риска Xj. Также можно оценить вклад корреляции между факторами риска в общий риск как
,
где все компоненты
случайного вектора
являются взаимно независимыми и имеют те же распределения, что и Xj. Отметим, что наличие корреляции между факторами риска Xj и ее направление может как увеличивать, так и уменьшать величину риска.
Вычисление P(D) путем вычисления интеграла (2) при больших размерностях m и при коррелированности факторов риска весьма трудоемко. Вместо этого можно использовать метод статистических испытаний Монте-Карло. Суть этой процедуры состоит в следующем. Пусть имеем некоторую выборку данных в виде матрицы Xn×m, которую будем условно называть генеральной совокупностью. Обозначим ее плотность вероятности px(x). Мы должны многократно генерировать новые векторы-наблюдения zi, i = 1,…,N, с законом распределения px(x). Тогда оценка вероятности P(D) будет равна частоте M / N, где N – общее количество сгенерированных наблюдений zi, M – количество исходов, когда сгенерированное наблюдение
.
Результаты исследования и их обсуждение
Рассмотрим мониторинг риска на наглядном примере.
Пример 1. Имеем двухфакторную систему X = (X1, X2). На рисунке, a–c, показаны выборки факторов риска (размер n = 1000) в три последовательных периода времени T1 < T2 < T3 и области G и D. Средние aj, стандартные отклонения sXj, коэффициенты корреляции
и результаты расчета P(D) в периоды T1, T2 и T3 приведены в табл. 1. Оценки P(D) выполнялись методом Монте-Карло, число испытаний N = 100000.
Таблица 1
Значения риска и числовых характеристик распределения
без выбросов
|
Параметры |
T1 |
T2 |
T3 |
|
a1 |
4,603 |
4,804 |
5,305 |
|
a2 |
4,201 |
3,901 |
3,700 |
|
|
0,356 |
0,447 |
0,559 |
|
|
0,230 |
0,311 |
0,404 |
|
|
-0,216 |
-0,376 |
-0,594 |
|
P(D) |
0,001 |
0,003 |
0,077 |
Примечание: составлена автором на основе полученных данных в ходе исследования/
Рост риска вызван главным образом дрейфом и ростом дисперсии фактора X2, а также усилением тесноты отрицательной корреляции между X1 и X2.
Модель многомерного риска на основе (1), (2) в целом оказалась достаточно адекватной в условиях стохастической однородности данных, когда в выборке отсутствуют выбросы, под которыми понимаем отклонения от среднего на более трех среднеквадратических отклонений. Появление в данных выбросов приводит к увеличению ковариаций и дисперсий. В результате происходит завышение оценки риска.
Рассмотрим способы обеспечения устойчивости оценивания риска. Заметим, что эта задача отличается от традиционного робастного оценивания: здесь рассматривается вопрос обеспечения устойчивости оценки риска относительно неоднородных данных, а не ошибок в виде выбросов [13, с. 200–218; 14, с. 25–32; 15].
Известен подход, основанный на представлении данных в виде гауссовых смесей (Gaussian Mixture Model – GMM) [16]. В модели GMM функция плотности вероятности имеет вид взвешенной суммы из смеси K гауссовых распределений
,
,
.
Оценка параметров p(x|ε) производится методом максимального правдоподобия [17]. Поскольку аналитическое решение для смесей отсутствует (из-за наличия скрытых переменных – индексов компонент), применяется итеративный EM-алгоритм (Expectation-Maximization), который монотонно увеличивает правдоподобие на каждом шаге, сходясь к локальному оптимуму.
Однако использование GMM в риск-анализе показало, что этот метод при редких выбросах и отсутствии у них эффекта кластеризации (что типично в риск-анализе) ошибочно определяет число смесей и обычно завышает долю выбросов [18]. Это ограничивает применение GMM в риск-анализе в условиях стохастической неоднородности данных.
Второй подход – это метод минимального определителя ковариации (Minimum Covariance Determinant – MCD) [19]. Алгоритм ищет такое подмножество
из h ≤ n наблюдений, ковариационная матрица Σh которого имеет минимальный определитель
. (4)
Определитель ковариационной матрицы
равен произведению определителя корреляционной матрицы
факторов риска и их дисперсий 
. (5)
Из (5) видим, что уменьшение
происходит при уменьшении
и
. Но при уменьшении дисперсий
выборка сжимается, что приводит к искусственному занижению корреляций между факторами риска и завышению
. Поэтому минимизация (4) дает неоднозначный эффект, и использование MCD в задаче оценки риска не имеет четкой интерпретации.

Выборки факторов риска в периоды T1 (a), T2 (b) и T3 (c) Примечание: составлен автором по результатам данного исследования
Известен подход, в котором данные аппроксимируются с помощью смеси t-распределений (Student Mixture Model – SMM) [20] как
.
Замена нормального распределения на распределение Стьюдента позволяет корректно описывать редкие события без их ложной классификации как аномалий. Однако процедура выбора чисел степеней свободы vk в SMM недостаточно формализована. Кроме того, утяжеление хвостов распределения плохо соответствует сути риск-анализа: слишком большие выбросы, как правило, не могут появляться физически, потому что система до их появления потеряет работоспособность.
Далее используем традиционную трактовку выбросов для гауссова распределения. В качестве устойчивой оценки средних aj значений каждого из факторов используем выборочные медианы [13, c. 33–46; 21]. Фиксируем уровень значимости α. Для каждого из факторов риска с помощью известных статистических процедур определяем число выбросов mj, j = 1,…,m. Соответственно, доли выбросов равны wj = mj / n, где n – количество наблюдений.
Для всех факторов Xj, у которых wj > 0, пересчитываем их средние квадратические отклонения так, чтобы
.
После этого корректируем ковариационную матрицу и оцениваем риск.
Проверим работоспособность предложенного метода.
Пример 2. В примере 1 во все три выборки добавим двухпроцентное засорение с помощью модели Тьюки – Хьюбера в виде смеси двух перекрывающихся распределений
,
где N(x,a,Σ) – исходные гауссовы векторы размерности m = 2, числовые характеристики которых приведены в табл. 1; N(x,aε,Σε) – гауссов вектор размерности m, компоненты которого имеют те же математические ожидания и удвоенные значения средних квадратических отклонений. Были проведены расчеты риска с помощью аппроксимации засоренных данным гауссовым распределением (3-я строка табл. 2), а также с помощью предложенного робастного метода корректировки ковариационной матрицы (четвертая строка табл. 2). Во второй строке приведены оценки P(D) из табл. 1. Оценка P(D) также выполнялась методом Монте-Карло по числу испытаний N = 100000.
Таблица 2
Результаты оценки риска P(D): для гауссовой выборки, при засорении данных выбросами, при корректировке ΣX засоренной выборки
|
Данные |
T1 |
T2 |
T3 |
|
Гауссова выборка |
0,001 |
0,003 |
0,077 |
|
2%-е засорение |
0,006 |
0,015 |
0,122 |
|
Корректировка ΣX |
0,002 |
0,006 |
0,098 |
Примечание: составлена автором на основе полученных данных в ходе исследования
Из табл. 2 видим, что даже малая доля засорений значительно завышает риск.
Заключение
Рассмотрены известные пути оценки многомерного риска в условиях стохастической неоднородности данных, основанные на моделях GMM, MCD и SMM. Анализ показал, что они дают неустойчивые результаты при наличии в данных отдельных засорений в виде выбросов.
Предложен подход, основанный на предварительной идентификации выбросов для каждого из факторов риска и последующей корректировке ковариационной матрицы данных. Анализ на тестовых примерах показал приемлемую устойчивость риск-анализа в условиях засорения гауссовых выборок. В дальнейшем планируется апробировать подход на многомерных модельных данных высокой размерности и на практических задачах.