Scientific journal
Modern high technologies
ISSN 1812-7320
"Перечень" ВАК
ИФ РИНЦ = 1,279

MULTIDIMENSIONAL RISK MONITORING IN CONDITIONS OF STOCHASTIC HETEROGENEITY OF DATA

Tyrsin A.N. 1, 2
1 Federal State Budgetary Institution of Science "Institute of Economics of the Ural Branch of the Russian Academy of Sciences"
2 Federal State Autonomous Educational Institution of Higher Education "Ural Federal University named after the First President of Russia B. N. Yeltsin"
1835 KB
In a broad sense, risk is understood as the possible danger of any adverse outcome. When assessing the reliability of systems, it is often necessary to consider many risk factors that may be correlated. When conducting risk analysis, situations often arise when data samples are stochastically heterogeneous. Such situations include non-Gaussian distributions of risk factors, heterogeneity of data, the presence of outliers and small samples. This imposes requirements on risk analysis methods. In this case, risk analysis is fraught with difficulties. The aim of the article is to propose and test an approach to multidimensional risk analysis in conditions of stochastic heterogeneity of data. The paper considers the basic model of multidimensional risk, in which set risk factors are represented as a Gaussian vector with correlated components. This model assumes that the domain of adverse outcomes is known. Stochastic heterogeneity of data leads to instability of risk analysis based on this model. Various ways of accounting for data heterogeneity are considered. An approach based on the preliminary identification of outliers for each of the risk factors and subsequent adjustment of the covariance matrix of the data is proposed. The analysis of test examples showed acceptable stability of risk analysis under conditions of contamination of Gaussian samples.
risk
random vector
model
system
robustness
gaussian distribution
heterogeneity of data

Введение

В широком смысле под «риском» понимают возможную опасность какого-либо неблагоприятного исхода [1, с. 11]. В своей простейшей форме величина риска – это общая величина ожидаемых результатов, вероятность, умноженная на последствия [2, с. 27]. При этом моделирование риска сводится к выделению опасных исходов, количественному заданию последствий от их наступления и оцениванию вероятностей этих исходов. Если последствия опасных исходов с требуемой степенью достоверности оценить заранее невозможно, то ограничиваются оцениванием вероятностей их возникновения.

Мониторинг риска позволяет своевременно обнаруживать возникновение неисправностей. Он является одним из важнейших инструментов при оценке надежности систем [3; 4]. Однако мониторинг риска реальных систем обычно сопряжен с рядом затруднений. Перечислим их.

Во-первых, множество факторов риска, которые могут быть коррелированными [5]. Это повышает вероятность одновременного проявления факторов риска, что может приводить к более значительным последствиям при возникновении неисправностей.

Во-вторых, стохастическая неоднородность данных. Это проявляется в их гетерогенности и наличии выбросов. Гетерогенность может быть вызвана влиянием неучтенных факторов и ограниченностью выборки при многомерности данных [6; 7]. Выбросы в данных могут возникать по объективным причинам из-за эффекта развития процессов деградации в системе [8]. Также можно отметить, что распределения анализируемых выборок в риск-анализе обычно являются унимодальными.

В-третьих, мониторинг риска предназначен прежде всего для оперативного обнаружения изменений в работе системы, кроме этого, часто у факторов риска могут наблюдаться тренды. Это приводит к необходимости оценки риска на малых выборках, при этом используемая математическая модель должна быть достаточно простой.

Известен подход к моделированию многомерного риска на основе представления его факторов в виде гауссова вектора [9]. Он учитывает малые выборки данных, многомерность и коррелированность факторов риска. Однако присутствие в выборке даже малой доли выбросов завышает оценки дисперсий и ковариаций. В результате чего оценка риска также завышается. Отметим, что обычно анализируемые выборки достаточно малы, а факторы риска формируются за счет влияния многих причин. В результате гауссова аппроксимация выборочного многомерного распределения без учета выбросов достаточно точно описывает случайный вектор факторов риска. Эту особенность отмечают многие авторы [10, с. 15–26; 11, с. 24–38].

Указанные особенности мониторинга риска реальных систем накладывают требования к методам анализа риска: 1) риск-анализ должен учитывать многомерность и стохастическую неоднородность данных; 2) малые размеры выборок, необходимость учета коррелированности факторов риска и требование оперативности анализа затрудняют использование негауссовых распределений.

Цель исследования – предложить и апробировать на тестовых примерах подход к многомерному риск-анализу в условиях стохастической неоднородности данных.

Материалы и методы исследования

Мониторинг риска должен опираться на адекватную математическую модель. В [9; 12] предложен подход к моделированию риска, согласно которому стохастическую систему S представляют в виде гауссова вектора , а в качестве управляющих переменных используют его числовые характеристики – вектор средних и ковариационную матрицу ΣX. Компоненты вектора X – это факторы риска, характеризующие состояние системы S.

Вместо выделения всех опасных ситуаций зададим геометрическую область D неблагоприятных исходов, которая определяется на основе имеющейся априорной информации и может выглядеть произвольным образом в зависимости от конкретной задачи. Для определенности опишем предлагаемый подход на примере распространенной концепции нежелательных событий как больших и маловероятных отклонений гауссова вектора X относительно безопасного состояния системы S.

Область безопасных состояний G можно описать различными способами. Наиболее оправданным с геометрической точки зрения представляется задать ее в виде внутренней области m-осного эллипсоида как

, (1)

где , bj – центр и полуоси эллипсоида, внутренняя область которого задает безопасные состояния системы.

Попадания в области G и

являются противоположными событиями. Тогда вероятность неблагоприятного исхода определим как вероятность непопадания случайного вектора X в область безопасных состояний системы

, (2)

где px(x) – плотность вероятности вектора X.

Формула (2) позволяет оценить только вероятность неблагоприятного исхода и не учитывает последствий его наступления. Если включить в формулу (2) функцию последствий от опасных ситуаций (функцию риска) g(x), то получим модель для количественной оценки риска

. (3)

Отметим, что формула (2) является частным случаем выражения (3). Действительно, если в (2) принять

то r(X) = P(D), то есть в этом случае риск будет равен вероятности неблагоприятного исхода.

Для задания функции g(x) не требуется знания фактических последствий от наступления неблагоприятного исхода в анализируемой системе. Достаточно лишь количественно описать в условных единицах зависимость последствий от значений факторов риска. Это можно сделать следующим образом.

1. Считаем, что функция g(x) является неотрицательной и непрерывной всюду на ℝm функцией, причем g(Θ) = 0.

2. Считаем, что функция g(x) не убывает по любому направлению из точки Θ.

3. .

Например, указанным выше условиям удовлетворяет параболоид

.

На ранней стадии проведения анализа риска системы сложно достаточно точно описать функцию g(x). Поэтому вероятность P(D) является удобным начальным приближением модели риска. Также вероятность P(D) может использоваться в качестве оценки риска для прогнозирования наступления неблагоприятного исхода. В данной статье рассматривается вопрос использования модели многомерного риска в условиях стохастической неоднородности данных. В этом случае без потери общности результатов достаточно рассмотреть поведение оценок вероятности P(D).

Практическое использование модели многомерного риска требует знания или задания плотности вероятности случайного вектора X значений факторов риска. В качестве базового будем использовать гауссово распределение с плотностью вероятности

,

где a – вектор математических ожиданий, ΣX – ковариационная матрица X.

Использование гауссова распределения для случайного вектора X основано на следующих аргументах: 1) справедливость центральной предельной теоремы; 2) анализируемая выборка является малой, что не позволяет оценить закон распределения случайного вектора; 3) в данной задаче нет необходимости идентифицировать фактический закон распределения px(x), так как нас интересует только вероятность P(D).

Оценка риска осуществляется следующим образом: 1) задаем в (1) параметры безопасных состояний системы; 2) по выборке данных размера n определяем вектор средних a и ковариационную матрицу ΣX; 3) по формуле (2) определяем риск P(D).

Наряду с риском данная модель позволяет оценить вклад в общий риск его составляющих Xj как

,

где , Dj–– область неблагоприятных исходов D после исключения фактора риска Xj. Также можно оценить вклад корреляции между факторами риска в общий риск как

,

где все компоненты случайного вектора являются взаимно независимыми и имеют те же распределения, что и Xj. Отметим, что наличие корреляции между факторами риска Xj и ее направление может как увеличивать, так и уменьшать величину риска.

Вычисление P(D) путем вычисления интеграла (2) при больших размерностях m и при коррелированности факторов риска весьма трудоемко. Вместо этого можно использовать метод статистических испытаний Монте-Карло. Суть этой процедуры состоит в следующем. Пусть имеем некоторую выборку данных в виде матрицы Xm, которую будем условно называть генеральной совокупностью. Обозначим ее плотность вероятности px(x). Мы должны многократно генерировать новые векторы-наблюдения zi, i = 1,…,N, с законом распределения px(x). Тогда оценка вероятности P(D) будет равна частоте M / N, где N – общее количество сгенерированных наблюдений zi, M – количество исходов, когда сгенерированное наблюдение .

Результаты исследования и их обсуждение

Рассмотрим мониторинг риска на наглядном примере.

Пример 1. Имеем двухфакторную систему X = (X1, X2). На рисунке, a–c, показаны выборки факторов риска (размер n = 1000) в три последовательных периода времени T1 < T2 < T3 и области G и D. Средние aj, стандартные отклонения sXj, коэффициенты корреляции и результаты расчета P(D) в периоды T1, T2 и T3 приведены в табл. 1. Оценки P(D) выполнялись методом Монте-Карло, число испытаний N = 100000.

Таблица 1

Значения риска и числовых характеристик распределения без выбросов

Параметры

T1

T2

T3

a1

4,603

4,804

5,305

a2

4,201

3,901

3,700

0,356

0,447

0,559

0,230

0,311

0,404

-0,216

-0,376

-0,594

P(D)

0,001

0,003

0,077

Примечание: составлена автором на основе полученных данных в ходе исследования/

Рост риска вызван главным образом дрейфом и ростом дисперсии фактора X2, а также усилением тесноты отрицательной корреляции между X1 и X2.

Модель многомерного риска на основе (1), (2) в целом оказалась достаточно адекватной в условиях стохастической однородности данных, когда в выборке отсутствуют выбросы, под которыми понимаем отклонения от среднего на более трех среднеквадратических отклонений. Появление в данных выбросов приводит к увеличению ковариаций и дисперсий. В результате происходит завышение оценки риска.

Рассмотрим способы обеспечения устойчивости оценивания риска. Заметим, что эта задача отличается от традиционного робастного оценивания: здесь рассматривается вопрос обеспечения устойчивости оценки риска относительно неоднородных данных, а не ошибок в виде выбросов [13, с. 200–218; 14, с. 25–32; 15].

Известен подход, основанный на представлении данных в виде гауссовых смесей (Gaussian Mixture Model – GMM) [16]. В модели GMM функция плотности вероятности имеет вид взвешенной суммы из смеси K гауссовых распределений

,

, .

Оценка параметров p(x|ε) производится методом максимального правдоподобия [17]. Поскольку аналитическое решение для смесей отсутствует (из-за наличия скрытых переменных – индексов компонент), применяется итеративный EM-алгоритм (Expectation-Maximization), который монотонно увеличивает правдоподобие на каждом шаге, сходясь к локальному оптимуму.

Однако использование GMM в риск-анализе показало, что этот метод при редких выбросах и отсутствии у них эффекта кластеризации (что типично в риск-анализе) ошибочно определяет число смесей и обычно завышает долю выбросов [18]. Это ограничивает применение GMM в риск-анализе в условиях стохастической неоднородности данных.

Второй подход – это метод минимального определителя ковариации (Minimum Covariance Determinant – MCD) [19]. Алгоритм ищет такое подмножество из h ≤ n наблюдений, ковариационная матрица Σh которого имеет минимальный определитель

. (4)

Определитель ковариационной матрицы равен произведению определителя корреляционной матрицы факторов риска и их дисперсий

. (5)

Из (5) видим, что уменьшение происходит при уменьшении и . Но при уменьшении дисперсий выборка сжимается, что приводит к искусственному занижению корреляций между факторами риска и завышению . Поэтому минимизация (4) дает неоднозначный эффект, и использование MCD в задаче оценки риска не имеет четкой интерпретации.

Выборки факторов риска в периоды T1 (a), T2 (b) и T3 (c) Примечание: составлен автором по результатам данного исследования

Известен подход, в котором данные аппроксимируются с помощью смеси t-распределений (Student Mixture Model – SMM) [20] как

.

Замена нормального распределения на распределение Стьюдента позволяет корректно описывать редкие события без их ложной классификации как аномалий. Однако процедура выбора чисел степеней свободы vk в SMM недостаточно формализована. Кроме того, утяжеление хвостов распределения плохо соответствует сути риск-анализа: слишком большие выбросы, как правило, не могут появляться физически, потому что система до их появления потеряет работоспособность.

Далее используем традиционную трактовку выбросов для гауссова распределения. В качестве устойчивой оценки средних aj значений каждого из факторов используем выборочные медианы [13, c. 33–46; 21]. Фиксируем уровень значимости α. Для каждого из факторов риска с помощью известных статистических процедур определяем число выбросов mj, j = 1,…,m. Соответственно, доли выбросов равны wj = mj / n, где n – количество наблюдений.

Для всех факторов Xj, у которых wj > 0, пересчитываем их средние квадратические отклонения так, чтобы

.

После этого корректируем ковариационную матрицу и оцениваем риск.

Проверим работоспособность предложенного метода.

Пример 2. В примере 1 во все три выборки добавим двухпроцентное засорение с помощью модели Тьюки – Хьюбера в виде смеси двух перекрывающихся распределений

,

где N(x,a,Σ) – исходные гауссовы векторы размерности m = 2, числовые характеристики которых приведены в табл. 1; N(x,aε,Σε) – гауссов вектор размерности m, компоненты которого имеют те же математические ожидания и удвоенные значения средних квадратических отклонений. Были проведены расчеты риска с помощью аппроксимации засоренных данным гауссовым распределением (3-я строка табл. 2), а также с помощью предложенного робастного метода корректировки ковариационной матрицы (четвертая строка табл. 2). Во второй строке приведены оценки P(D) из табл. 1. Оценка P(D) также выполнялась методом Монте-Карло по числу испытаний N = 100000.

Таблица 2

Результаты оценки риска P(D): для гауссовой выборки, при засорении данных выбросами, при корректировке ΣX засоренной выборки

Данные

T1

T2

T3

Гауссова выборка

0,001

0,003

0,077

2%-е засорение

0,006

0,015

0,122

Корректировка ΣX

0,002

0,006

0,098

Примечание: составлена автором на основе полученных данных в ходе исследования

Из табл. 2 видим, что даже малая доля засорений значительно завышает риск.

Заключение

Рассмотрены известные пути оценки многомерного риска в условиях стохастической неоднородности данных, основанные на моделях GMM, MCD и SMM. Анализ показал, что они дают неустойчивые результаты при наличии в данных отдельных засорений в виде выбросов.

Предложен подход, основанный на предварительной идентификации выбросов для каждого из факторов риска и последующей корректировке ковариационной матрицы данных. Анализ на тестовых примерах показал приемлемую устойчивость риск-анализа в условиях засорения гауссовых выборок. В дальнейшем планируется апробировать подход на многомерных модельных данных высокой размерности и на практических задачах.


Conflict of interest
The authors declare that there is no conflict of interest.

Acknowledgements
The article was carried out in accordance with the research plan of the Institute of Economics of the Ural Branch of the Russian Academy of Sciences.

Financing
The research was performed without external funding.

Библиографическая ссылка

Тырсин А.Н. МОНИТОРИНГ МНОГОМЕРНОГО РИСКА В УСЛОВИЯХ СТОХАСТИЧЕСКОЙ НЕОДНОРОДНОСТИ ДАННЫХ // Современные наукоемкие технологии. 2026. № 7. С. 193-199;
URL: https://top-technologies.ru/en/article/view?id=40875 (дата обращения: 12.08.2026).