Modern high technologiesrae.ru
Scientific journal

Modern high technologies

ISSN 1812-7320VAK ListRSCI IF = 1,279

MACHINE LEARNING ALGORITHMS IN DATA ANALYSIS ON THE EMPLOYMENT STATUS OF EDUCATIONAL INSTITUTION GRADUATES

1Northern (Arctic) Federal University named after M.V. Lomonosov
2Kaliningrad State Technical University
3Immanuel Kant Baltic Federal University

Введение

Использование технологий искусственного интеллекта способствует развитию современной цифровой экономики, трансформации бизнес-процессов, оптимизации производственных операций, повышению эффективности управления [1–3]. Алгоритмы и методы искусственного интеллекта позволяют автоматизировать рутинные операции, сокращая временные затраты и повышая точность выполняемых действий, оптимизировать производственные процессы, осуществляя контроль качества выпускаемой продукции и способствуя оптимизации планирования производства, обрабатывать большие объемы данных, выявляя в них закономерности и определяя новые знания [4–6].

Методы и модели машинного обучения, анализируя имеющиеся данные, выявляя в них закономерности, получают новые данные, необходимые для решения актуальных задач [7–9].

Цель исследования – проведение интеллектуального анализа данных, содержащих информацию об уровне трудоустройства и заработной платы выпускников учебных заведений высшего и среднего специального образования по направлениям подготовки и уровням образования. Представленное исследование, проведенное на основе методов и алгоритмов машинного обучения, позволяет определить наиболее успешные и востребованные на рынке труда направления подготовки и учебные заведения Российской Федерации, а также определить прогнозные значения доли трудоустроенных выпускников учебных заведений и показателя уровня трудоустройства обучающихся по учебным заведениям.

Материалы и методы исследования

Алгоритмы и методы машинного обучения являются широко используемым инструментом для проведения анализа данных различных прикладных областей [10, 11]. Искусственный интеллект, включающий в себя в том числе и модели машинного обучения, предоставляет возможности по проведению разведывательного анализа и предобработки данных, эффективного решения задач интеллектуального анализа данных различного уровня сложности [12, 13].

Для знакомства с исходным датасетом и построения моделей машинного обучения использовались библиотеки языка программирования Python по управлению, анализу и визуализации данных, а также библиотеки, предоставляющие алгоритмы решения задач классификации, регрессии, кластеризации, уменьшения размерности [14, 15].

Описание используемого набора данных

Для проведения анализа использовались данные о выпускниках более 5000 высших и средних специальных российских учебных заведений, сформированные из информационных систем Социального фонда и Рособрнадзора. Это выборочная совокупность о выпускниках, завершивших образование в вузе/ссузе, сгруппированная по направлениям подготовки, уровням образования, году выпуска и половой принадлежности. Используемый датасет включал в себя 1 027 682 записей и 19 параметров [16]. Данные по величине заработной платы и по трудоустройству рассматривались по состоянию на 2024 г. (дата обращения: 07.04.2026).

Описание параметров используемого датасета:

object_level: str: уровень территориальной единицы (регион)

object_name: str: название территориальной единицы (региона)

okato: int64: код ОКАТО региона

oktmo: int64: код ОКТМО региона

gender: str: пол выпускника (мужской, женский, всего)

education_level: str: уровень образования

year: int64: год выпуска

university: str: название образовательной организации

specialty_section: str: укрупненная группа направлений подготовки

specialty: str: направление подготовки

specialty_code: str: код направления подготовки

count_graduate: int64: количество выпускников

percent_employed: float64: доля трудоустроенных выпускников

average_salary_fact_avg: float64: средняя фактическая заработная плата в 2024 г.

average_salary_fact_med: float64: медианная фактическая заработная плата в 2024 г.

average_salary_norm_avg: float64: средняя зарплата, нормированная на уровень цен региона трудоустройства

average_salary_norm_med: float64: медианная зарплата, нормированная на уровень цен региона трудоустройства

average_age: float64: средний возраст выпускника

percent_combine_work_and_study: float64: доля выпускников, совмещавших учебу и работу.

Рис. 1. Анализ распределений некоторых числовых признаков Примечание: составлен авторами по результатам данного исследования

Результаты исследования и их обсуждение

Для знакомства со структурой используемых данных, выявления скрытых закономерностей в них и подготовки данных к последующему этапу моделирования был использован метод EDA. Итогами некоторых этапов данного процесса стал анализ распределения переменных и обработка выбросов и аномалий, представленный на рис. 1.

Интерпретация полученных результатов описательной статистики и визуализация распределений подтвердила сильную правостороннюю асимметрию (длинный хвост вправо) у таких признаков, как количество выпускников, доля трудоустроенных выпускников, средняя и медианная фактическая заработная плата, средняя и медианная зарплата, нормированная на уровень цен региона трудоустройства. Распределения, близкие к симметричному, были определены для признаков Средний возраст выпускника и Доля выпускников, совмещавших учебу и работу. Для всех числовых признаков (за исключением доли выпускников, совмещавших учебу и работу) определялась доля потенциальных выбросов.

Анализ распределения категориальных признаков позволил определить топ-категории по укрупненным группам подготовки, регионам, уровням образования и полу выпускника (рис. 2).

Рис. 2. Визуализация на основе частотного распределения Примечание: составлен авторами по результатам данного исследования

Рис. 3. Программный код по обработке выбросов Примечание: составлен авторами по результатам данного исследования

После определения аномальных значений для признаков Количество выпускников, Средняя и Медианная фактическая заработная плата, Средняя и Медианная зарплата, нормированная на уровень цен региона трудоустройства, использовалось логарифмирование и систематизация/обрезка хвостов по квантилям (статистический метод winsorization, который используется для ограничения экстремальных значений в наборе данных с целью уменьшения влияния выбросов на статистический анализ) (рис. 3).

Для остальных числовых признаков была мягко вычислена винсоризация без логарифмирования. Некоторые результаты обработки выбросов представлены на рис. 4.

Для подготовки данных к построению моделей машинного обучения, чтобы не переполнять память, использовались классы StandardScaler и MinMaxScaler для масштабирования числовых данных. Для кодирования категориальных признаков с низкой кардинальностью (<= 30 уникальных значений) был применен метод One-hot encoding, для высококардинальных признаков – частотное кодирование (1 столбец на признак). Фрагмент обработанного датасета содержится в рис. 5.

Анализ построенной тепловой карты позволил избежать проблему мультиколлинеарности нецелевых признаков в дальнейшем. Выполненный анализ логики признаков, изучение матрицы корреляции, проверка этапов предобработки, использование независимых валидационных выборок позволили решить задачу утечки данных.

По обработанным данным были решены следующие задачи предсказания данных:

‒ Прогнозирование доли трудоустроенных выпускников.

‒ Прогнозирование показателя уровня трудоустройства выпускников.

При решении задачи регрессии были построены модели LinearRegression (базовая линейная модель, которая очень быстро обучается, дает понятный ориентир «минимального уровня качества» и легко интерпретируется), DecisionTreeRegressor (простая нелинейная модель, учитывающая нелинейные зависимости и взаимодействия признаков и не требующая сложной подготовки признаков), RandomForestRegressor (усиленная версия дерева (ансамбль), обычно дающая более стабильное и точное качество, чем одно дерево, не склонная к переобучению, нежели DecisionTree). Распределение на обучающую и тестовую выборки: 80 и 20 % соответственно).

Значения метрик качества обучения данных модели продемонстрированы на рис. 7.

Лучшей по R2 оказалась модель RandomForest. Данная модель показывает и лучший баланс точности: наибольший R2 и более низкие ошибки MAE/RMSE среди рассмотренных моделей.

Рис. 4. Обработка выбросов Примечание: составлен авторами по результатам данного исследования

Рис. 5. Фрагмент обработанного датасета Примечание: составлен авторами по результатам данного исследования

Рис. 6. Фрагмент программного кода для построения моделей регрессии Примечание: составлен авторами по результатам данного исследования

Рис. 7. Метрики качества моделей задачи регрессии Примечание: составлен авторами по результатам данного исследования

Рис. 8. Анализ метрик моделей задачи классификации Примечание: составлен авторами по результатам данного исследования

В целях решения бинарной задачи классификации представленные в датасете объекты были разбиты на два класса: 1 (если доля трудоустроенных выпускников больше медианного значения) и 0 (в остальных случаях). Качество обучения построенных моделей LogisticRegression, DecisionTree, RandomForest анализировалось по метрикам Accuracy (доля правильных ответов (0–1)), F1-мера (баланс точности и полноты (0–1)) и ROC_AUC (способность разделять классы (0–1)) (рис. 8).

Лучшей моделью выбрана RandomForest, так как она показала наибольшее значение ROC_AUC и баланс Accuracy/F1 на тестовой выборке.

Для решения задачи кластеризации, являющейся задачей обучения без учителя, предварительно был удален признак половой принадлежности выпускника (имеющий значения: мужской, женский, всего) и построены модели KMeans и Agglomerative (с применением метода главных компонентов PCA – метода снижения размерности данных с потерей наименьшего объема информации). Количество кластеров на основе elbow method было определено равным 3 (рис. 9).

Рис. 9. Модели кластеризации Примечание: составлен авторами по результатам данного исследования

По метрике silhouette_score оптимальной оказалась модель KMeans. Ее кластеры более компактны и лучше отделены друг от друга на данном наборе признаков. Полученные кластеры представляют собой группы образовательных организаций с высоким, средним и низким уровнем трудоустройства выпускников.

Заключение

Алгоритмы машинного обучения, являясь частью искусственного интеллекта, позволяют, обучаясь на данных, выявлять в них закономерности, в том числе скрытые, определять прогнозные значения исследуемых показателей на последующие временные периоды. Построенные модели машинного обучения могут использоваться как вспомогательный инструмент при условии дополнительной валидации, позволяющий оптимизировать процессы в исследуемых прикладных областях.

Представленное исследование продемонстрировало основные этапы проведения интеллектуального анализа данных об уровне трудоустройства и заработной платы выпускников высших и средних специальных учебных заведений.

Построенные модели машинного обучения могут быть применимы в решении задач предсказания исследуемых признаков и кластеризации в анализе деятельности учебных заведений.


Conflict of Interest
The authors declare that there is no conflict of interest.

Acknowledgments
The authors would like to express their gratitude to A.D. Shumeeva, a student at Immanuel Kant Baltic Federal University, who actively participated in the research.

Funding
The research was performed without external funding.

Bibliographic Reference

Zelenina L.I., Solovey M.V. MACHINE LEARNING ALGORITHMS IN DATA ANALYSIS ON THE EMPLOYMENT STATUS OF EDUCATIONAL INSTITUTION GRADUATES // Modern high technologies. 2026. No. 8. pp. 70-77;
URL: https://top-technologies.ru/en/article/view?id=40901 (accessed: 04/09/2026).
DOI: https://doi.org/10.17513/snt.40901