MACHINE LEARNING ALGORITHMS IN DATA ANALYSIS ON THE EMPLOYMENT STATUS OF EDUCATIONAL INSTITUTION GRADUATES
Введение
Использование технологий искусственного интеллекта способствует развитию современной цифровой экономики, трансформации бизнес-процессов, оптимизации производственных операций, повышению эффективности управления [1–3]. Алгоритмы и методы искусственного интеллекта позволяют автоматизировать рутинные операции, сокращая временные затраты и повышая точность выполняемых действий, оптимизировать производственные процессы, осуществляя контроль качества выпускаемой продукции и способствуя оптимизации планирования производства, обрабатывать большие объемы данных, выявляя в них закономерности и определяя новые знания [4–6].
Методы и модели машинного обучения, анализируя имеющиеся данные, выявляя в них закономерности, получают новые данные, необходимые для решения актуальных задач [7–9].
Цель исследования – проведение интеллектуального анализа данных, содержащих информацию об уровне трудоустройства и заработной платы выпускников учебных заведений высшего и среднего специального образования по направлениям подготовки и уровням образования. Представленное исследование, проведенное на основе методов и алгоритмов машинного обучения, позволяет определить наиболее успешные и востребованные на рынке труда направления подготовки и учебные заведения Российской Федерации, а также определить прогнозные значения доли трудоустроенных выпускников учебных заведений и показателя уровня трудоустройства обучающихся по учебным заведениям.
Материалы и методы исследования
Алгоритмы и методы машинного обучения являются широко используемым инструментом для проведения анализа данных различных прикладных областей [10, 11]. Искусственный интеллект, включающий в себя в том числе и модели машинного обучения, предоставляет возможности по проведению разведывательного анализа и предобработки данных, эффективного решения задач интеллектуального анализа данных различного уровня сложности [12, 13].
Для знакомства с исходным датасетом и построения моделей машинного обучения использовались библиотеки языка программирования Python по управлению, анализу и визуализации данных, а также библиотеки, предоставляющие алгоритмы решения задач классификации, регрессии, кластеризации, уменьшения размерности [14, 15].
Описание используемого набора данных
Для проведения анализа использовались данные о выпускниках более 5000 высших и средних специальных российских учебных заведений, сформированные из информационных систем Социального фонда и Рособрнадзора. Это выборочная совокупность о выпускниках, завершивших образование в вузе/ссузе, сгруппированная по направлениям подготовки, уровням образования, году выпуска и половой принадлежности. Используемый датасет включал в себя 1 027 682 записей и 19 параметров [16]. Данные по величине заработной платы и по трудоустройству рассматривались по состоянию на 2024 г. (дата обращения: 07.04.2026).
Описание параметров используемого датасета:
object_level: str: уровень территориальной единицы (регион)
object_name: str: название территориальной единицы (региона)
okato: int64: код ОКАТО региона
oktmo: int64: код ОКТМО региона
gender: str: пол выпускника (мужской, женский, всего)
education_level: str: уровень образования
year: int64: год выпуска
university: str: название образовательной организации
specialty_section: str: укрупненная группа направлений подготовки
specialty: str: направление подготовки
specialty_code: str: код направления подготовки
count_graduate: int64: количество выпускников
percent_employed: float64: доля трудоустроенных выпускников
average_salary_fact_avg: float64: средняя фактическая заработная плата в 2024 г.
average_salary_fact_med: float64: медианная фактическая заработная плата в 2024 г.
average_salary_norm_avg: float64: средняя зарплата, нормированная на уровень цен региона трудоустройства
average_salary_norm_med: float64: медианная зарплата, нормированная на уровень цен региона трудоустройства
average_age: float64: средний возраст выпускника
percent_combine_work_and_study: float64: доля выпускников, совмещавших учебу и работу.

Рис. 1. Анализ распределений некоторых числовых признаков Примечание: составлен авторами по результатам данного исследования
Результаты исследования и их обсуждение
Для знакомства со структурой используемых данных, выявления скрытых закономерностей в них и подготовки данных к последующему этапу моделирования был использован метод EDA. Итогами некоторых этапов данного процесса стал анализ распределения переменных и обработка выбросов и аномалий, представленный на рис. 1.
Интерпретация полученных результатов описательной статистики и визуализация распределений подтвердила сильную правостороннюю асимметрию (длинный хвост вправо) у таких признаков, как количество выпускников, доля трудоустроенных выпускников, средняя и медианная фактическая заработная плата, средняя и медианная зарплата, нормированная на уровень цен региона трудоустройства. Распределения, близкие к симметричному, были определены для признаков Средний возраст выпускника и Доля выпускников, совмещавших учебу и работу. Для всех числовых признаков (за исключением доли выпускников, совмещавших учебу и работу) определялась доля потенциальных выбросов.
Анализ распределения категориальных признаков позволил определить топ-категории по укрупненным группам подготовки, регионам, уровням образования и полу выпускника (рис. 2).

Рис. 2. Визуализация на основе частотного распределения Примечание: составлен авторами по результатам данного исследования

Рис. 3. Программный код по обработке выбросов Примечание: составлен авторами по результатам данного исследования
После определения аномальных значений для признаков Количество выпускников, Средняя и Медианная фактическая заработная плата, Средняя и Медианная зарплата, нормированная на уровень цен региона трудоустройства, использовалось логарифмирование и систематизация/обрезка хвостов по квантилям (статистический метод winsorization, который используется для ограничения экстремальных значений в наборе данных с целью уменьшения влияния выбросов на статистический анализ) (рис. 3).
Для остальных числовых признаков была мягко вычислена винсоризация без логарифмирования. Некоторые результаты обработки выбросов представлены на рис. 4.
Для подготовки данных к построению моделей машинного обучения, чтобы не переполнять память, использовались классы StandardScaler и MinMaxScaler для масштабирования числовых данных. Для кодирования категориальных признаков с низкой кардинальностью (<= 30 уникальных значений) был применен метод One-hot encoding, для высококардинальных признаков – частотное кодирование (1 столбец на признак). Фрагмент обработанного датасета содержится в рис. 5.
Анализ построенной тепловой карты позволил избежать проблему мультиколлинеарности нецелевых признаков в дальнейшем. Выполненный анализ логики признаков, изучение матрицы корреляции, проверка этапов предобработки, использование независимых валидационных выборок позволили решить задачу утечки данных.
По обработанным данным были решены следующие задачи предсказания данных:
‒ Прогнозирование доли трудоустроенных выпускников.
‒ Прогнозирование показателя уровня трудоустройства выпускников.
При решении задачи регрессии были построены модели LinearRegression (базовая линейная модель, которая очень быстро обучается, дает понятный ориентир «минимального уровня качества» и легко интерпретируется), DecisionTreeRegressor (простая нелинейная модель, учитывающая нелинейные зависимости и взаимодействия признаков и не требующая сложной подготовки признаков), RandomForestRegressor (усиленная версия дерева (ансамбль), обычно дающая более стабильное и точное качество, чем одно дерево, не склонная к переобучению, нежели DecisionTree). Распределение на обучающую и тестовую выборки: 80 и 20 % соответственно).
Значения метрик качества обучения данных модели продемонстрированы на рис. 7.
Лучшей по R2 оказалась модель RandomForest. Данная модель показывает и лучший баланс точности: наибольший R2 и более низкие ошибки MAE/RMSE среди рассмотренных моделей.

Рис. 4. Обработка выбросов Примечание: составлен авторами по результатам данного исследования

Рис. 5. Фрагмент обработанного датасета Примечание: составлен авторами по результатам данного исследования

Рис. 6. Фрагмент программного кода для построения моделей регрессии Примечание: составлен авторами по результатам данного исследования

Рис. 7. Метрики качества моделей задачи регрессии Примечание: составлен авторами по результатам данного исследования

Рис. 8. Анализ метрик моделей задачи классификации Примечание: составлен авторами по результатам данного исследования
В целях решения бинарной задачи классификации представленные в датасете объекты были разбиты на два класса: 1 (если доля трудоустроенных выпускников больше медианного значения) и 0 (в остальных случаях). Качество обучения построенных моделей LogisticRegression, DecisionTree, RandomForest анализировалось по метрикам Accuracy (доля правильных ответов (0–1)), F1-мера (баланс точности и полноты (0–1)) и ROC_AUC (способность разделять классы (0–1)) (рис. 8).
Лучшей моделью выбрана RandomForest, так как она показала наибольшее значение ROC_AUC и баланс Accuracy/F1 на тестовой выборке.
Для решения задачи кластеризации, являющейся задачей обучения без учителя, предварительно был удален признак половой принадлежности выпускника (имеющий значения: мужской, женский, всего) и построены модели KMeans и Agglomerative (с применением метода главных компонентов PCA – метода снижения размерности данных с потерей наименьшего объема информации). Количество кластеров на основе elbow method было определено равным 3 (рис. 9).

Рис. 9. Модели кластеризации Примечание: составлен авторами по результатам данного исследования
По метрике silhouette_score оптимальной оказалась модель KMeans. Ее кластеры более компактны и лучше отделены друг от друга на данном наборе признаков. Полученные кластеры представляют собой группы образовательных организаций с высоким, средним и низким уровнем трудоустройства выпускников.
Заключение
Алгоритмы машинного обучения, являясь частью искусственного интеллекта, позволяют, обучаясь на данных, выявлять в них закономерности, в том числе скрытые, определять прогнозные значения исследуемых показателей на последующие временные периоды. Построенные модели машинного обучения могут использоваться как вспомогательный инструмент при условии дополнительной валидации, позволяющий оптимизировать процессы в исследуемых прикладных областях.
Представленное исследование продемонстрировало основные этапы проведения интеллектуального анализа данных об уровне трудоустройства и заработной платы выпускников высших и средних специальных учебных заведений.
Построенные модели машинного обучения могут быть применимы в решении задач предсказания исследуемых признаков и кластеризации в анализе деятельности учебных заведений.
Conflict of Interest
Acknowledgments
Funding
Bibliographic Reference
URL: https://top-technologies.ru/en/article/view?id=40901 (accessed: 04/09/2026).
DOI: https://doi.org/10.17513/snt.40901
