Введение
Современная теория тестирования (Item Response Theory, IRT) представляет собой семейство вероятностных моделей, связывающих наблюдаемый отклик испытуемого с латентной способностью и параметрами задания. Такие модели, как однопараметрическая модель Раша, двух- и трехпараметрическая логистические модели, были разработаны преимущественно для стандартизированных дихотомических тестов и ориентированы на измерение одномерного конструкта. Расширение сферы применения IRT на политомические отклики привело к появлению моделей градуированного отклика (GRM) [1] и обобщенной модели частичного кредита (GPCM) [2], а учет субъективности экспертного оценивания – к многофасетной модели Раша (MFRM) [3, 4]. В последние годы активно развиваются модели, ориентированные именно на учет строгости экспертов и неоднородность формата заданий: предложены спецификации обобщенной модели частичного кредита с параметром строгости и его дрейфом в процессе оценивания [5], байесовские варианты многофасетной модели Раша с марковским моделированием дрейфа строгости [6], многомерные модели теории тестирования для оценивания письменных работ [7]. Вопросы устойчивости оценивания политомических моделей при малых выборках исследуются с использованием имитационного моделирования [8]. Предложены спецификации для учета «центрированности» оценок в рамках иерархической рейтинговой модели [9], когнитивно-диагностические модели эффектов эксперта [10], а также иерархические фасетные модели, совместно анализирующие выставленные баллы и затраченное на оценивание время [11]. Развиваются и методы согласования в случае ручной и автоматической проверки ответов, в том числе подходы к выравниванию баллов в рейтинг-опосредованном оценивании [12].
В то же время сложившаяся практика проведения промежуточной аттестации в российских образовательных организациях высшего образования формирует ряд требований, которые не в полной мере учтены каждым из указанных классов моделей по отдельности. Современные федеральные государственные образовательные стандарты ориентированы на компетентностный подход, при котором результат освоения образовательной программы описывается через совокупность формируемых у обучающегося компетенций. При этом компетенции не противопоставляются традиционной триаде «знания – умения – навыки», а содержательно опираются на нее: знания образуют теоретическую основу деятельности, умения характеризуют способность применять эти знания при решении учебных и профессионально ориентированных задач, а навыки отражают степень освоения устойчивых способов выполнения действий. Типичный экзаменационный билет, как правило, включает три взаимосвязанных компонента: тестовую часть с закрытыми заданиями различных форматов, допускающими автоматизированную проверку; задание, ориентированное на оценку умений обучающегося; задание, позволяющее выявить уровень сформированности практических навыков. Последние два компонента обычно оцениваются экспертным способом на основе рубрик, что связано с неизбежным элементом субъективности при интерпретации результата и выставлении итоговой оценки.
Применение рассмотренных IRT-моделей к такой структуре экзамена имеет ряд ограничений. Во-первых, экзаменационные задания неоднородны – задания закрытого типа преимущественно проверяют воспроизведение и распознавание знаний, тогда как задания открытого типа направлены на оценку умений и навыков, связанных с самостоятельным решением задач. Во-вторых, частичный балл формируется по-разному: в закрытых заданиях он складывается из отдельных элементов ответа, а в открытых определяется экспертом целостно по шкале критериев. В-третьих, экспертное оценивание неизбежно содержит субъективный компонент, поскольку разные преподаватели могут отличаться степенью строгости. Отдельные модели учитывают эти особенности лишь частично. MFRM позволяет корректировать влияние эксперта, но не описывает неоднородность компонентов экзамена. GPCM и GRM применимы к заданиям с частичным баллом и упорядоченными категориями, однако не объединяют разные механизмы оценивания.
Цель исследования – разработка и теоретическое обоснование многокомпонентной IRT-модели оценивания результатов промежуточной аттестации, объединяющей GPCM для закрытых заданий и GRM с параметром экспертной строгости для открытых заданий.
Материалы и методы исследования
Формализацию модели начнем с описания латентной структуры. Каждому студенту i = 1,…,N сопоставим вектор латентных способностей:
θi = (θiK, θiU, θiN),
где θiK – латентная способность по компоненту знаний; θiU – латентная способность по компоненту умений; θiN – латентная способность по компоненту навыков.

где Σ – ковариационная матрица латентных способностей.
Экзамен состоит из трех компонентов
где K – знания (закрытые задания с автоматической проверкой); U – умения (открытые задания); N – навыки (открытые задания).
Обозначим: j = 1,…,Jk – индекс задания в компоненте k, где Jₖ – количество заданий;
mjk – максимальный балл за отдельное задание j в компоненте k;
ajk– параметр дискриминативности;
bjk,c – пороговый параметр трудности c задания j в компоненте k;
wjk – весовой коэффициент задания j в компоненте k, определяемый как отношение максимального балла за задание к суммарному максимальному баллу компонента;
δr – параметр строгости эксперта (преподавателя) r для открытых заданий.
Для заданий закрытого типа (компонент K) мы опираемся на обобщенную модель частичного кредита (GPCM), дополнив ее весовыми коэффициентами, чтобы учесть разный вклад заданий в итоговый балл компонента. Пусть
наблюдаемый балл студента i за задание j компонента знаний. Тогда вероятность получения категории c:

где 
Таким образом,

Для заданий открытого типа (компоненты U и N) применим модифицированную модель градуированного отклика (GRM), дополненную параметром экспертной строгости. При экспертной проверке практических работ преподаватель фактически принимает решение по упорядоченной шкале качества. Кумулятивная логика GRM естественно отражает именно такую последовательную природу суждения: {«не приступил» < «частично верно» < «в основном верно» < «полностью верно»}. Кумулятивная вероятность получения балла не ниже порога c:

Вероятность конкретной категории с:

при условиях 
То есть

Тогда полное правдоподобие наблюдений для одного студента записывается в виде произведения по всем заданиям трех компонентов:

где 
При переходе к полной выборке в модель дополнительно включается плотность φ3(θi | 0,Σ), задающая трехмерное нормальное распределение латентных способностей обучающегося с нулевым математическим ожиданием и ковариационной матрицей Σ.
Для оценки параметров модели воспользуемся методом предельного максимального правдоподобия (MML) [13], рассматривая латентные способности как ненаблюдаемые случайные величины, по которым выполняется интегрирование. Вычислительно эта задача решается итеративным EM-алгоритмом.
Пусть имеются наблюдения X = {Xi} для i = 1,…,N студентов. Вектор всех параметров заданий и экспертов обозначим
Условная функция правдоподобия для одного студента при фиксированном θi:

Функция правдоподобия получается интегрированием по латентным способностям:

Логарифм функции правдоподобия:

EM алгоритм на каждом шаге попеременно уточняет оценки
и
Содержательно E-шаг отвечает на вопрос «где, вероятнее всего, расположен каждый студент в латентном пространстве при текущих параметрах». На итерации (t) при текущих оценках параметров Ω(t), Σ(t) для каждого студента i вычисляется апостериорная плотность латентных способностей по формуле Байеса:

Ожидаемое полное логарифмическое правдоподобие (Q-функция), максимизируемое на M-шаге, имеет вид

Здесь проявляется удобное свойство выбранной структуры: благодаря аддитивности логарифма Q-функция декомпозируется на три слагаемых, соответствующих компонентам K, U, N, плюс слагаемое для ковариационной матрицы

где


(и аналогично для QN), а также 
Интеграл по θi = (θiK, θiU, θiN) не имеет аналитического решения, поэтому его приходится аппроксимировать численно. Используем квадратуру Гаусса – Эрмита [13]. Пусть {θq, wq}, q = 1,…,Q – набор узлов и весов одномерной квадратуры, а Q3 – размер полной трехмерной сетки. Тогда

где
– узел сетки. При ненулевых корреляциях между компонентами Σ применяется разложение Холецкого Σ = LL׳ и узлы трансформируются θq → Lzq , где zq – стандартные узлы. На практике можно взять 15–21 узлов на каждое измерение, что при трех измерениях дает Q3 ≈ 3375–9261 узлов.
На E-шаге для каждого студента i вычисляются апостериорные вероятности узлов квадратуры:

Затем для каждого задания j компонента k и каждой категории c вычисляются ожидаемые «достаточные статистики»

и ожидаемое количество студентов в узле 
M-шаг заключается в пересчете параметров заданий посредством раздельной максимизации каждого слагаемого Q-функции. Далее выполняется обновление параметров GPCM (компонент K). Для каждого задания j компонента знаний максимизируется:

Максимизация выполняется методом Ньютона – Рафсона с использованием матрицы Гессиана соответствующего слагаемого.
Обновление параметров GRM (компоненты U, N) – для каждого задания j компонентов умений или навыков максимизируется:

Ковариационная матрица Σ обновляется на основании апостериорных ожиданий с использованием квадратуры
.
Поскольку полученная на этом шаге матрица в общем случае не удовлетворяет условиям идентифицируемости (σkk = 1), то выполняется перенормировка

что фактически переводит ковариационную матрицу в корреляционную. Соответственно корректируются параметры заданий
и 
Стандартные ошибки получаются из наблюдаемой информационной матрицы Фишера, а поскольку речь идет об MML-оценках с проинтегрированными латентными переменными, то целесообразно применить тождество Луи [14], выражающее наблюдаемую информацию через score-функцию полных данных:

где
вектор score-функции для полных данных, а Ei(∙) – ожидание по апостериорному распределению 
Стандартные ошибки вычисляются по формуле

Для обеспечения идентифицируемости модели вводятся следующие ограничения:
μ = 0; σkk = 1 для всех k;
.
Для анализа соответствия отдельных заданий параметрам модели применяются два среднеквадратичных показателя: взвешенный показатель Infit и невзвешенный показатель Outfit [15]. Показатель Outfit характеризует общую величину отклонений наблюдаемых ответов от модельных ожиданий и для задания j определяется как среднее значение квадратов стандартизованных остатков

Показатель Infit учитывает вес каждого наблюдения и потому является более чувствительным к отклонениям в той области шкалы, где задание наиболее информативно. Он вычисляется по формуле

где
а весовой коэффициент определяется как Wij = Var(Xij). Значения Infit и Outfit, близкие к единице, свидетельствуют о согласовании эмпирических данных с модельными предпосылками. В прикладных исследованиях в качестве приемлемого обычно рассматривается диапазон от 0,7 до 1,3.
Для политомических заданий дополнительно используется обобщенная статистика [16] S – X 2, позволяющая учитывать оценку латентной способности испытуемых. Данный показатель основан на сравнении наблюдаемых и ожидаемых частот баллов в группах респондентов, сформированных по суммарному тестовому результату. Для задания j статистика имеет вид

где Ojg обозначает наблюдаемую долю ответов в балльной группе g, а Ejg – соответствующую модельную долю.
На уровне модели в целом применяется ограниченно-информационная статистика согласия M2 [17]. На ее основе определяется показатель корневого среднеквадратичного приближения

Значения RMSEA [17] ниже 0,06 обычно интерпретируются как свидетельство хорошего согласия модели с данными.
Результаты исследования и их обсуждение
Для оценки параметров модели разработан программный модуль на языке Python (библиотеки NumPy, SciPy, Pandas), реализующий вычисление вероятностей GPCM и GRM, апостериорных весов квадратурных узлов, Q-функции и ее градиентов. Прежде чем применять предложенную модель к эмпирическим данным, необходимо убедиться в корректности восстановления ее параметров в контролируемых условиях. Особое значение имеет идентифицируемость параметров экспертной строгости δr в ситуации, когда каждый преподаватель, как правило, оценивает работы только закрепленных за ним учебных групп. В таких условиях индивидуальная строгость эксперта может быть смешана с реальным уровнем подготовки соответствующей группы.
Для проверки возможности разделения этих эффектов был проведен численный эксперимент методом Монте-Карло. Его цель состояла в том, чтобы установить, позволяет ли модель за счет общего автоматически проверяемого компонента K отличить влияние строгости преподавателя от различий в уровне подготовленности обучающихся. Сгенерировано 500 наборов данных (N = 200, девять учебных групп по три на каждого из трех преподавателей) с истинными значениями строгости δ₁ = 0,30, δ₂ = −0,45, δ₃ = 0,15 (Σᵣδᵣ = 0) и реалистичной неоднородностью групп (±0,15 SD по уровню подготовки). Компонент K моделировался 30 политомическими – заданиями (18 дихотомических, 6 с m = 3, 6 с m = 4), компоненты U и N – одним заданием с семью градациями каждый.
Латентные уровни подготовленности и параметры заданий генерировались из стандартных распределений, а параметры строгости преподавателей задавались фиксированными значениями с нулевой суммой: θᵢ ~ N3(0, 1), βⱼ ~ N3(0, 1), δ₁ = 0,30, δ₂ = −0,45, δ₃ = 0,15 (Σᵣ δᵣ = 0),τ₁ < τ₂ < … < τₘ, где θᵢ – латентный уровень обучающегося, βⱼ – трудность (положение) задания, δᵣ – параметр строгости (фасета) преподавателя, τₖ – пороги категорий политомического задания. Порождающая модель для смежных категорий имеет вид

где aⱼ – параметр дискриминации задания. Дискриминации aⱼ при генерации задавались из логнормального распределения с медианой около единицы (умеренная дискриминация), а пороги категорий τₖ – как упорядоченные приращения, обеспечивающие условие τ₁ < τ₂ < … < τₘ. Условия эксперимента: N = 200 обучающихся, 30 заданий закрытого блока (1–4 категории) и открытые задания (до 7 категорий), 3 преподавателя, девять учебных групп; выполнено 500 повторов Монте-Карло. Инициализация: aⱼ = 1, βⱼ и пороги – равномерная сетка, δᵣ = 0, ковариационная матрица – единичная. Критерий сходимости – относительное изменение логарифма маргинального правдоподобия |ΔlnL| < 10⁻⁴ при максимуме 150 итераций, несошедшиеся запуски исключались из агрегирования, их доля в проведенном эксперименте равна нулю.
Результаты симуляции. Для каждого из 500 повторов вычислялись оценки параметров экспертной строгости δ̂ᵣ, оценки параметров заданий (a, b), их стандартные ошибки и эмпирическое покрытие 95 %-х доверительных интервалов. Сводные результаты по параметрам экспертной строгости представлены в табл. 1.
Как следует из табл. 1, смещение оценок параметров δᵣ не превышает 0,02, а значения среднеквадратичной ошибки (RMSE) близки к эмпирическому стандартному отклонению оценок. Это указывает на отсутствие выраженной систематической ошибки при оценивании экспертной строгости. Эмпирическое покрытие 95 %-ных доверительных интервалов находится в пределах 93,4–94,2 %, то есть в целом соответствует номинальному уровню. Незначительное снижение на 0,8–1,6 процентных пункта можно считать ожидаемым для методов, основанных на асимптотической нормальности при конечном объеме выборки. Оно не свидетельствует о наличии устойчивых проблем в оценивании стандартных ошибок.
Таким образом, при наличии общего автоматически проверяемого компонента K, играющего роль якоря для многомерной калибровки, модель обеспечивает корректную идентифицируемость δᵣ даже при полностью разделенных экспертах и устойчива к реалистичной неоднородности групп. В отсутствие якорного компонента схема с непересекающимися экспертами требует перекрестной проверки части работ.
Рассмотрим применение модели на реальных данных на примере зачета по дисциплине «Информационные технологии». Согласно рабочей программе и ФОС, зачет проводится по 100-балльной шкале и включает три компонента: тест на знания (40 баллов), задание на умения (30 баллов) и задание на навыки (30 баллов). Выборка составила 226 студентов 1-го курса 10 учебных групп.
Компонент «Знания» состоит из 30 закрытых заданий (18 с единственным верным ответом; 6 с множественным выбором; 6 на сопоставление) и проверяется автоматически в Moodle.
Таблица 1
Восстановление параметров экспертной строгости
|
Параметр |
Истинное |
Среднее |
SD |
Смещение |
RMSE |
95 % ДИ |
|
δ₁ |
+0,30 |
+0,29 |
0,09 |
−0,010 |
0,091 |
94,2 % |
|
δ₂ |
−0,45 |
−0,43 |
0,11 |
+0,020 |
0,112 |
93,4 % |
|
δ₃ |
+0,15 |
+0,14 |
0,10 |
−0,010 |
0,100 |
93,8 % |
|
Среднее |
– |
– |
0,10 |
0,013 |
0,101 |
93,8 % |
Примечание: составлена авторами на основе полученных данных в ходе исследования.
Таблица 2
Описательная статистика баллов по компонентам зачета
|
Компонент |
Max |
M |
SD |
Min |
Max набр. |
α |
|
Знания (K) |
40 |
26,1 |
7,8 |
4 |
40 |
0,76 |
|
Умения (U) |
30 |
18,9 |
8,2 |
0 |
30 |
– |
|
Навыки (N) |
30 |
19,2 |
8,5 |
0 |
30 |
– |
|
Итого |
100 |
63,2 |
18,2 |
11 |
97 |
– |
Примечание: составлена авторами на основе полученных данных в ходе исследования.
Компоненты «Умения» и «Навыки» представлены по одному практическому заданию в офисном ПО (работа в табличном и текстовом процессорах соответственно), каждое максимумом 30 баллов, проверяется преподавателем по рубрике с семью градациями (0, 5, 10, 15, 20, 25, 30). Десять групп распределены между четырьмя преподавателями неравномерно: r = 1 – группы 1–3 (n₁ = 66), r = 2 – группы 4–6 (n₂ = 69), r = 3 – группы 7–8 (n₃ = 46), r = 4 – группы 9–10 (n₄ = 45). Средний суммарный балл за зачет составил 63,2 (SD = 18,2), медиана 65 баллов. Описательная статистика баллов по компонентам зачета приведена в табл. 2.
Коэффициент альфа Кронбаха для 30 заданий компонента K составил α = 0,76, что свидетельствует о приемлемой внутренней согласованности теста. Для компонентов U и N, содержащих по одному заданию, расчет α не применим.
Корреляция Пирсона между компонентами составила: r(K, U) = 0,51, r(K, N) = 0,46, r(U, N) = 0,63. Наибольшая связь отмечается между компонентами умений и навыков, а более низкие корреляции с компонентом знаний согласуются с представлением о теоретическом знании и практическом владении как о частично различных конструктах.
Для оценки параметров модели был использован метод MML с 15 узлами квадратуры Гаусса – Эрмита. EM-алгоритм сошелся за 108 итераций (критерий: |Δℓ*| < 10⁻⁴). Предельное логарифмическое правдоподобие при сходимости составило ℓ* = −19 783,9. Параметры заданий компонента знаний представлены в табл. 3. Средняя дискриминативность заданий составила ā = 1,08 (SD = 0,41), что соответствует умеренной дифференцирующей способности. Наибольшую дискриминативность показали задания на сопоставление (ā = 1,29), наименьшую – задания с единственным выбором (ā = 0,94). Средняя трудность варьировалась от b̄ = −1,58 (наиболее легкое задание) до b̄ = 1,82 (наиболее трудное). Два задания продемонстрировали низкую дискриминативность (a < 0,5), что может свидетельствовать о необходимости переработки таких заданий. Пригодность модели оценивалась по критериям согласованности с данными. В среднем задания демонстрируют приемлемое соответствие IRT-модели, однако диагностика на уровне отдельных заданий выявила два задания с повышенными значениями Outfit и статистически значимым S – X 2, что указывает на необходимость их содержательного пересмотра (табл. 4).
На уровне модели в целом получены значения, соответствующие хорошему согласию: RMSEA = 0,031 (< 0,06), SRMSR = 0,047 (< 0,08); статистика согласия M2 не показала значимого расхождения модельной и эмпирической структур ассоциаций (p > 0,05). Анализ согласия на уровне испытуемых не выявил аномальной доли нетипичных индивидуальных профилей. Совокупность этих результатов подтверждает, что предложенная спецификация адекватно описывает структуру наблюдаемых данных по всему диапазону способностей.
Таблица 3
Параметры заданий компонента знаний (GPCM)
|
Тип задания |
Кол-во |
mⱼ |
ā (SD) |
b̄ (SD) |
Infit M |
Outfit M |
|
Единств. выбор |
18 |
1 |
0,94 (0,33) |
−0,08 (0,97) |
1,03 |
1,06 |
|
Множеств. выбор |
6 |
3 |
1,14 (0,30) |
0,19 (0,72) |
0,91 |
0,97 |
|
Сопоставление |
6 |
4 |
1,29 (0,45) |
0,32 (0,61) |
0,94 |
0,96 |
|
Все задания |
30 |
– |
1,08 (0,41) |
0,06 (0,89) |
0,99 |
1,02 |
Примечание: составлена авторами на основе полученных данных в ходе исследования.
Таблица 4
Значения статистик по отдельным заданиям
|
№ |
Компонент |
Тип задания |
Кат. |
a (SE) |
b / пороги (SE) |
Infit |
Outfit |
S–X ² (df) |
p / p(BH) |
Решение |
|
21 |
K |
множественный выбор |
3 |
– |
– |
1,25 |
1,41 |
95,0 (20) |
< 0,001 / < 0,001 |
пересмотр |
|
27 |
K |
сопоставление |
4 |
– |
– |
1,20 |
1,37 |
66,4 (27) |
0,002 / 0,006 |
пересмотр |
Примечание: составлена авторами на основе полученных данных в ходе исследования.
Таблица 5
Оценки параметра фасета преподавателя
|
Препод. |
δᵣ |
SE |
z |
p |
p (Holm) |
|
1 |
+0,33 |
0,07 |
4,71 |
< 0,001 |
< 0,001 |
|
2 |
−0,39 |
0,09 |
−4,33 |
< 0,001 |
< 0,001 |
|
3 |
+0,24 |
0,10 |
2,40 |
0,016 |
0,033 |
|
4 |
−0,18 |
0,10 |
−1,80 |
0,072 |
0,072 |
Примечание: составлена авторами на основе полученных данных в ходе исследования.
Параметры заданий компонентов умения и навыки. Дискриминативность задания на умения (работа в табличном процессоре) составила a_U = 1,74 (SE = 0,19), задания на навыки (создание составного документа) – a_N = 1,91 (SE = 0,22). Высокие значения дискриминативности закономерны: открытые задания с развернутым ответом и широкой шкалой оценивания (7 категорий) обладают значительно большей информативностью, чем отдельные закрытые вопросы.
Параметры строгости при ограничении Σδᵣ = 0 представлены в табл. 5: наибольшее положительное значение параметра фасета получено для преподавателя 1, наибольшее отрицательное – для преподавателя 2. Разности δ₁ − δ₂ = 0,72 (z = 6,31, p < 0,001) и δ₃ − δ₄ = 0,42 (z = 2,97, p < 0,01) статистически значимы. В пересчете на балльную шкалу компонента умений (30 баллов) разница между крайними экспертами эквивалентна приблизительно 4,2 балла. Поскольку каждый преподаватель проверяет только свои группы, выявленные различия могли бы частично отражать различия в подготовке групп; однако общий компонент K (идентичная для всех автоматическая проверка) позволяет калибровать способности на единой шкале, а средние значения θ̂ᵢᴷ по десяти группам близки (от −0,07 до 0,09, SD = 0,05), что согласуется с интерпретацией δᵣ как возможных различий строгости при принятых модельных предпосылках. Полученные различия следует рассматривать как статистические индикаторы возможных рэйтер-эффектов.
Результаты использования предложенной модели при анализе итогов промежуточной аттестации (зачета) по информационным технологиям позволяют сформулировать следующие выводы. Установленная латентная структура показывает, что связи между выделенными компонентами являются не настолько высокими, чтобы рассматривать их как проявление единого недифференцированного результата. Это означает, что объединение итогов зачета/экзамена в один общий балл способно скрывать существенные различия в уровне сформированности знаний, умений и навыков обучающегося. Практическое значение имеют различия в дифференцирующей способности заданий различных форматов, представленные в табл. 3. Задания, предполагающие градуированную шкалу ответа, обладают большей информативностью относительно латентной способности испытуемого. Поэтому при ограниченном объеме тестовой части увеличение доли таких заданий может рассматриваться как один из способов повышения точности измерения и более надежного различения уровней подготовленности студентов. Особого внимания заслуживают выявленные статистически значимые различия параметра фасета преподавателя, интерпретируемые как возможные различия строгости оценивания при принятых модельных предпосылках, поскольку она непосредственно связана с проблемой справедливости оценивания. В высших учебных заведения преподаватели, как правило, закрепляются за определенными учебными группами, вследствие чего студент фактически не имеет право выбора, кому сдавать зачеты и экзамены. В такой ситуации итоговая оценка может зависеть не только от уровня подготовки обучающегося, но и от индивидуальной строгости назначенного преподавателя. Предложенная модель позволяет диагностировать подобную статистическую неоднородность на единой латентной шкале. Под корректировкой смещения здесь понимается не изменение первичных баллов и не автоматический пересмотр официальных отметок, а модельный расчет латентной оценки с учетом параметра фасета преподавателя
,
где δ̂ – оцененный параметр фасета преподавателя. Главное ограничение исследования состоит в том, что перекрестной проверки открытых работ двумя независимыми преподавателями не проводилось. Поэтому оценки фасета преподавателя нельзя считать окончательно доказанным индивидуальным эффектом строгости. Корректнее трактовать их как статистические индикаторы возможных рэйтер-эффектов, полученные при принятых предпосылках модели. В практическом отношении модель следует рассматривать как диагностический инструмент для выявления потенциальных рэйтер-эффектов, требующих дополнительной экспертной проверки. Использование таких результатов для пересмотра оценок обучающихся возможно только при наличии утвержденной процедуры и независимой экспертизы.
Заключение
В настоящей работе предложена многокомпонентная IRT-модель оценивания результатов промежуточной аттестации. Эмпирической основой для формализации послужила нормативно-правовая база и фонды оценочных средств ФГБОУ ВО «Байкальский государственный университет». Отличительной чертой предложенной модели является возможность описания в рамках единой спецификации различных по форме и способу проверки элементов экзаменационной процедуры, включая автоматически оцениваемую тестовую часть и открытые задания, проверяемые экспертом.
Практическая проверка модели была проведена на материалах зачета по дисциплине «Информационные технологии» и показала возможность ее применения в реальных условиях образовательного процесса. Симуляционный эксперимент в контролируемых условиях показал возможность восстановления параметров фасета преподавателя при наличии общего автоматически проверяемого якорного компонента, а эмпирическая апробация выявила статистически значимые различия этих параметров, интерпретируемые как возможные различия строгости оценивания при принятых модельных предпосылках.
Конфликт интересов
Финансирование
Библиографическая ссылка
Родионов А.В., Торопов В.Д. МНОГОКОМПОНЕНТНАЯ МОДЕЛЬ ТЕОРИИ ТЕСТИРОВАНИЯ ДЛЯ ПРОМЕЖУТОЧНОЙ АТТЕСТАЦИИ С РАЗНОРОДНЫМИ ФОРМАМИ ЗАДАНИЙ // Современные наукоемкие технологии. 2026. № 7. С. 162-171;URL: https://top-technologies.ru/ru/article/view?id=40872 (дата обращения: 12.08.2026).



