Разбор отчета вместе со мной

Практический урок по готовым примерам исследований: мы открываем результаты реалистичного исследования и читаем каждый показатель в том порядке, в котором это делал бы экзаменатор, изучая, что стоит включать в диссертацию, а что нет.

Почему этот урок

Реальные данные могут быть какими угодно, и многие тесты часто не дают значимых результатов, поэтому они мало чему учат в плане понимания работы самих тестов. Примеры исследований созданы специально, чтобы каждый тест содержал что-то достойное внимания: надежный конструкт и ненадежный, вопрос с обратной шкалой и различия между группами, которые можно выявить только с помощью апостериорных (post-hoc) сравнений. Данные получены с помощью генератора с фиксированным начальным числом (fixed-seed), поэтому одни и те же цифры отображаются на всех устройствах, и вы можете сверить то, что видите, с этой страницей.

Примечание: Данные предназначены для обучения, они не являются реальными, о чем указано в описании каждого исследования.

Четыре исследования

Код Исследование Ответы Зачем это здесь
SHOWCASE-MAIN Академическая вовлеченность и успеваемость 300 Каждый тест, требующий реальной выборки
SHOWCASE-PILOT Пилотное исследование: пре-тест 16 Точные тесты для малых выборок
SHOWCASE-POST Пилотное исследование: пост-тест 16 Парный t-критерий
SHOWCASE-BROKEN Намеренно «сломанное» исследование 24 Когда Pulseform отказывается выдавать число и почему

Если исследования есть в вашем аккаунте, откройте Опросы (Surveys), затем Просмотр ответов и результатов (View Responses & Results) для SHOWCASE-MAIN, а затем вкладку Академическая вовлеченность и надежность (Cronbach). Если их нет, изучите показатели здесь и выполните те же действия со своими данными.

Шаг 1: Сначала надежность

Конструкт Альфа Вердикт
Поведенческая вовлеченность 0.946 Отлично
Когнитивная вовлеченность 0.946 Отлично
Эмоциональная вовлеченность 0.948 Отлично
Вспомогательные факторы 0.482 Отклонено

Конструкт Вспомогательные факторы создан так, чтобы не пройти проверку: альфа ниже принятого порога 0.70 и даже ниже 0.60. Откройте таблицу вопросов и посмотрите на скорректированную корреляцию «пункт-общий балл» (corrected item-total correlation): она низкая для каждого вопроса. Именно так выглядит инструмент, который не измеряет единую концепцию.

Предупреждение: Не проводите проверку гипотез для конструкта, надежность которого отклонена. Укажите на эту слабость в диссертации и переформулируйте вопросы для следующего исследования.

Шаг 2: Вопрос с обратной шкалой

Вопрос «Я пропускаю лекции без уважительной причины» сформулирован отрицательно и отмечен в редакторе как Этот вопрос оценивается в обратном порядке (This item is reverse scored), поэтому его корреляция с конструктом положительная.

Попробуйте: Откройте вопрос в редакторе, снимите галочку Этот вопрос оценивается в обратном порядке и вернитесь на академическую вкладку. Альфа поведенческой вовлеченности упадет с 0.946 до менее чем 0.5, хотя ни один ответ не изменился. Затем снова поставьте галочку. Это показывает, почему каждый вопрос с обратной шкалой должен быть отмечен до того, как вы начнете читать результаты.

Шаг 3: Нормальны ли данные?

Асимметрия и эксцесс говорят о том, что конструкты вовлеченности и средний балл (GPA) нормальны, однако тест Шапиро-Уилка отклоняет все из них. Это не ошибка: при 300 респондентах Шапиро-Уилка отклоняет любое отклонение, каким бы малым оно ни было.

  • Опирайтесь на асимметрию и эксцесс для больших выборок и сообщайте о результатах Шапиро-Уилка с этой оговоркой, если того требует научный руководитель.
  • Часы в библиотеке действительно имеют асимметрию (+0.87), поэтому матрица корреляций рекомендует Спирмена. Удалите этот показатель из матрицы, и рекомендация сменится на Пирсона.

Шаг 4: Различия между группами

По полу (t-критерий для независимых выборок):

t(298) = 3.54, p < .001, d = 0.41, 95% CI [0.15, 0.52]

  • Доверительный интервал не содержит нуля: это то же самое утверждение, что и p < .001, но в единицах измерения шкалы.
  • d = 0.41 — это эффект от малого до среднего: различие статистически значимо, но невелико. В этом разница между значимостью и размером эффекта.

По специальности: F(2, 297) = 1.24, p = .290. Значимых различий нет, поэтому апостериорные сравнения не отображаются. Это результат, который нужно представить как есть, а не как «неудачный».

Шаг 5: Апостериорные сравнения раскрывают суть

По курсу обучения: F(3, 296) = 10.60, p < .001, η² = 0.097.

Один лишь ANOVA говорит «есть различия», что является половиной результата. Апостериорные сравнения (Тьюки и Шеффе) указывают на конкретные пары: первый и второй курсы похожи, третий и четвертый курсы похожи, а разрыв находится между этими двумя группами. Заметьте также, что Тьюки всегда ближе к значимости, чем Шеффе, поскольку это более мощный тест.

Шаг 6: Множественная регрессия

F(3, 296) = 345.31, p < .001, R² = .778

Предиктор β p
Поведенческая вовлеченность .613 < .001
Когнитивная вовлеченность .384 < .001
Эмоциональная вовлеченность .032 .341
  • Эмоциональная вовлеченность не является значимой, и ее доверительный интервал содержит ноль.
  • VIF находится в диапазоне от 1.45 до 1.50, поэтому ранжирование предикторов стабильно и может быть процитировано. Если бы значение было выше 5, ответ на вопрос «какой из них самый сильный?» был бы нестабильным.

Шаг 7: Факторный анализ подтверждает то, что сказала альфа

Появляется уведомление: «Вы объявили 4 конструкта; данные содержат 3». Это верно: три конструкта вовлеченности образуют свои собственные факторы, в то время как вспомогательные факторы не образуют ни одного, о чем уже говорила альфа (0.482).

Совет: Это результат исследования вашего инструмента, а не ошибка анализа. Вы можете написать: «Факторный анализ выделил три фактора; пункты вспомогательных факторов не загрузились на отдельный фактор, что согласуется с их низкой надежностью (α = 0.482)».

Шаг 8: Малые выборки и пре/пост-тесты

  • В SHOWCASE-PILOT (8 человек в группе) Pulseform вычисляет точное значение p (0.0014) путем перебора всех возможных разбиений вместо аппроксимации. Это «Exact Sig.» из SPSS, и именно его следует указывать.
  • Сравнивая SHOWCASE-PILOT с SHOWCASE-POST, Pulseform сопоставляет каждого человека с самим собой по коду респондента: t(15) = 2.40, p = .030, d = 0.60. Средние значения различаются всего на 0.42; если рассматривать их как две независимые выборки, значимых различий не будет. См. Пре/пост опросы.

Шаг 9: Когда Pulseform отказывается

Откройте SHOWCASE-BROKEN. Каждый изъян в нем намерен:

Что в данных Что говорит Pulseform
Все дали одинаковый ответ на конструкт Альфа неприемлема, корреляция невычислима, а не «ноль»
Конструкт из одного вопроса Альфа неприменима
Два идентичных вопроса Идеальная корреляция без доверительного интервала; регрессия и факторный анализ отклонены
23 мужчины и одна женщина Пол нельзя сравнить
6 специальностей среди 24 человек Таблица сопряженности слишком разрежена для хи-квадрата

Отказ — это информация, а не ошибка. Вводящее в заблуждение число хуже, чем его отсутствие: «r = 0» попало бы в вашу диссертацию как результат, который данные не подтверждают. И заметьте, что отказ описывает первое препятствие, с которым столкнулся расчет, поэтому сузьте выборку, чтобы увидеть остальные.

Что дальше