Вспомним использованные нами данные в первой части, которые были взяты из статьи "Ложь как психофизиологический феномен" .

PS OSS(1) OSS(2) OSS(3) OSS(4) OSS(5)
Ложь > Правда 17 13 16 18 18 17
Правда > ложь 3 7 4 2 2 3

Проведя биноминальный тест для каждого из алгоритмов, мы получили вот такой набор p-значений: 0.001, 0.132, 0.006, 0.0002, 0.0002, 0.001. "Неудачником" тут выглядит OSS(1). Может быть, он самый неточный тест, а может, ему просто не повезло с данными. На другом наборе он бы показал себя с лучшей стороны. Выборка из 20 элементов мала, и вполне вероятно, что и другие алгоритмы на другой такой же выборке показали себя иначе, может быть, даже и хуже. Над конкретными свойствами полученной, даже по всем правилам, выборки мы не властны. Её характеристики — это дело случая. И быть может, в другой раз или другой исследователь получит такие вот данные.

PS OSS(1) OSS(2) OSS(3) OSS(4) OSS(5)
Ложь > Правда 14 13 16 15 14 17
Правда > ложь 6 7 4 5 6 3

Выглядят они не так убедительно, как исходные данные, но давайте посмотрим, есть ли между этими наборами статистически значимая разница. Сравним два набора: (17, 13, 16, 18, 18, 17) и (14, 13, 16, 15, 14, 17). Вот тут как раз мы можем использовать критерий хи-квадрат, проверим с его помощью гипотезу об однородности. В результате получим р-значение = 0,991. Хи-квадрат решительно не видит никаких статистически значимых различий между этими наборами частот. Значит, второй гипотетический набор результатов алгоритмов вполне может реализоваться на каких-то случайно отобранных объектах. Проведя биноминальный тест для каждого из алгоритмов с гипотетическими результатами, получим следующий набор p-значений: 0.058, 0.132, 0.006, 0.021, 0.058, 0.001.

Если б мы выбрали для проверки гипотезы исследования только один какой-то алгоритм и сделали бы это добросовестно, то именно на этих данных мы с вероятностью 50% допустили бы ошибку пропуска цели: три алгоритма дали p-значение больше 0.05. Если использовать результаты всех алгоритмов, то получаем ситуацию неопределенности: три на три. А если ещё вспомнить про множественные сравнения, то надо применять, например, поправку Бонферрони. Делим 0.05/6 = 0.0083. Теперь надо считать результат значимым только в том случае, если p-значение < 0.0083. Получаем, что уже 4 алгоритма из шести — большинство — не подтверждают гипотезу исследования. Учитывая, что полученные значения находятся в районе 0.05 и выборка всего лишь 20 объектов, итогом исследования может быть только вывод о том, что необходима выборка большего размера для надёжной проверки гипотезы. В общем, в результате — отсутствие конкретного результата.

А вот если к этим (гипотетическим, но возможным) данным применить **знаковый перестановочный тест (permutation test) для связанных выборок** (см. часть 1), то получим p-значение = 0.012. И на уровне одной сотой, достаточно уверенно, можем подтвердить гипотезу исследования.

Таким образом, имеем: используя только один алгоритм, значительно увеличиваем шансы на ошибку первого рода — пропуск цели (открытия); анализируя результаты тестов по отдельности, также увеличиваем вероятность пропуска цели. Анализируя результаты алгоритмов в совокупности, существенно увеличиваем мощность теста и уменьшаем шансы на пропуск эффекта, который имеется в реальности. Больше алгоритмов — больше информации. Но алгоритмы должны быть действительно разными «взглядами на одну проблему», и они должны не быть избыточно коррелированными друг с другом / не дублировать одну и ту же ошибку.

Если кто из читателей знаком с **СППРП "Сокол"**, то ситуация ему может показаться знакомой. В ней также используется несколько алгоритмов оценки полиграмм и алгоритм **мета-оценщик**, который выдаёт своё решение на основе решения алгоритмов системы. И он точнее каждого из них, взятого по отдельности.

Вот так вот с помощью пермутационного теста можно сводить воедино результаты разных алгоритмов и извлекать из этого больше информации.

Допускаю, что пермутационный тест в силу непривычности может быть непонятным, сложным, неясно, как его применять — ведь надо программировать. Но есть вариант проще и привычнее. Можно обойтись одним старым знакомым биномиальным тестом. Для этого надо разработать комитет алгоритмов, например, комитет голосования по большинству голосов, тем самым значительно повысим мощность итогового теста (способность теста обнаружить эффект, если он есть).

Комитет по большинству — это просто. В каждом конкретном случае подсчитываем количество алгоритмов, которые голосуют за наличие эффекта. У нас чётное число алгоритмов, поэтому договримся, что если 4 и более алгоритма голосуют за наличие эффекта, то принимаем решение — эффект есть. Если 3 и менее — эффекта нет. В последнем случае имеется четыре исхода: 0 проголосовало, 1, 2, 3. В первом случае: 4, 5, 6. Если эффект отсутсвует (гипотеза исследования неверна) и алгоритмы выдают свои решения случайным образом с вероятностью 0.5, то комитет будет чаще выносить решение в пользу того, что эффекта нет. В таком случае вероятность того, что комитет вынесет решение за наличие эффекта, будет равна 0.34375 (не 0.5). Если б алгоритмов было нечётное количество, то комитет с вероятностью 0.5 голосовал бы «за» и с такой же вероятностью «против». Тут надо вспомнить формулу биноминального распределения.

Основные понятия теории вероятностей и статистики для анализа полиграмм

Формула биномиального распределения, где k — это количество алгоритмов, проголосовавших «за».
Далее вычислим вероятность, с которой комитет алгоритмов проголосует «за», если эффект в реальности отсутвует.

Расчёт вероятности консенсуса «за»

Теперь мы готовы к проверке гипотезы исследования, надо только рассмотреть имеющиеся данные и подсчитать, сколько раз комитет алгоритмов пришёл к консенсусу о том, что эффект имеется. Сделаем это для «плохих» гипотетических данных. Допустим, результат нашего эксперимента такой как на таблице ниже(распределение нулей и единиц практически не играет роли, главное — это маргинальные частоты), все исходы тестов и голоса алгоритмов помещены в таблицу, где 1 — голос «за», 0 — голос «против».

Таблица голосов
Нетрудно подсчитать по этой таблице, что комитет алгоритмов пришёл к консенсусу, что эффект имеется 14 раз, что он отсутвует 6 раз. Имеем такую табличку:

Результат Мета-алгоритм
За 14
Против 6

Результаты шести алгоритмов мы свели к одному мета-алгоритму. Теперь у нас нет связанных, зависимых данных. Мы можем использовать биномиальный тест с вероятностью в условиях нулевой гипотезы, равной 0.34375. Он выдаст нам такое p-значение = 0.0012. Гипотеза исследования подтверждается на уровне одной тысячной! В 10 раз более уверенно, чем в случае пермутационного теста.

Сейчас мы с вами имели дело с «мудростью толпы», с теоремой Кондорсе о жюри присяжных, о которой я писал в материале От баллов к вероятностям: математические основы достоверности в современной полиграфологии (часть 4).

Имеются и другие статистические техники, которые могут быть использованы для проверки гипотезы исследования Поповичева С.В., но эти можно назвать «золотым стандартом», поэтому ими и ограничимся.

Текст по ширине (выделите и нажмите кнопку)

PS

Касательно результатов исследования, изложенного в статье «Ложь как психофизиологический феномен» , можно добавить следующее. В одном из недавних выпусков APA Magazine есть статья, в которой имеются такие строки (OR — ориентировочная реакция, RLL — длина линии дыхания). Перевод этой статьи я опубликую.

Недавние попытки отделить обман от OR проводились с использованием парадигмы теста скрываемой информации (CIT). Ambach, Stark, Peper и Vaitl (2008) сообщили о результатах попыток разделить обман и ориентацию. Авторы пришли к выводу, что уменьшение показателей RLL является результатом обмана или подготовки к обману, а не процессов OR. Мы не до конца убеждены, что обман и OR являются взаимоисключающими процессами.
Возможно, альтернативным объяснением является то, что сам акт обмана (включая подготовку и исполнение) повышает значимость стимула. Было показано, что такое увеличение значимости приводит к более сильным OR (Gati & Ben-Shakhar, 1990; Siddle, Stephenson & Spinks, 1983; Stekelenburg & van Boxtel, 2001). Вполне вероятно, что обман и значимость неразрывно переплетены и их невозможно разделить. В эксперименте Ambach et al. увеличение сигнальной ценности из-за обмана явно повлияло на измерения RLL, что, по их мнению, было следствием различных ментальных процессов. Это указывает на наличие различий при введении обмана, но не доказывает окончательно, почему именно обман уменьшил RLL. Более экономное (парсимонийное) предположение состоит в том, что «обман» увеличил значимость этих целей, тем самым усилив OR.

Акт обмана повышает значимость стимула. Собственно, статья Поповичева С.В. о том же самом.

Итог:

  • Проблема: Малые выборки и отдельные алгоритмы ненадежны.
  • Решение: Используйте ансамбли/комитеты независимых алгоритмов.
  • Метод: Объединяйте результаты с помощью пермутационных тестов или простого голосования.
  • Результат: Значительно повысите надежность и точность ваших статистических выводов.