Сразу с места в карьер, без всяких прелюдий. В основе «Сокола-2», как и первого «Сокола», лежит пермутационный тест. Во втором — пермутационный тест на равенство средних. Идея его такая: если разницы в реагировании на Пв и Вл нет, то как ни обозначай данные теста, какую метку ни присваивай — Пв или Вл, для определения того, на какой тип сильнее реагирование, ничего не изменится. То есть в этом случае можно менять метки вопросов как угодно, сохраняя при этом общее количество Пв и Вл стимулов. Можно метки переставлять и каждый раз вычислять средние по группам Пв и Вл.

Как работает пермутационный тест — на пальцах

Представьте: у вас 18 карточек — 9 с пометкой «Пв» и 9 с пометкой «Вл». На каждой карточке четыре числа (реакции по четырём каналам). Вы раскладываете их на две стопки по меткам и считаете средние в каждой стопке. Получаете разность средних.

Теперь — ключевой шаг. Вы снимаете все метки, перемешиваете 18 карточек и заново делите на две случайные стопки по 9. Снова считаете разность средних. И так — тысячи раз.

Получается гора «случайных» разностей — это и есть пермутационное распределение. Оно показывает, какие разности вообще возможны, если Пв и Вл в среднем не отличаются (а различия — чистая случайность).

Осталось посмотреть, куда попала ваша настоящая разность. Если она затесалась где-то в середине горы — значит, такая разность легко возникает случайно, и оснований говорить о реальном различии нет. А если она торчит с самого края — значит, случай такое не организует, и различие настоящее.

Что происходит «под капотом»

  1. Считаем наблюдаемую разность средних (Пв − Вл) для каждой переменной.
  2. Объединяем все четыре разности в одну общую статистику (чтобы решить задачу по всем переменным сразу).
  3. Перемешиваем метки Пв/Вл — например, 100 000 раз — и каждый раз пересчитываем ту же статистику.
  4. Смотрим, какая доля случайных значений статистики оказалась не меньше наблюдаемой. Это и есть p-значение.

Никаких предположений о нормальности, равенстве дисперсий или независимости между каналами. Распределение строится из самих данных, а не берётся из готовой таблицы.

Смотрим на данные теста из второй части, на результат их анализа в пермутационном тесте.

Ниже представлены результаты многомерного пермутационного теста.

Физиологический канал Направление z-оценки Значение z Статус
Дыхание В сторону «Ложь» +0.1359
КГР (ЭДА) В сторону «Правда» -0.7703
ПГ (Плетизмо) В сторону «Правда» -0.4170
АД (Манжета) В сторону «Правда» -0.9288
Сумма (T) В сторону «Правда» -1.9802

z-оценка — стандартизованная разность средних, показывающая направление и величину эффекта в каждом канале

Глобальный односторонний тест (гипотеза «Пв > Вл по всем каналам одновременно»): p ≈ 0,9938.

Гипотеза не подтверждается — и это мягко сказано. По трём каналам из четырёх средние Пв не больше, а меньше средних Вл. Наблюдаемая статистика оказалась не на правом краю распределения (где она должна была бы быть для подтверждения «Пв > Вл»), а почти на левом — то есть результат смотрит в противоположную сторону.

Пермутационное распределение

Наблюдаемая статистика T отмечена пунктирной вертикальной линией. Подавляющее большинство разностей лежит правее вертикальной линии — они больше наблюдаемой T. Если площадь «колокола» принять за единицу, то площадь, отсекаемая от колокола пунктирной линией справа, равна 0,9938. Это и есть p-значение, полученное в проведённом тесте. Таким образом, гипотезу о том, что средние группы Пв больше среднего группы Вл, решительно не принимаем. Мы можем принять гипотезу о том, что Вл > Пв. P-значение для этой гипотезы — это площадь «хвостика» колокола слева от вертикальной пунктирной линии. 1 — 0,9938 = 0,0062.

  • Гипотеза 1 (Пв сильнее Вл): p = 0,9938 — это правосторонняя гипотеза.
  • Гипотеза 2 (Вл сильнее Пв): p = 0,0062 — это левосторонняя гипотеза.

Достоинства пермутационного теста
1. Не требует нормальности. t-тест не прошёл по КГР — распределение явно ненормальное. Пермутационный тест на это просто не смотрит: он строит распределение из данных, а не из формулы.

  1. Не требует независимости между каналами. Метод Фишера предполагает, что p-значения из разных тестов независимы. Но дыхание, КГР, ПГ и АД измерены на одном человеке — они коррелированы. Многомерный пермутационный тест обходит это: при каждом перемешивании все четыре канала двигаются вместе, как единый блок. Корреляция сохраняется и в наблюдаемых данных, и в случайных перестановках — и потому не искажает результат.

  2. Работает на малых выборках. 9 наблюдений в группе — это немного. Параметрические тесты на таких данных чувствительны к нарушениям допущений. Пермутационный тест — нет, потому что он не опирается на асимптотические приближения.

  3. Точные p-значения. При достаточном числе перестановок p-значение получается точным, а не приближённым. Не нужно доверять «достаточно ли велика выборка, чтобы тест сработал».

  4. Понятная логика. Идея «перемешать метки и посмотреть, что могло бы случиться» интуитивно ясна даже без статистического образования. Это важно для полиграфолога, который должен понимать, откуда берётся решение.

Таким образом, если мы в результате пермутационного теста получаем p-значение менее 0,05, то принимаем гипотезу о том, что Пв > Вл, что означает в рамках принятого нами исходного положения во второй части, что проверяемый сильнее реагировал на проверочные стимулы в тесте. Если (1 — p-значение) < 0,05, то реагирование проверяемого на Вл статистически значимо превышает его реагирование на Пв.

Такой способ принятия решения является научно и практически обоснованным. Именно так проверяют гипотезы в науке.

Можно было бы считать алгоритм законченным, и он бы заключался всего лишь в применении статистического теста. Но дело в том, что используемые в тесте данные малы. В таких условиях статистические тесты обладают небольшой мощностью. То есть, p-значение будет нечасто принимать значение меньше 0,05 и больше 0,95. Оценка на реальных данных показала, что это происходит только примерно в 40% случаев. Остальными 60% — p-значений болтаются где-то между 0,05 и 0,95, и решение не принимается. Для повышения мощности теста надо увеличивать количество данных, иначе говоря, увеличивать количество повторов теста. Но насколько это возможно сделать без того, что состояние проверяемого поменяется — не произойдёт привыкание, рассеятся внимание, наступит усталость и т. п., в результате чего данные будут искажены, не известно. Этот вопрос не изучен.

Но выход из положения есть. И тут мы переходим ко второй части алгоритма — к байесовскому анализу данных теста.

Для этого были изучены распределения натурального логарифма отношения p-значения к (1 — p-значение). В статистике p/(1 — p) называется шансами
. Конкретно для нашего случая это шансы того, что при верности нулевой гипотезы статистика теста примет наблюдаемое или меньшее значение. То есть, шансы p-значения для левосторонней гипотезы.

На выборке из ста тестов с известным решением Института полиграфологии Министерства обороны США (DoDPI), в которую входит 50 тестов с независимым подтверждением сокрытия информации, 50 с независимым подтверждением отсутствия сокрытия, были изготовлены калибровочные распределения отношения шансов. В каждом случае посчитали натуральный логарифм отношения p-значения левостороннего к p-значению правостороннего. Получили две выборки по 50 элементов со значениями натуральных логарифмов. Удалили из них выбросы. Построили гистограммы. Диаграммы qq-плотов. Провели тесты Шапиро-Уилка. P-значения получились 0.4211 и 0.8571. Построили теоретические нормальные распределения с оценками параметров, оценённых по выборкам. И теперь, используя априорную вероятность, по формуле Байеса можно вычислять оценку вероятности того, что человек скрывает информацию по теме проверки.

Исходные гистограммы калибровочных выборок.

Исходные гистаграммы калибровочных выборок
После удаления выбросов из калибровочных распределений в группе "Ложь" осталось 47 элементов, в группе "правда" 46. Выбросы удалялись на основе межквартильного размаха. Далее были построены диаграммы q-q-плот и проведены тесты Шапиро-Уилка на нормальность распределений.

Пермутационное распределение
Таким образом стало возможно не использовать ядерную оценку плотности (что вызвало бы у полиграфологов дополнительные затруднения для понимания как работает алгоритм ), а использовать теоретические нормальные распределения для калибровочных распределений.

И теперь с помощью теоремы Байеса имеется возможность дать оценку вероятности того к какому профилю реагирования принадлежит реагирование тестируемого лица. Касаться сути теоремы Байеса и его формулу мы не будем. Мы визуально поймём, что происходит, и как это всё делается, откуда берётся вывод. Сделаем на примере данных теста, которые мы видели во второй части. Помним, что наблюдаемая статистика теста Т = -1,9802, а наблюдаемый логарифм шансов (логит) равен Ln((1 - 0,9938)/0,9938) = -5,069

Пермутационное распределениеСлева имеем колокол нормального распределения группы не скрывавших информацию по проверочной теме, а справа — скрывавших. Их колокола всегда перекрываются, и поэтому всегда существует отличная от нуля вероятность, что профиль реагирования тестируемого принадлежит не к первой группе, а ко второй. И принять решение надо на основе оценки этой вероятности. Можно по этой визуализации принять качественное решение. Например, так: наблюдаемое значение логита (оранжевая пунктирная вертикальная линия) находится существенно дальше от центра распределения группы «Ложь», чем от центра группы «Правда». Отсюда вывод — профиль реагирования тестируемого, согласно калибровочным распределениям, соответствует профилю реагирования людей, отвечавших правду на проверочные вопросы. И так же объяснять принимаемое решение, если наблюдаемый логит находится справа от центров калибровочных распределений.

А как же численно выразить нашу уверенность? Оценка вероятности вычисляется по формуле Байеса, в которую входят априорные вероятности. На практике они всегда неизвестны и принимаются за 0,5 (что недалеко от истинного значения). Но в таком случае в формуле Байеса априорные вероятности сокращаются, и формула упрощается. Ниже с помощью рисунка показано, как вычисляется вероятность того, что профиль реагирования принадлежит группе «Ложь».

Пермутационное распределение

Вероятность принадлежности профиля к группе «Ложь» P = h1/(h1 + h2).

Словами: расстояние от оси х до «колокола» группы «Ложь», делённое на сумму расстояний до колоколов группы «Ложь» и группы «Правда».
Более научно это звучит так: h1 и h2 — это значения плотностей вероятностей калибровочных распределений "Ложь" и "Правда" в точке наблюдаемого логита. Геометрически это высота кривой в данной точке.

На основе полученной оценки вероятности можно принимать решение. Пороги выбраны на основе оценки баланса между ошибками первого и второго рода на калибровочных данных. Если принимать решение при P>0,5 то на калибровочных данных 89 профилей тестируемых определены правильно, в 11 случаях допущена ошибка (всего 100 тестов). Рекомендуется принимать решение при P>0,7. В этом случае на калибровочных данных 80% правильных решений, 7% ошибочных и 13% неопределённых исходов. При при P>0,9 решение можно принимать более уверенно. Результат на этой выборке примерно (плюс-минус) такой же как у известных американских алгоритмов. Но зато "Сокол2" полностью открытый, объяснимый и интерпретируемый алгоритм. Если необходима большая точность — добро пожаловать к другим алгоритмам СППРП "Сокол", но они не столь просты для понимания и интерпретации.

В итоге имеем два этапа работы алгоритма:

  1. Пермутационный тест на равенство средних. Если p-значение односторонней гипотезы менее 0,05 — принимаем решение. Иначе следующий пункт.
  2. На основе байесовского анализа и калибровочных распределений вычисляем оценку вероятности принадлежности профиля реагирования к той или иной группе. Если полученная более 70% — принимаем решение. Иначе неопределённый результат

Пермутационное распределение

В СППРП «Сокол» с помощью выбранной нейронной сети подготавливается автоматический отчёт, в котором все этапы работы алгоритма объясняются, данные интерпретируются и указывается, на основании чего принимается решение. Тут можно скачать его для ознакомления.

В конце отчёта всегда будет вот такой подобный параграф:

Примечание:
Вероятнее всего, человек скрывает информацию по теме проверки (так как вероятность этого > 0,9).
Эта вероятность не означает абсолютного доказательства правдивости/обмана. Она является статистической оценкой, зависящей от качества полиграфного обследования, корректности измерений показателей и обработки выбросов, применимости калибровочных распределений DoDPI и отсутствия существенных внешних факторов, влияющих на физиологические реакции.

Все пункты, кроме применимости калибровочных распределений DoDPI, должны обеспечиваться полиграфологом и являются его зоной ответственности.

И помните, что алгоритм — это только алгоритм, а всё остальное — это зона ответственности полиграфолога.