Описание картинки По дошедшим до меня слухам, в прошлом году на конференции «Легенда» Поповичев С. В. выступил с критикой мета-анализа АПА от 2011 года. Суть критики мне известна условно, она нигде не публиковалась, поэтому я упомяну о ней только в плане того, чтобы оттенить суть статьи (сокращенного перевода), которую предлагаю к вашему вниманию. Мол, не только наши специалисты, но и сами американцы критикуют мета-анализ. Позволю себе остановиться на двух аспектах критики, приведённой в этой статье:
1. Реальные распределения отличаются от нормальных, и поэтому нормальное нельзя использовать, это приводит к ошибке.
Немножко критики критики... Одного утверждения об отличии недостаточно для того, чтобы говорить о неправильности и ошибке. Слов недостаточно — необходимо вопрос изучать конкретно и предметно: определить, есть ли статистически значимое различие; если есть, то велик ли эффект, а может быть он столь мал, что им вполне можно пренебречь?; а имеющаяся разница, пусть и с большим эффектом, действительно приводит к большой ошибке классификации полиграмм? А может быть опять верно, что привносимая ошибка находится в пределах погрешности? В общем, одного утверждения недостаточно.

  1. В таблицах мета-анализа много ошибок. А вот тут да. И это касается не только мета-анализа. Во многих работах американцев присутствуют ошибки и путаница с числами в таблицах. Это говорит о небрежном подходе в работе с данными. Что недопустимо, так как все выводы делаются на основе этих данных. Так что за американцами надо обязательно перепроверять..

Перевод статьи APA Magazine

Как метааналитическое исследование Американской ассоциации полиграфологов не смогло обосновать использование скрининговых тестов по нескольким вопросам

I. СИНОПСИС

Полиграф — это криминалистический тест, направленный на выявление обмана в отношении рассматриваемого вопроса; чаще всего он представлен в форме теста сравнения вопросов (CQT). Заключение по тесту обычно формируется экспертом путем визуальной оценки с использованием модели анализа данных теста (TDA), которая сопоставляет физиологическое возбуждение между релевантными и контрольными вопросами.

В 2011 году Американская ассоциация полиграфологов (APA) опубликовала «Метааналитическое исследование точности критериев валидированных методов полиграфа». Этот документ представлял собой отчет комитета, задачей которого было выявление валидированных форматов полиграфа и моделей оценки TDA, соответствующих определенным требованиям к точности и частоте безрезультатных (неубедительных) ответов, установленным Комитетом. Данный отчет использовался для обоснования обязательного применения валидированных методов в Стандартах практики APA с целью стандартизации проведения полиграфологических экспертиз.

Как директор школы подготовки специалистов по полиграфу, автор на протяжении нескольких лет был обеспокоен вариативностью экспертной оценки CQT и различными пороговыми значениями (cut scores), публикуемыми для принятия решений по тесту. В 2015 году Нельсон и Хэндлер опубликовали статью о статистических референтных распределениях для полиграфов с вопросами сравнения, которая включает средние баллы тестов и стандартные отклонения, полученные на основе различных форматов и моделей оценки, рассмотренных в метааналитическом исследовании APA. Автор обнаружил несоответствия в референтных распределениях, которые ставят под сомнение качество метааналитического исследования APA и методологию сбора данных.

Автор также отметил, что отчет Национальной академии наук (NAS) 2003 года по точности полиграфа стал стимулом для проведения исследования APA. Отчет NAS 2003 подтвердил возможность использования полиграфа в делах по конкретным инцидентам, указывая на то, что точность теста выше случайного уровня. Однако отчет NAS отверг использование полиграфа для целей скрининга (проверки) в случаях, когда нет конкретного обвинения. В отчете NAS говорилось, что существующих исследований недостаточно для обоснования применения метода при массовом скрининге и что результаты тестов по конкретным инцидентам нельзя обобщать для валидации методов скрининга.

Таким образом, целью данного обзора было определить, удалось ли метааналитическому исследованию APA преодолеть опасения, высказанные NAS. Обзор автора подтверждает наличие достаточного количества исследований для обоснования использования одновопросных (single-issue) доказательных и следственных методов. Однако исследование APA не смогло предоставить доказательств для проведения скрининговых тестов по нескольким вопросам с использованием следственных форматов из-за методологических недостатков и отсутствия соответствующих исследований, учитывающих опасения NAS.

II. ПОДРОБНОЕ ОБСУЖДЕНИЕ

Совет директоров APA признал, что отчет NAS 2003 требует от профессии внедрения доказательной науки для улучшения проведения экспертиз и укрепления общественного доверия. Специальный комитет был создан для решения проблем методов, которым может не хватать научной базы. Отчет комитета 2011 года стал основой для новых Стандартов практики APA (SoP).

Автор отмечает отсутствие ясности в SoP относительно того, какие форматы тестов приемлемы для скрининга и чем они отличаются от тестов по конкретным инцидентам. В разговоре с автором отчета Гоглер сообщил, что «было стремление как можно скорее выпустить отчет» и что он изначально задумывался как предварительный документ, который будет дополнен более детальным исследованием через несколько лет. Однако отчет фактически стал списком «валидированных методов». Кроме того, использование таблиц в исследовании APA подталкивает экспертов к использованию конкретных названий форматов тестов вместо следования общим принципам валидированного тестирования.

Эта спешка создала путаницу. Профессия продолжает использовать многовопросные форматы для скрининга, хотя практика использования таких форматов в расследованиях по конкретным делам была отвергнута. В APA SoP используется термин «последовательные этапы» (successive hurdles) — подход, подразумевающий повторное тестирование валидированными методами, если результат скрининга не является однозначно правдивым. Однако в стандартах APA отсутствует четкое предписание или детальная информация по этому вопросу.

В результате эксперты могут ошибочно полагать, что тесты DLST и AFMGQT соответствуют требованиям для использования в качестве следственных форматов при скрининге. Автор утверждает, что методология исследования APA не подтверждает использование этих методов как многовопросных (multi-issue) в данных выводах. Таким образом, APA не достигла своей цели по устранению опасений NAS относительно невозможности обобщения результатов тестов по одному вопросу на многовопросные скрининговые тесты.

Отчет NAS 2003 выражал обеспокоенность тем, что вопросы в тестах для скрининга могут становиться слишком двусмысленными. Также существовали опасения по поводу низкого уровня базовой частоты (base rate) обвинений, что может увеличить количество ложноположительных результатов. В многовопросных тестах со смешанными показателями базовой частоты эти риски возрастают.

Автор также подверг критике использование метода Монте-Карло в исследовании Нельсона (2015). Было отмечено, что эксперты не проводили рецензирование (peer review) метааналитического исследования APA, хотя оно фактически управляет стандартами практики ассоциации.

III. РЕЗЮМЕ ВЫЯВЛЕННЫХ ПРОБЛЕМ

  • A. Математические ошибки: Данные в таблицах были неверно введены или перепутаны (например, количество правдивых и лгущих участников было инвертировано).
  • B. Ошибочные допущения: Было ошибочно предположено, что данные одновопросного теста можно просто разделить на части и использовать для моделирования многовопросного теста, где вопросы считаются независимыми.
  • C. Неправильное использование распределений: Использование нормального распределения вместо реально существующих скошенных (асимметричных) распределений ведет к искаженным результатам, завышая точность тестов.
  • D. Отсутствие прозрачности в моделировании: Многократное повторение симуляций Монте-Карло на основе неверных допущений без использования реальных данных по проблемным методам скрининга.
  • E. Закрытость данных: Недостаток прозрачности в деталях проведения симуляций делает невозможным воспроизведение или проверку результатов другими исследователями.
  • F. Игнорирование ограничений: Постоянное использование ограниченных исследований (с плохой чувствительностью) нивелирует важность предостережений, которые содержатся в отчетах.

IV. ИССЛЕДОВАНИЯ, ПРИВЕДЕННЫЕ В МЕТАНАЛИЗЕ APA

A. AFMGQT (Air Force Mixed General Question Test)

Автор анализирует исследования Нельсона и др., указывая на то, что они часто использовали данные из сценариев «имитации преступления» (mock crime), где вопросы были заведомо зависимы друг от друга, в то время как для многовопросных тестов требуется допущение об их независимости. Это делает выводы о точности таких форматов при использовании в реальном мире необоснованными.

Особое внимание уделено исследованию 2015 года (Nelson & Handler), где средние баллы для лгущих и правдивых групп были аномально близки по стандартному отклонению, что вызывает сомнения в достоверности данных.

B. DLST (Directed Lie Screening Test)

Тест DLST изначально разрабатывался Министерством обороны США как уникальный формат скрининга. Автор указывает на серьезные проблемы: эксперты не соблюдали процесс «последовательных этапов», а в некоторых исследованиях из отчетов исключались ложноположительные и неубедительные результаты, чтобы искусственно завысить показатели точности.

В исследовании 2012 года (Nelson et al.) использовался ограниченный набор данных из Багдада. Автор отмечает, что эксперты не использовали формат ACQT, а вопросы были сформулированы так, что ложь и правда не могли быть смешаны в рамках одного сценария, что делает результаты неприменимыми к реальным многовопросным тестам.

V. ЧТО СТАЛО ИЗВЕСТНО СО ВРЕМЕН ПУБЛИКАЦИИ МЕТАНАЛИЗА

Как видно из анализа, многие агентства перешли с форматов R/I (Relevant/Irrelevant) на AFMGQT и DLST, полагая, что они являются самодостаточными методами. Однако это привело к проблемам: агентства столкнулись с необходимостью отклоняться от валидированных правил оценки или создавать внутренние политики, не имеющие научной поддержки, чтобы компенсировать недостатки этих форматов.

Пример 1: Полицейское управление на юго-западе США проводило около 1000 тестов в год. Столкнувшись с трудностями при достижении пороговых значений по правилам Federal 7, они приняли политику «не допускать неубедительных результатов», принимая решение на основе общего направления теста, что не является валидированным методом.

Пример 2: Агентство полиции штата на юге США вынуждено проводить около 50% сессий как «разъясняющие» (breakout exams), что нарушает принцип последовательных этапов. Кроме того, они используют систему общего итогового балла (grand total scoring) для независимых вопросов, что является спорной практикой.

Автор подчеркивает: использование нормального распределения при анализе данных полиграфа — это ошибка. Реальные данные экспертов асимметричны («скошены»). Когда исследователи пытаются подогнать эти данные под «колоколообразную» кривую, они получают искаженную картину точности.

VI. ЗАКЛЮЧЕНИЕ

Обзор методологии исследования APA позволяет сделать вывод: существуют веские причины для сомнений в целесообразности использования DLST и AFMGQT в качестве многовопросных следственных форматов. Проблема заключается в том, что исследователи пытались экстраполировать точность тестов по одному вопросу на многовопросные конструкции, не имея для этого достаточной доказательной базы.

«Нельзя раскрасить лошадь полосками и назвать её зеброй ради удобства», — утверждает автор. Многовопросные скрининговые тесты имеют принципиально иную структуру распределения данных (смешение правды и лжи в группах), чем одновопросные тесты, и текущие методы моделирования не учитывают этого различия.

Автор рекомендует:

  • Использовать принцип «последовательных этапов» для всех многовопросных форматов.
  • Внедрять автоматизированные алгоритмы оценки (компьютерное измерение) для снижения вариативности экспертных оценок.
  • Обеспечить прозрачность методологий, чтобы другие исследователи могли их проверить.