May 24

Как интерпретировать РКИ

Или почему недостаточная мощность ≠ неубедительный результат ≠ отрицательное исследование ≠ нейтральное исследование.

Сейчас буду говорить о том, в чем сам довольно поверхностно разбираюсь, но стремлюсь разобраться. Во время учебы в универе никакой статистикой и не пахло, да и после тоже, пока не вписался в написание диссертации, но и это мне не сильно помогло, так что продолжаю изучать.

Недавно попался тред в Х от Ibrahim Halil Tanboga, о том как интерпретировать результаты РКИ, информация мне показалась достаточно полезной, делюсь. Если хотите детально изучить эту тему, то конечно лучше купить курс по медицинской статистике. А здесь написаны некоторые хорошие базовые вещи, на мой взгляд.

Пожалуй основная идея, в том что нельзя интерпретировать результат исследования только через p-value. Все чуть сложнее, чем p<0,05 = работает или p>0,05 = не работает. Помимо статистической значимости очень важно смотреть на доверительный интервал, клинически значимый порог эффекта и, при необходимости, возможно еще байесовские вероятности. Тогда можно выяснить, что при p>0,05, одни «не значимые» исследования просто ничего не доказали (мало данных), другие исключили значимые преимущества, третьи показали реальную эквивалентность, а некоторые пограничные исследования на самом деле все же несут сильный сигнал пользы или вреда. И это принципиально разные выводы порой скрывающиеся под одинаковым ярлыком "no significant difference".

Автор предлагает такой алгоритм, мне он представляется разумным:

Найти первичную конечную точку (primary endpoint) - что собственно оценивали.

Далее, топ три вещи, с которых стоит начинать помимо p-value:

1. Размер эффекта

HR - hazard ratio, отношение рисков во времени

RR - relative risk, относительный риск

OR - odds ratio, отношение шансов

MD - mean difference, разница средних

ARR / ARD - абсолютное снижение / разница рисков

Шпаргалка по размеру эффекта

RR и OR измеряют кумулятивный риск за весь период исследования

HR учитывает время до наступления события (интенсивность)

Для HR, RR и OR нулевое значение - 1,0
Для разницы средних и абсолютной разницы риска - 0

  • HR/RR/OR = 1 - различий нет
  • HR/RR/OR < 1 - риск ниже в группе вмешательства
  • HR/RR/OR > 1 - риск выше в группе вмешательства

2. MCID (minimal clinically important difference), минимально клинически значимая разница

Это порог, после которого эффект становится не просто статистически заметным, а достаточно важным для практики. Например, для условного исследования можно заранее решить, что клинически значимая польза — это снижение риска минимум на 20%. Тогда для HR или RR границей пользы может быть 0,80.

Важно: MCID не универсален. Его нельзя механически переносить из одного заболевания, исхода или шкалы в другую. Он должен зависеть от клинического контекста и быть задан заранее. Без MCID очень легко объявить "успехом" эффект, который статистически заметен, но в реальной клинике почти ничего не меняет.

3. 95% доверительный интервал

Доверительный интервал показывает не только "есть значимость или нет", а насколько точно оценен эффект (исключает ли 0). Посмотреть исключает ли ДИ нулевое значение и клинически значимую пользу/вред.

"Узкий" ДИ - оценка точнее, больше уверенности

"Широкий" ДИ - много неопределенности

ДИ пересекает нулевое значение - статистическая значимость, как правило, не достигнута

ДИ не пересекает нулевое значение - обычно это соответствует статистической значимости

Теперь посмотрим, где ДИ относительно MCID, шесть возможных вариантов.

Если - то чаще всего это:

ДИ полностью в зоне клинически значимой пользы - Positive

ДИ исключает ноль, но эффект неточный - Imprecise (+)

ДИ полностью в зоне вреда - Harmful

ДИ широкий и "захватывает всё" - Inconclusive

клинически значимая польза исключена - Negative

и польза, и вред исключены - Neutral

Подробнее про каждый.

Если заранее задано, что клинически значимая польза соответствует HR ≤ 0,80, а клинически значимый вред - HR ≥ 1,25.

1. Positive - положительное исследование

Исследование показывает статистически значимый и клинически значимый эффект.

Не только "p < 0,05", но и весь доверительный интервал лежит в зоне клинически важной пользы.

Пример: HR 0,72; 95% ДИ 0,65-0,79

Весь доверительный интервал находится в зоне клинически значимой пользы

  • нулевой эффект HR = 1,00 исключен
  • даже верхняя граница ДИ 0,79 ниже порога клинически значимой пользы 0,80
  • значит, результат совместим не просто с пользой, а с клинически значимой пользой

Смысл: это сильный аргумент в пользу вмешательства. Эффект не только статистически заметен, но и достаточно велик, чтобы иметь клиническое значение.

2. Imprecise (+) - положительное, но неточное

Здесь результат формально статистически значим, польза вероятна, но точный размер эффекта остается неясным.

Пример: HR 0,70; 95% ДИ 0,49-0,98

Доверительный интервал указывает на пользу, но величина эффекта остается неточной

  • нулевой эффект HR = 1,00 исключен
  • точечная оценка HR 0,70 находится в зоне клинически значимой пользы
  • нижняя граница ДИ 0,49 допускает очень большой эффект
  • верхняя граница ДИ 0,98 допускает эффект, который может быть статистически значимым, но уже не обязательно клинически значимым

Смысл: сигнал пользы есть, но величину эффекта лучше не переоценивать. Часто именно здесь потом выясняется, что первый результат был слишком оптимистичным.

3. Neutral - нейтральное исследование

Neutral означает, что ДИ достаточно узкий и исключает и клинически значимую пользу, и клинически значимый вред.

Пример: HR 0,98; 95% ДИ 0,94-1,02

Весь доверительный интервал находится в зоне между 0,80 и 1,25

  • клинически значимая польза исключена, потому что нижняя граница ДИ 0,94 выше порога пользы 0,80
  • клинически значимый вред исключен, потому что верхняя граница ДИ 1,02 ниже порога вреда 1,25
  • результат находится близко к нулевому эффекту HR = 1,00.

Смысл: существенной разницы, скорее всего, нет. В практическом плане стратегии могут быть очень похожи, и тогда при выборе важнее становятся цена, безопасность, удобство, доступность и предпочтения пациента и прочее.

Но здесь нужна аккуратность интерпретации. Cтрогая эквивалентность требует специального дизайна equivalence trial или заранее заданных границ эквивалентности.

4. Negative - отрицательное исследование

Negative означает, что клинически значимая польза исключена. Но это не то же самое, что neutral.

Пример: HR 0,95; 95% ДИ 0,85-1,07

Доверительный интервал исключает клинически значимую пользу, но не доказывает полную одинаковость стратегий

  • нижняя граница ДИ 0,85 выше порога клинически значимой пользы 0,80 - значит, клинически значимая польза исключена
  • ДИ пересекает нулевое значение HR = 1,00, поэтому статистически значимого преимущества нет
  • верхняя граница ДИ 1,07 не достигает порога клинически значимого вреда 1,25

Такой результат не доказывает идеальную одинаковость (эквивалентность) стратегий. Небольшая польза или небольшой вред могут быть возможны. Но клинически значимая польза исключена.

Смысл: вмешательство, скорее всего, не дает того значимого выигрыша, ради которого его хотели использовать.

5. Inconclusive - неубедительное, неопределенное исследование

Это случай, когда исследование не дает нормального ответа.

Пример: HR 0,90; 95% ДИ 0,65-1,35

Доверительный интервал слишком широкий и допускает разные клинические сценарии

  • клинически значимая польза возможна, потому что нижняя граница ДИ 0,65 ниже порога пользы 0,80
  • отсутствие эффекта возможно, потому что ДИ пересекает HR = 1,00
  • клинически значимый вред возможен, потому что верхняя граница ДИ 1,35 выше порога вреда 1,25

Смысл: правильный вывод здесь не "не работает", а "мы не знаем". Исследование слишком неточное, чтобы уверенно отличить пользу, отсутствие эффекта и вред.

6. Harmful - вредное вмешательство

Это ситуация, когда данные указывают на вред.

Пример: HR 1,35; 95% ДИ 1,28-1,50

Весь доверительный интервал находится в зоне клинически значимого вреда

  • нулевой эффект HR = 1,00 исключен
  • даже нижняя граница ДИ 1,28 выше порога клинически значимого вреда 1,25
  • значит, результат совместим не просто с ухудшением, а с клинически значимым вредом

Смысл: это сигнал клинически значимого вреда, который может быть основанием избегать или ограничивать вмешательство, если результат методологически надежен и применим к нужной популяции.

Важно

p > 0,05 ≠ эффекта нет. Это значит только, что нулевая гипотеза не была отвергнута в рамках данного анализа. Без ДИ и MCID мы еще ничего толком не поняли

Широкий ДИ ≠ neutral. Это чаще означает inconclusive.

Любой "non-significant" результат ≠ negative. Negative — только если клинически значимая польза действительно исключена.

Negative ≠ Neutral. Neutral - более сильный вывод, чем Negative. Для него нужна хорошая точность, узкий ДИ и заранее понятный клинический коридор.

Ещё несколько важных моментов:

Underpowered - это не "отрицательное"

Underpowered означает, что исследование имело недостаточную статистическую мощность: слишком мало пациентов или слишком мало событий, чтобы надежно выявить заранее заданный клинически важный эффект. Это вероятно если мы видим широй ДИ или он включает и нулевое значение и MCID, либо фразы по типу "trend toward benefit"

Недостаточная мощность обычно ведет к категории inconclusive. Т.е. маленькое исследование с p = 0,18 не обязательно отрицательное. Часто оно просто слишком слабое, чтобы что-то доказать.

Маленькие "положительные" исследования тоже опасны

Есть обратная проблема, если маленькое исследование все-таки стало "положительным", наблюдаемый эффект часто оказывается завышенным. Поэтому сначала стоит посмотреть на размер выборки, число событий, ширину ДИ и воспроизводимость результата.

Про post-hoc power

Иногда после "незначимого" результата пытаются посчитать post-hoc power - мощность уже после получения данных. Автор негативно относится к такой практие, потому что после завершения исследования все уже видно из размера эффекта, p-value и 95% ДИ. То есть не надо пытаться оживить слабый вывод калькулятором мощности. Лучше честно посмотреть на интервал.

Байесовский анализ

Если клинический результат очень важен, а p близко к 0,05 и ДИ почти исключает ноль, можно вычислить байесовские апостериорные вероятности, например для того чтобы отличить negative, neutral и inconclusive, прежде чем присваивать исследованию какой-то статус.

Проще говоря, вместо бинарного, "значимо / не значимо" мы получаем вероятность пользы, клинически значимой пользы, эквивалентности и вреда в %, это понятнее для клинициста.

Но такой подход не должен быть магической кнопкой "сделать исследование положительным". Все зависит от априорных предположений, их прозрачности и анализа чувствительности.

Априорное (Prior) - это предположение о возможном эффекте до учета данных конкретного исследования. Т.е., что мы считали правдоподобным до того, как увидели результаты этого РКИ?

Автор, ссылаясь на подход Zampieri и соавт., предлагает использовать разные варианты Prior: скептический (центрирован около отсутствия эффекта), оптимистичный (предполагает возможную пользу), пессимистичный (предполагает возможный вред) или, на основе предыдущих исследований/метаанализа, опционально

Также можно задавать "силу" - слабый/умеренный/сильный. Важно не подбирать prior задним числом под желаемый результат. Zampieri и соавт. отдельно подчеркивают, что priors должны быть заданы прозрачно, потому что иначе bayesian-реанализ может стать источником смещения, а не способом уточнения вывода.

После выбора priors автор предлагает для каждого рассчитать три основные метрики (по аналогии с OR,HR):

Pr(MCID benefit) - вероятность клинически значимой пользы

Pr(ROPE) - region of practical equivalence, вероятность практической эквивалентности

Pr(MCID harm) - вероятность клинически значимого вреда

Также, можно рассчитать дополнительные параметры - Pr(any benefit), Postarior median OR/HR, 95% credible interval, ARR. После чего автор предлагает вычислить чувстивтельность, I² между результатами при разных priors. И если вывод сохраняется,то он более устойчив.

В результате, например, исследование может давать 95% вероятность хоть какой-то пользы, но только 45% вероятность клинически значимой пользы, условно. Тогда это уже не positive, а скорее imprecise (+), где польза вероятна, но ее величина неясна.

Про non-inferiority и equivalence

Все, что выше, про superiority РКИ, где вопрос звучит так - новое вмешательство лучше стандартного? Но бывают другие дизайны.

Non-inferiority РКИ - новое вмешательство не хуже стандартного больше чем на заранее заданную величину? Здесь используется односторонняя граница.

Equivalence РКИ - различия между вмешательствами находятся внутри заранее заданного коридора эквивалентности? Здесь нужны две границы, с обеих сторон.

Такие дела.

Автор приводит классные примеры исследований, в основном по кардиологии правда. Например в EOLIA и ANDROMEDA-SHOCK не было значимочсти, но но байесовский анализ показал высокую вероятность пользы, а в ART, с таким же пограничным результатом,байесовский анализ скорее подтвердил вред. С ними можно ознакомиться в оригинальной публикации.

Полный текст поста - https://x.com/ihtanboga/status/2042232013525008725?s=52

БАЗА, на которую ссылается автор:

Methodological framework:

  1. Pocock SJ, Stone GW. The Primary Outcome Fails — What Next? NEJM. 2016;375:861-870.
  2. Hawkins AT, Samuels JD. How to Interpret a Clinical Trial That Did Not Meet Its Primary Outcome. JAMA. 2021;326:1875-76.
  3. Wasserstein RL et al. Moving to a World Beyond "p < 0.05". Am Stat. 2019;73(sup1):1-19.
  4. ICH E9 (1998); ICH E10 (2000).
  5. McGlothlin AE. Minimal Clinically Important Difference. AJPH. 2013.

Bayesian framework:

  1. Zampieri FG, Casey JD, Shankar-Hari M, Harrell FE, Harhay MO. Using Bayesian Methods to Augment the Interpretation of Critical Care Trials. AJRCCM. 2021;203:543-552.
  2. Goligher EC et al. ECMO for Severe ARDS: Posterior Probability of Mortality Benefit. JAMA. 2018;320:2251-2259.
  3. Zampieri FG et al. Bayesian Reanalysis of the ANDROMEDA-SHOCK Trial. AJRCCM. 2020;201:423-429.
  4. Kruschke JK. Rejecting or Accepting Parameter Values in Bayesian Estimation. Adv Methods Pract Psychol Sci. 2018.
  5. Spiegelhalter DJ et al. Bayesian Approaches to Clinical Trials. Wiley, 2004.

Frank Harrell:

  1. Harrell FE. Statistical Errors in the Medical Literature. fharrell.com/post/errmed (2017).
  2. Harrell FE. Bayesian vs Frequentist Decisions. hbiostat.org/bayes/bet/.

Underpowered, Type M/S, replication crisis:

  1. Freiman JA et al. The Importance of Beta. NEJM. 1978;299:690-694.
  2. Gelman A, Carlin J. Beyond Power Calculations. Perspect Psychol Sci. 2014;9:641-651.
  3. Button KS et al. Power Failure. Nat Rev Neurosci. 2013;14:365-376.
  4. Hoenig JM, Heisey DM. The Abuse of Power. Am Stat. 2001;55:19-24.
  5. Ioannidis JPA. Why Most Published Research Findings Are False. PLoS Med. 2005;2:e124.
  6. Sidebotham D, Barlow J. Effect Sizes From Small Discovery Trials. Anaesthesia. 2024.

Altman and ASA:

  1. Altman DG, Bland JM. Absence of Evidence Is Not Evidence of Absence. BMJ. 1995;311:485.
  2. Wasserstein RL, Lazar NA. The ASA Statement on p-Values. Am Stat. 2016;70:129-133.

Critical care RCTs:

  1. Combes A et al. EOLIA. NEJM. 2018;378:1965-1975.
  2. Hernández G et al. ANDROMEDA-SHOCK. JAMA. 2019;321:654-664.
  3. Cavalcanti AB et al. ART. JAMA. 2017;318:1335-1345.