← На главную

Вместо RCT — данные прошлого: имитация целевого испытания

01.07.2026 15:30 · hackernews

В 1710 году шотландский врач Джон Арбетнот доказывал существование Бога через статистику: 82 года подряд в Лондоне рождалось больше мальчиков, чем девочек. Если вероятность пола одинакова, шанс такого исхода — 0.5⁸². Значит, решил он, тут не случай, а божественный замысел. Пьер-Симон Лаплас в 1781 году перепроверил данные и сделал более трезвый вывод: просто мальчиков рождается чуть больше. Он же заметил, что в Лондоне доля мальчиков на 0.38% выше, чем в Париже, а разница между Парижем и Неаполем оказалась статистически незначимой.

Эти ранние тесты показывают и риски, и силу наблюдательных данных. Арбетнот легко нашёл подтверждение тому, во что уже верил. Но оба учёных смогли делать науку прямо за столом, используя местные записи — без дорогих экспериментов.

Первое упоминание контролируемого испытания — в Книге Даниила (VII век до н.э.): пророк предложил 10 дней проверить вегетарианскую диету. В XI веке Ибн Сина в «Каноне врачебной науки» советовал изучать пациентов с одним заболеванием, без сопутствующих — это перекликается с современными критериями включения в RCT. Петрарка в XIV веке предлагал разделить сотню больных на две группы: лечиться у врачей или положиться на природу. В 1648 году фламандский врач Ян Баптист ван Гельмонт впервые предложил рандомизацию: бросить жребий, чтобы половина больных досталась ему, половина — коллеге, и сравнить смертность.

В 1747 году Джеймс Линд провёл испытание 12 матросов с цингой: одна группа получала цитрусовые и выздоровела. В 1898 году датчанин Йоханнес Фибигер провёл испытание сыворотки от дифтерии на 484 пациентах — с контрольной группой и первой попыткой явной рандомизации (по дню поступления). Двойной слепой метод появился позже. А первым современным RCT считается испытание стрептомицина от туберкулёза, организованное Medical Research Council Великобритании в 1946 году — там были и рандомизация, и сокрытие назначения, и формальные критерии включения.

После трагедии с талидомидом FDA добилось принятия поправки Кефовера-Харриса (1962), которая сделала RCT стандартом для доказательства эффективности лекарств. RCT удобен: его легко понять, он даёт несмещённые оценки и упрощает коммуникацию с регулирующими органами.

Но у RCT есть проблемы. Этический вопрос: нельзя отобрать у роженицы врача ради контрольной группы. Операционные сложности: ВОЗовское испытание дородовой помощи (1996) потребовало 53 клиники, 24 000 женщин, 256 участников и огромных затрат. Многие гипотезы в общественном здравоохранении так не проверить.

Здесь помогают наблюдательные исследования с современными методами. Например, имитация целевого испытания (target trial emulation): вы формулируете гипотезу, а затем анализируете уже собранные данные так, как если бы это был спланированный эксперимент. Для учёта смешивающих факторов (confounders) используют взвешивание обратной вероятности (inverse probability weighting). Если женщина с низким доходом всё же рожает в учреждении — это даёт дополнительную информацию, и её случай взвешивается сильнее. Сейчас компьютеры легко справляются с такими расчётами.

Методы вроде двойного машинного обучения (double machine learning) позволяют получить надёжные оценки даже при гибких моделях. Важна и проверка на отрицательных контролях: если ваша методика показывает, что статины защищают от попадания под грузовик — значит, что-то не так.

В 2019 году Барбра Дикерман показала, что предыдущие наблюдательные исследования ошибочно приписывали статинам защиту от рака из-за бессмертного временного смещения. В 2022 году исследователи с данными Veterans Affairs (N=902 235 на руку) за считанные месяцы сравнили вакцины Moderna и BioNTech-Pfizer и выяснили, что Moderna эффективнее — такой RCT компании не стали бы делать сами.

Наблюдательные данные особенно ценны для стран с низким доходом, где проводить RCT дорого или невозможно. В Эфиопии, например, нет электронных медицинских записей, и последняя перепись была в 2007 году. Вложение в крупные наблюдательные наборы (как Million Veterans Program в США) окупается десятками исследований. Иногда не надо ставить эксперимент — достаточно просто записать, что происходит, и применить правильные методы.

Читать оригинал →