惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
GbyAI
GbyAI
Jina AI
Jina AI
博客园_首页
Y
Y Combinator Blog
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
M
MIT News - Artificial intelligence
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
MyScale Blog
MyScale Blog
MongoDB | Blog
MongoDB | Blog
雷峰网
雷峰网
罗磊的独立博客
博客园 - Franky
Last Week in AI
Last Week in AI
Vercel News
Vercel News
Martin Fowler
Martin Fowler
Stack Overflow Blog
Stack Overflow Blog
Microsoft Security Blog
Microsoft Security Blog
月光博客
月光博客
WordPress大学
WordPress大学
W
WeLiveSecurity
Apple Machine Learning Research
Apple Machine Learning Research
TaoSecurity Blog
TaoSecurity Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 聂微东
Schneier on Security
Schneier on Security
Engineering at Meta
Engineering at Meta
Simon Willison's Weblog
Simon Willison's Weblog
博客园 - 【当耐特】
宝玉的分享
宝玉的分享
大猫的无限游戏
大猫的无限游戏
S
SegmentFault 最新的问题
P
Proofpoint News Feed
C
Cyber Attacks, Cyber Crime and Cyber Security
博客园 - 叶小钗
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
L
LINUX DO - 最新话题
S
Security @ Cisco Blogs
B
Blog RSS Feed
B
Blog
爱范儿
爱范儿
D
Darknet – Hacking Tools, Hacker News & Cyber Security
T
Tailwind CSS Blog
Attack and Defense Labs
Attack and Defense Labs
V
Visual Studio Blog
NISL@THU
NISL@THU
U
Unit 42
Hugging Face - Blog
Hugging Face - Blog
A
Arctic Wolf

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром T-TOPS: Как распутать гордиев узел проекта после выхода в прод (меч не понадобится) Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Дом, который не построил Фишер (Часть 2)
2026-04-16 · via Все публикации подряд на Хабре

§2. Z в вакууме

(что было в прошлый раз)

Теперь, когда у нас есть необходимый понятийный аппарат, посмотрим, как заставить его работать.

Пусть имеется случайная величина ξ с неизвестным математическим ожиданием μ, которое и будет предметом нашего интереса. Для простоты сделаем два, мягко говоря, не слишком правдоподобных предположения: случайная величина ξ имеет нормальное распределение, причем его дисперсия известна и равна σ2. Конечно, чтобы не потерять связь с реальностью, от этих предположений хорошо бы избавиться, но за это придется заплатить необходимостью привлекать, например, предельные теоремы, что уведет разговор далеко в сторону, так что остановимся на нашем простом, пусть и ужасно искусственном, случае.

Итак, запишем сказанное выше так:

ξ ~ N( μ=?, σ2)

У нас, конечно, имеется iid-выборка размера n: X = {x1, x2, … xn}. Аббревиатура iid (independent identically distributed) означает простую случайную выборку, т. е. все xi независимы и порождены одной случайной величиной ξ.

Мы хотим проверить нулевую гипотезу о том, что математическое ожидание μ равно конкретному числу μ0.

H0: μ= μ0

Чтобы нулевая гипотеза у нас не висела в пустоте и имела смысл, должна быть и альтернативная гипотеза. И опять же для простоты пусть она пока будет односторонней:

H1: μ> μ0

По имеющейся выборке мы без труда вычислим обычное выборочное среднее , но здесь мы запишем его в немного непривычном виде:

\bar X = \frac{1}{n}x_1 + \frac{1}{n}x_2 + ... \frac{1}{n}x_n

Так как все xi имеют одно и то же распределение N( μ, σ2 ), к тому же независимы друг от друга, выборочное среднее оказывается простой линейной комбинацией одинаково распределенных и независимых нормальных случайных величин, а значит тоже будет иметь нормальное распределение: это напрямую следует из свойств этого распределения, расчехлять ЦПТ и прочие хитрости нет необходимости. Вспоминая элементарные правила действий со случайными величинами, можно проверить, что параметры этого распределения есть E(\bar X)=μи  Var(\bar X) = \frac{\sigma^2}{n}.

Теперь произведем центрирование и нормирование этого среднего:

 Z = \frac{(\bar X-\mu)\sqrt(N))}{\sigma}

Смысл этой операции в том, что теперь случайная величина Z имеет удобное стандартное нормальное распределение N(μ=0, σ2=1). Чтобы в этом убедиться, достаточно опять вспомнить о линейных свойствах этого распределения и обратить внимание, что в выражении для Z имеется только одна случайная компонента, выборочное среднее \bar X, а остальное — просто фиксированные числа. И еще раз подчеркнем, что это точное, не асимптотическое, утверждение — при наших допущениях о нормальном распределении ξ и известной дисперсии оно строго справедливо для любого размера выборки, даже очень маленького.

Констатируем:

Z =  \frac{(\bar X-\mu)\sqrt(N))}{\sigma}~ N(0, 1) (1)

А теперь сделаем два почти тривиальных, но невероятно важных наблюдения:

1) Распределение Z не зависит от того, чему в действительности равно математическое ожидание μ. Имеется в виду, что подставляя в (1) вместо μ его истинное значение, каким бы оно ни было на самом деле, мы можем быть уверены, что Z ~ N(0, 1). Будь это не так, то при неизвестном μ мы не знали бы и распределения Z. В литературе вам может встретиться термин pivotal quantity, и это именно оно: функция от данных и параметра, распределение которой не зависит от этого параметра. Это весьма ценное свойство по целому ряду причин, но прямо сейчас нам важна только одна:

2) Теперь мы получаем право в (1) заменить μ на любое наше гипотетическое значение μ0 и смело заявить, что если нулевая гипотеза H0: μ= μ0 верна, то

Z =   \frac{(\bar X-\mu_0)\sqrt(N))}{\sigma}~ N(0, 1) (2)

А сейчас внимание. В нашем распоряжении оказалась случайная величина, вероятностное «поведение» которой нам заранее известно, при условии, что H0 верна. Что если рассчитанное по нашей выборке наблюдаемое значение z(X) окажется там, где мы вряд ли ожидаем его увидеть, если z действительно распределено как N(0,1)? Мы таким образом оказываемся в рамках той нехитрой логической конструкции, которая обсуждалась в §1. Увидев значение z(X) подозрительно далеко в хвосте стандартного нормального распределения (Рисунок 1), мы можем заключить, что произошло событие, которое, скорее всего, не должно было произойти, если Z имеет такое распределение.

Рисунок 1

Рисунок 1

На вопрос «почему так случилось?» можно дать два взаимоисключающих ответа: А) подстановка нашего μ0 в (2) привела к тому, что Z имеет какое-то другое распределение, а это значит, что μ≠μ0, и нулевая гипотеза не верна; Б) даже маловероятные события иногда случаются, поэтому существует возможность, что наши подозрения напрасны, так что отвергнув гипотезу, мы совершим ошибку первого рода (см. §1).

Вернемся к Рисунку 1. Попадание z(X) в зону правее порогового значения zCRIT есть не что иное, как критическое событие, о котором говорилось в первой части. Интервал (zCRIT, +∞) совершенно официально именуется критической областью или областью отвержения нулевой гипотезы. Выбирать значение zCRIT каждый волен как ему вздумается, руководствуясь здравым смыслом и без оглядки на «best practice», традиции и прочие эзотерические вещи. Главное понимать, что этот выбор определяет вероятность попасть в критическую зону — уже знакомую нам α. Она же — вероятность совершить ошибку первого рода, так как z(X) может именно с такой вероятностью оказаться в этой зоне, если верно (2), т. е. если верна H0.

Если zCRIT в критическую область не попадает, т. е. еслиz(X) \notin (z_{crit}, +\infty), мы, вместо «нулевая гипотеза принимается», должны осторожно сказать что-то вроде «нулевая гипотеза не отвергается», «для ее отклонения нет серьезных оснований», и т. п. По крайней мере, так нас наставляют авторы учебников и редакторы научных журналов. Но гораздо важнее всей этой ритуальной семантики контекст задачи и, стало быть, наше осознанное решение о том, насколько серьезны должны быть эти «основания», и свое решение мы выражаем выбором α и, как следствие, выбором zCRIT. Конечно, если вы академический ученый, то осторожные, консервативные формулировки придутся ко двору, так как они стоят на страже спокойствия научного сообщества (и вашей репутации). Но я не знаю, кто вы, поэтому и счел нужным написать этот абзац.

Почему критическую область мы выбрали в правом хвосте, а не где-то еще? Потому что при всех сделанных допущениях выражение (2) справедливо, только если H0 верна. Если же верна альтернативная гипотеза H1: μ> μ0, про которую мы опять чуть не забыли, то статистика Z, как это следует опять же из свойств нормального распределения, будет все равно подчиняться нормальному закону с той же дисперсией σ2=1, однако ее математическое ожидание теперь окажется равным не нулю, а некоторой положительной величине Δ /(σ/√n) (где Δ=μ10 и μ1 это истинное значение генерального среднего), так как теперь E()=μ1. Распределение Z перемещается вправо, и тогда, выбрав другую критическую область, пусть и соответствующую тому же уровню значимости α, мы бы нанесли удар по мощности теста (см. Рис. 2).

Рисунок 2. Вверху: верна нулевая гипотеза. Внизу: верна альтернатива

Рисунок 2. Вверху: верна нулевая гипотеза. Внизу: верна альтернатива

Теперь вероятность события z(X)> zCRIT равна уже не α (Рис 2, нижняя панель), а площади закрашенной желтым области под кривой справа от zCRIT. Это вероятность отклонить ложную нулевую гипотезу, если на самом деле она не верна, а верно μ=μ1. Это и есть мощность теста, 1-β. Площадь, закрашенная на этом рисунке голубым, является вероятностью ошибки второго рода, β. Концептуально эти понятия уже обсуждались в §1, не будем повторяться. Однако обратите внимание, что μ1 это лишь одна точка из возможного множества точек, представляющих нашу альтернативу H1: μ> μ0. Поэтому очень полезно будет рассматривать мощность как функцию от возможных значений μ1, а еще нагляднее — как функцию от величины эффекта, Δ=μ10 (Рис. 3). Очевидно, чем больше Δ, тем дальше вправо сдвигается альтернативное распределение z-статистики и тем больше мощность критерия.

Рисунок 3

Рисунок 3

Вспомним, что «сдвиг» произошел на величину Δ /(σ/√n), а значит он и, как следствие, мощность, зависят не только от Δ, но также от размера выборки n и дисперсии генеральной совокупности. Причем зависимость от дисперсии обратная — чем меньше σ2, тем больше мощность при прочих равных, что согласуется с интуицией. Все эти факты намекают на возможность планировать эксперимент заранее. В частности, отвечать на вопросы типа «Какого размера выборку надо собрать, чтобы эффект не меньший, чем Δ, был обнаружен с вероятностью не меньше, чем 1-β, если уровень значимости равен α?». И этим мы еще обязательно займемся.

Скрытый текст

На Рисунке 2 мы изобразили плотности нулевого и одного из альтернативных распределений z-статистики на двух разных панелях, чтобы еще раз церемониально указать на их несовместность. В реальности верна либо гипотеза H0 (Рис 2, верхняя панель), либо какая-то другая (Рис. 2, нижняя панель) — эти два варианта не являются двумя возможными результатами предстоящего случайного испытания, которым можно присваивать вероятности. Сформулировав гипотезы, вы уже сделали выбор, и теперь поручаете данным оценить, насколько этот выбор был близок к реальному (и фиксированному) положению вещей. Данные выскажут свое мнение вероятностным языком, так как вы добывали их случайным образом, как пресловутые разноцветные шары из корзины в задачниках по теории вероятностей. Но факт истинности или ложности гипотезы все это время остается неизменным и неслучайным. Например, подбрасывая монету, вы оставляете ее физические свойства неизменными, а ведь гипотеза H0: Pорел=1/2 это по сути гипотеза о монете как о физическом объекте. Как уже говорилось, критиковать такую философию можно и нужно, но это тема для отдельного разговора.

Теперь мы почти готовы двигаться дальше. «Почти», потому нам осталось извлечь еще один, и очень страшный, скелет из шкафа классической статистики.

§3. P-value unmasked (и немного истории)

Сугубо техническая сторона дела выглядит очень просто. Как узнать, что вычисленное значение статистики теста, например z(X), оказалось в критической области? Можно, конечно, просто сравнить zCRIT и z(X), и если z(X)> zCRIT, то критическое событие произошло. Но можно поступить и по-другому: вычислить вероятность события z>z(X). На Рисунке 4 видно, что если эта вероятность оказалась меньше заранее выбранного уровня значимости α, то это также однозначно указывает на попадание статистики теста в область отвержения гипотезы.

Рисунок 4

Рисунок 4

Вероятность P(z>z(X)) получила бесхитростное название p-значение (p-value). И, казалось бы, на этом разговор о нем можно заканчивать. Но не все так просто, особенно если вспомнить, что речь идет о методах, разработанных в 1920-30 годах, когда у людей не было возможности быстро и точно вычислять значения любых функций распределения для произвольных точек. И в самом деле, p-value, детище вездесущего Р. Фишера, изначально не было задумано просто как инструмент, обслуживающий ту методологию, которую мы обсуждали до сих пор. И дело тут вовсе не в сложности вычислений, а в гораздо более принципиальных (и абстрактных) вещах. P-value было подано как альтернатива методу, который мы рассматривали до сих пор и который Фишер считал, ни много ни мало, антинаучным. По мнению Фишера, авторы этого метода, Е. Нейман и Э. Пирсон, отступились от научного метода, предложив механическое бинарное правило «отвергнуть / не отвергнуть» вместо того, чтобы дать ученым инструмент, точно измеряющий степень согласованности эмпирических данных с гипотезой, какой бы эта степень ни была, и оставляющий человеку возможность самому оценивать ее серьезность и принимать решение.

У Неймана и Пирсона, разумеется, нашлись свои веские контрагрументы. Спор получился на редкость громким и до неприличия жестким, и ни одна из сторон не вышла из него явным победителем. Озадаченная публика почесала в затылке и пришла к заключению, что по-своему прав и Фишер и его оппоненты. Все бы ничего, но это привело к тому, что со временем нюансы методологического спора забылись, и p-value стали воспринимать как неотъемлемую часть процедуры Неймана-Пирсона. Так родился странный гибрид, который сейчас очень часто преподносится как нечто само собой разумеющееся, и от которого поморщились бы и Фишер, и Нейман с Пирсоном.

Вообще, синтез противоборствующих идей нередко бывает полезным. Но здесь, похоже, не тот случай. Поэтому далее нам придется двигаться очень осторожно, чтобы не допустить путаницы. Итак, что же такое p-value, и как его интерпретировать?

1) Первый возможный ответ мы уже дали: это индикатор, показывающий, попала ли статистика теста в критическую область. Всё. Никаких Фишеровских «степеней согласованности», мы остаемся на уже знакомой территории методологии Неймана-Пирсона. Это вполне уважаемая позиция, и не надо бояться обидеть великого статистика.

2) Второй ответ: p-value – это, образно говоря, «линейка», измеряющая, насколько сильно отклонились данные от того, что ожидалось, если нулевая гипотеза верна. В самом деле, если его значение мало, близко к нулю, то это означает, что тестовая статистика настолько далеко заехала в маловероятную зону своего распределения при верной H0, что дальше уже почти некуда — в том смысле, что еще более аномальный результат маловероятен. Это и есть идея Фишера в чистом виде. Мы не сравниваем p-value со значением α, не думаем о мощности и размере эффекта (альтернативная гипотеза вообще игнорируется). Мы просто смотрим на одно число, p-value, и пытаемся понять, что нам теперь думать о нулевой гипотезе.

На первый взгляд помирить спорщиков не так уж и сложно. В самом деле, почему бы не сказать, что важен не только факт преодоления критического порога статистикой теста, но и насколько далеко или близко от этого порога она оказалась? Или, если угодно, давайте вспомним наш шуточный пример из §1. Что если за окном мы увидели не просто небольшой мокрый снег с дождем, а настоящий снегопад по всем правилам, как в новогоднюю ночь? Другими словами, критическое событие происходит, просто оно выражено сравнительно более ярко. В этом случае очень хочется сказать совершенно естественную вещь: «тогда наша уверенность в том, что сейчас не лето, будет гораздо больше». Однако, если мы хотим оставаться последовательными, то так говорить нельзя! Потому что в выбранной нами классической парадигме мы даже не помышляем об измерении уверенности (этим занимается так называемая байесовская статистика, на которую мы намекали во врезке в §1, не назвав ее по имени) — вместо этого нас интересуют лишь вероятности получить те или иные данные при фиксированных и неслучайных гипотезах. Иронично, что Фишер, мягко говоря, не был приверженцем байесовского подхода, и прекрасно осознавал созданное им же противоречие. Он промучился с ним многие годы, но вопрос так и остался нерешенным.

Расстроенный (?) Рональд Фишер

Расстроенный (?) Рональд Фишер

Обратите внимание, что ни одна из двух озвученных выше интепретаций не говорит, что p-value – это вероятность ошибки первого рода. В рамках парадигмы Неймана-Пирсона такое утверждение было бы попросту абсурдным. Вероятность α фиксируется заранее и не может измениться в зависимости от того, что случилось с тестовой статистикой. Это установленное «правило игры», а не счет, с которым закончился конкретный матч. В качестве другой аналогии представьте себе, что лимит разрешенной скорости на участке дороги всякий раз менялся бы в зависимости от того, как быстро двигался мимо радара очередной автомобиль.

С версией Фишера все еще жестче. Она вообще не говорит об α. Это, конечно, не значит, что она отвергает саму возможность ошибиться. Но если бы Фишера нарядили в форму инспектора ГИБДД, он не стал бы никого штрафовать и, стало быть, беспокоиться, что штраф выписан несправедливо. Он просто смотрел бы на показания радара и пытался бы из увиденного сделать вывод о состоянии дороги и возможностях автомобилей у местного населения. Он предлагает нам мыслить индуктивно: от частных фактов о мире ко все более точному описанию этого мира по мере накопления фактов. Возня с квитанциями и судами ему противна. Для него фиксированной вероятности ошибки просто не существует. Если он изначально думал, что дорога тут плохая или местные автолюбители ездят на развалюхах, то увидев на радаре 120 км/ч, он заподозрит неладное о своем исходном мнении и, может быть, решит разобраться с вопросом более внимательно. А может быть, не решит, выбор за ним.

Но как бы то ни было, в обеих парадигмах утверждение о том, что p-value есть вероятность ошибки первого рода, логически несостоятельно. Представим себе ситуацию: мы вычислили p-value, и теперь, глядя на него, спрашиваем: «Какова теперь вероятность ошибки первого рода?». Другими словами, наш вопрос звучит так: «какова вероятность, что, если нулевая гипотеза верна, я ошибусь, если отвергну ее?». Но это очень странный вопрос. Если гипотеза в самом деле верна, то отвергая ее, я совершенно точно ошибусь, вероятность этого равна 1. И эта вероятность вообще никак не зависит от моей выборки и от того, что я по ней посчитал, в том числе от p-value.

Путаница «p-value / вероятность ошибки», возможно, вызвана тем, что слово «вероятность» (буква p в названии) инстинктивно хочется связать с чем-то уже знакомым, и тут вероятность ошибки первого рода очень удобно подворачивается под руку. Но это еще не самое страшное. Гораздо сильнее желание привязать вероятность к самой гипотезе, и вот с этим желанием бороться не в пример сложнее. Действительно, мы отвергаем нулевую гипотезу при «малом» значении p-value, и кому-то может показаться логичным, что это значение и есть вероятность, что H0 верна. Но, во-первых, еще раз занудно повторим, что вероятности гипотез мы вообще не рассматриваем, так как считаем истинность/ложность гипотезы данностью. А во-вторых, даже если махнуть рукой на принципы и начать говорить о гипотезе как о случайном событии, все равно получается что-то нелепое. P-value вычисляется в предположении, что H0 верна — напомним, что это вероятность получить такое же или еще более «подозрительное» значение статистики теста, если она действительно имеет заявленное при нулевой гипотезе распределение. Таким образом, речь идет о двух разных вопросах. Мы спрашиваем, чему равна вероятность события z(X)> zCRIT при условии, что H0 верна, и это не то же самое, что вероятность верности H0 при условии, что мы получили определенное значение статистики. В конце концов, нельзя безнаказанно менять местами "причину и следствие": в общем случае P(A|B)≠P(B|A).

Напоследок упомянем еще один зловредный миф: p-value как мера размера эффекта Δ. Когда видишь очень малое значение p-value, есть соблазн заявить, что это свидетельство большой величины Δ. Возможно, тут будет уместна еще одна юридическая аналогия. Убедительность улик (малое p-value) ≠ тяжесть преступления (большая Δ). Можно собрать очень веские свидетельства в пользу того, что подсудимый… просто перешел улицу на красный свет. Аналогично, можно получить, например, p-value=0.001 просто потому, что в вашем распоряжении огромная выборка, и критерий, соответственно, демонстрирует очень высокую мощность — он чутко улавливает даже очень незначительное отклонение от нулевой гипотезы, т. е. его статистика с высокой вероятностью попадает в критическую область. А между тем, настоящее значение Δ может быть весьма малым и вообще не представлять для вас практического интереса. Так что главный конфликт здесь в том, что Δ есть фиксированный, хоть и неизвестный, факт, а p-value по своей природе изменчиво и зависит от данных. Мы снова видим уже знакомый сюжет: неслучайная детерминированная реальность против случайности данных. Отступление от этого принципа всякий раз ведет к разнообразным заблуждениям, бороться с которыми на удивление трудно, но приходится.

****

После такого полемического и, признаться, несколько сумбурного чтива, будет полезно оставить несколько ключевых тезисов:

  • P-value – это вероятность того, что значение тестовой статистики могло бы быть больше (и/или меньше, в зависимости от альтернативной гипотезы), чем ее полученное фактическое значение, если нулевая гипотеза верна (смотрим Рисунок 4).

  • P-value можно использовать как механический индикатор попадания статистики теста в критическую область, не придавая ему больше никаких дополнительных «интерпретаций». В таком ракурсе p-value оказывается просто инструментом методологии Неймана-Пирсона, которую мы описывали в §1. Мы всего лишь сравниваем его с выбранным значением α, и на этом ставим точку.

  • Либо, следуя за Фишером, можно сказать, что это мера того, насколько данные согласуются с нулевой гипотезой. Чем меньше p-value, тем хуже данные поддерживают H0. Можно попробовать сделать следующий шаг и сказать, что чем меньше p-value, тем сильнее мы уверены, что H0 не верна. Звучит вполне естественно и логично, но следует помнить, что это очень сомнительное утверждение, так как мы все еще находимся внутри парадигмы, в основе которой лежит представление о вероятности, как об «объективно» существующей величине, а не байесовской степени уверенности. Переход на байесовские рельсы с необходимостью повлечет за собой полную смену парадигмы, не только философской, но и математической, и в этих рамках для p-value места уже не найдется.

  • Так или иначе, ни в коем случае нельзя рассматривать p-value как вероятность ошибки, или как вероятность гипотезы. Это очень грубые логические ляпы, последствия которых могут быть весьма тяжелыми, даже без всякой философии. Не является p-value и измерителем величины эффекта. Вообще, из неверных представлений о p-value можно составить длинный и веселый хит-парад. Вы без труда найдете множество статей на эту тему. Например, вот одна из наиболее полных. А вот ставшее уже знаменитым заявление Американской статистической ассоциации. Советую ознакомиться.

Продолжение следует