Статистическая значимость
Статистическая значимость — вывод, что различие, замеченное в тесте, вряд ли объясняется одной случайностью при пороге, заданном до начала теста.
Как работает
Даже две одинаково хорошие версии страницы обычно показывают разный коэффициент конверсии: заказы приходят случайно. p-значение — это то, как часто одинаковые версии показали бы разрыв не меньше вашего. Если оно ниже уровня, заданного заранее, чаще всего 5% (уровень доверия 95%), различие считается значимым.
Значимость говорит, что разрыв, вероятно, не случаен, но не о том, насколько он важен. Если остановить A/B-тест при первом значимом показании, ложные победители появляются намного чаще заявленного уровня, поэтому размер выборки фиксируют заранее. О том, что делать, когда трафика мало, рассказывает руководство по A/B-тестам для небольших магазинов.
Формула
z = (CR версии B − CR версии A) ÷ √(p × (1 − p) × (1/n версии A + 1/n версии B)); CR — коэффициент конверсии, n — клики, p — объединённая доля обеих версий; при 5% значимо, если z выходит за ±1,96
Пример
Пример на вымышленном магазине, числа не клиентские.
Магазин посуды делит 8 000 кликов за месяц между двумя макетами. A: 150 заказов из 4 000 кликов, 3,75%. B: 170 из 4 000, 4,25%, прирост 13%. Объединённая доля: 4%. z = 0,005 ÷ √(0,04 × 0,96 × 0,0005) = 1,14, p-значение ≈ 0,25: не значимо. Чтобы заметить такой прирост при 5% и мощности 80%, нужно около 23 100 кликов на версию: почти шесть месяцев трафика.
Как это читает GetProfit
Вместо теста на значимость лента изменений портала оценивает правку по фиксированным диапазонам за 14 дней: «сработало», если ROAS вырос выше 1,2× при конверсиях не ниже 0,8×; «навредило», если ROAS упал ниже 0,8× или конверсии опустились ниже половины прежних; вердикта нет, если прошло меньше 7 дней или нет конверсий. Для масштаба: в данных GetProfit ежемесячный ROAS магазина обычно отклоняется на 16% от собственной медианы (медиана по 110 магазинам, у которых не меньше 8 месяцев данных, июнь 2025 — июнь 2026).
Верно и неверно
- Неверно: «Значимо на 95%, значит, B лучше с вероятностью 95%». Верно: 5% — это то, как часто одинаковые версии всё равно показали бы значимый разрыв, а не вероятность того, что B выиграет.
- Неверно: «Не значимо, значит, макет ни на что не влияет». Верно: в примере не хватило трафика; прирост в 13% может быть настоящим.
Источники
- 7.1.3.1. Critical values and p values (NIST/SEMATECH e-Handbook of Statistical Methods, на английском) — уровень значимости, заданный заранее. Проверено 02.10.2026.
- How Not To Run an A/B Test (Evan Miller, на английском) — если заглядывать в результаты по ходу теста, растёт число ложных срабатываний. Проверено 02.10.2026.
- Sample Size Calculator (Evan Miller, на английском) — размер выборки на версию (базовая конверсия 3,75%, эффект 0,5 процентного пункта в абсолютном выражении, мощность 80%, α 5%). Проверено 02.10.2026.
- Данные GetProfit: 110 интернет-магазинов, июнь 2025 — июнь 2026 — ежемесячное отклонение ROAS от медианы каждого магазина.