A/B-тесты в рассылках: когда они возможны и как не обмануть себя
Порог значимости, размер выборки и почему малым базам тестировать нечего
Mailvex · 9 августа 2026 · 5 мин чтения

Достоверный A/B-тест требует примерно тысячи получателей на каждый вариант и порога значимости 95%. При базе меньше двух тысяч адресов тестировать нечего: любая разница будет случайной. Ниже — как понять, хватает ли вам базы, что тестировать и что делать, если размера не хватает.
Главная ошибка: тест без выборки
Типичная картина: рассылка ушла на двести адресов в каждом варианте, у первого открываемость 22%, у второго 25%. Вывод: второй вариант лучше на три процентных пункта. На самом деле вывода нет — при такой выборке разница в три пункта возникает случайно примерно в половине случаев.
Я видел сотни A/B-тестов, которые «доказали» что-то на двухстах получателях с разницей в три процента открываемости. Это не данные, это шум.
Проблема не в том, что тест плохо проведён. Проблема в том, что при малой выборке достоверный результат получить невозможно в принципе, сколько ни повторяй.
Порог 95% и что показывают сервисы
Статистическая значимость отвечает на один вопрос: какова вероятность, что наблюдаемая разница возникла случайно. Отраслевой стандарт — 95%, то есть вероятность случайности не выше пяти процентов.
Здесь кроется ловушка, в которую попадают почти все. Сервисы рассылок показывают уровень уверенности, и человек видит фразу вроде «победитель: вариант А, уверенность 87%» — это звучит убедительно.
Но 87% значимости означает, что примерно в одном случае из восьми вы объявите победителем вариант, который на самом деле не лучше. Порог 95% выбран не случайно: ниже него результат нельзя считать надёжным.
95% и не меньше
Отраслевой стандарт порога статистической значимости для A/B-тестов рассылок
Какая база нужна для теста
Нужный размер выборки зависит от трёх вещей: базового значения метрики, размера различия, которое вы хотите уловить, и желаемой уверенности. Чем меньше различие, тем больше нужна выборка.
Практический ориентир — около тысячи получателей на вариант как нижняя граница. Но это минимум для крупных различий; чтобы уловить разницу в пять процентов, понадобится в разы больше.
Отсюда таблица, которая сразу отвечает на вопрос «а мне вообще есть смысл тестировать».
| Размер базы | Что можно тестировать | Что бессмысленно |
|---|---|---|
| до 2 000 | ничего надёжно | любые A/B-тесты |
| 2 000 – 10 000 | крупные различия в переходах | тонкая настройка формулировок |
| 10 000 – 50 000 | переходы, время отправки, оффер | различия меньше 20% |
| свыше 50 000 | почти всё, включая конверсию | — |
Отдельная сложность: конверсия в покупку — метрика с низким базовым значением, обычно единицы процентов. Чем ниже базовое значение, тем больше нужна выборка. Поэтому тестировать конверсию гораздо сложнее, чем переходы, и для большинства баз это недоступно.

Что тестировать в первую очередь
При ограниченной выборке тестировать надо то, что даёт крупные различия. Мелкие правки формулировок требуют выборок, которых у вас нет.
- тема письма — влияет на открытия, различия бывают крупными
- время отправки — иногда даёт разницу в разы
- оффер: скидка против бесплатной доставки — крупное различие
- главная кнопка: текст и расположение
- длина письма: короткое против подробного
Про тему письма есть важная оговорка. Она влияет прежде всего на открываемость, а открываемость искажена защитой приватности почты Apple, которая засчитывает открытия автоматически. То есть тест темы измеряет метрику, которой нельзя верить.
Выход — измерять тест темы не по открытиям, а по переходам от числа отправленных. Тема влияет и на них, просто эффект слабее, и выборка потребуется больше.
Правила, которые нельзя нарушать
- одна переменная за раз — иначе непонятно, что сработало
- случайное распределение адресов, а не по алфавиту или дате подписки
- одинаковое время отправки для обоих вариантов
- не останавливать тест досрочно, увидев красивую разницу
- не объявлять победителя ниже порога в 95%
- проверять один и тот же результат повторным тестом при важном решении
Про досрочную остановку стоит сказать отдельно. Если смотреть на результат каждый час и остановиться, когда разница выглядит убедительной, вы гарантированно найдёте «победителя» даже там, где разницы нет. Размер выборки определяется до теста, а не по ходу.
Что делать, если база маленькая
Это не приговор, а смена подхода. При базе меньше нескольких тысяч адресов A/B-тесты заменяются на другие инструменты.
- внедряйте заведомо хорошие решения без теста: одна кнопка вместо трёх, отступы, размер шрифта на мобильном
- сравнивайте не варианты одного письма, а типы писем между собой по выручке на письмо
- смотрите на собственную динамику от месяца к месяцу, а не на разовые сравнения
- копите наблюдения качественно: что люди спрашивают в ответных письмах, на что жалуются
Отдельно: накопительный тест. Если отправлять одинаковые письма по одной схеме несколько месяцев, а потом сменить схему и сравнить периоды, выборка накопится сама. Это медленнее A/B-теста, зато доступно при любой базе.
Как провести первый тест
Порядок такой: сформулировать гипотезу, посчитать нужную выборку, разделить базу случайным образом, отправить оба варианта одновременно, дождаться окончания срока и только потом смотреть результат.
Гипотеза должна быть проверяемой. «Посмотрим, какая тема сработает лучше» — не гипотеза. «Тема с конкретной цифрой даст больше переходов, чем тема с вопросом» — гипотеза, у которой есть исход.
В Mailvex можно быстро собрать два варианта письма из одного шаблона: скопировать письмо, изменить проверяемый элемент и выгрузить оба HTML для загрузки в свой сервис рассылок. Брендбук применяется к обоим одинаково, поэтому различие остаётся ровно в том элементе, который вы тестируете.
Соберите два варианта письма из одного шаблона.
Смотреть шаблоныЧастые вопросы
Какая минимальная база для A/B-теста?
Ориентировочно тысяча получателей на каждый вариант, то есть база от двух тысяч адресов. И это минимум для крупных различий: чтобы уловить разницу в несколько процентов, нужны десятки тысяч.
Сервис показывает уверенность 90%, можно считать победителя?
Нет. Стандартный порог — 95%. При 90% вы примерно в одном случае из десяти объявите победителем вариант, который не лучше. Либо продолжайте тест, либо признайте, что различия не обнаружено.
Что делать, если база слишком мала для тестов?
Внедрять заведомо хорошие решения без проверки, сравнивать типы писем между собой по выручке на письмо и смотреть собственную динамику от месяца к месяцу. Накопительное сравнение периодов работает при любой базе, просто медленнее.