Сначала формализовать базу
Нужно явно описать, как создаётся один случайный билет, сколько билетов участвует, какие правила выигрыша применяются и сколько тиражей сравнивается. Если база не соответствует реальному эксперименту, миллион прогонов только точнее оценит неверную постановку.
Для сравнения стратегии с рандомом обе стороны получают одинаковый бюджет комбинаций. Иначе симуляция измеряет объём, а не качество выбора.
Распределение важнее среднего
Среднее число совпадений скрывает разброс. Две стратегии могут иметь одинаковое среднее, но разную частоту крайних результатов. Поэтому полезно показывать медиану, квантили и долю симуляций, которые не хуже наблюдаемого результата.
Один редкий удачный прогон не доказывает преимущество. Нужно увидеть, где фактический результат находится внутри полного распределения случайной базы.
- Медиана и среднее.
- 5-й и 95-й процентили.
- Доля симуляций не хуже факта.
- Количество прогонов и случайное зерно.
Сколько прогонов достаточно
Требуемое количество зависит от точности и редкости события. Для центральных показателей десятки тысяч прогонов могут быть информативны; для очень редкого выигрыша потребуется значительно больше или аналитический расчёт.
Стабильность можно проверить повтором с другим seed. Если оценка заметно прыгает, прогонов недостаточно либо событие слишком редкое для выбранного метода.
Типичные ошибки
Нельзя менять метрику после просмотра результатов, оставлять только лучший seed или сравнивать модель, настроенную на архиве, с базой на том же архиве без поправки на подбор.
Monte Carlo особенно полезен как проверка здравого смысла: мог ли похожий результат регулярно возникать случайно? Если да, сложная история о скрытом сигнале не нужна.