Модель распознала 10 документов из 10 без единой ошибки. Можно ли пускать её на тысячу таких же? Метрология отвечает: 10 из 10 доказывают меньше, чем кажется.
Есть правило трёх: если в n проверенных образцах не нашлось ни одного дефекта, верхняя граница доли дефектов с 95% уверенностью — примерно 3/n.
10 документов без ошибок — доля ошибок может быть до ~26%. 30 документов — до ~9,5%. 100 документов — до ~3%. 300 документов — около 1%.
То есть, чтобы с 95% уверенностью сказать «ошибок не больше 1%», нужно около 300 документов подряд без единой ошибки.
Но и 300 не спасут, если выборка однородная. Ошибки LLM не случайны, как брак на конвейере, — они кучкуются: таблицы, мелкий шрифт, сканы. Поэтому выборку делят на группы по этим признакам и считают отдельно для каждой. Иначе 300 чистых текстовых PDF ничего не скажут о таблицах.
Ещё две вещи, которых нет у партии товара: — невоспроизводимость: прогоните один и тот же документ несколько раз — ответ может отличаться; — дрейф: новая версия модели или промпта обнуляет приёмку, проверку нужно повторить.
И до всего этого договоритесь, что считается ошибкой: любая опечатка или неверное число в ключевом поле. От этого зависит, что вы вообще измеряете.
А на скольких документах вы проверяли модель, прежде чем пустить её в работу?