Первая попытка дешевле, но хороший финал иногда требует второго кандидата
В семидневном срезе 317 выданных генераций прошли итоговую проверку. Для 74 из них система создала повторного кандидата. Оценочная стоимость изображения в группе с retry была выше примерно в 2,6 раза, но сравнивать только цену попытки неверно: важна стоимость пригодного результата.
Что именно посчитано
Мы взяли обезличенные события завершённых генераций за семь дней и разделили их по признаку quality_gate_retry_count. В группе без retry оказалось 243 результата, с одним повтором — 74. Учитывалась оценочная стоимость вызовов модели для изображения; инфраструктура, проверка, хранение и разработка сюда не входят.
| Группа | Результатов | Средняя image-cost | Медиана quality score |
|---|---|---|---|
| Без retry | 243 | $0,039 | 96 |
| С retry | 74 | $0,103 | 95 |
Почему стоимость попытки вводит в заблуждение
Дешёвый кадр бесполезен, если он не выполнил запрос. Правильнее считать затраты до первого пригодного результата: генерацию кандидатов, автоматическую оценку, задержку и вероятность ручной переделки. Retry дорожает, но может заменить повторный запуск пользователем и сохранить контекст задачи.
Средняя оценочная стоимость генерации изображения среди выданных результатов с известным числом повторов.
Retry оправдан, если причина случайна и проверяема
Лишний палец, рваный край или повтор текстуры может исчезнуть в новом кандидате.
Повтор полезен, если система усиливает конкретно проигнорированную инструкцию.
Пограничный вариант можно улучшить без смены замысла.
Допустим один контролируемый повтор с усиленным сохранением личности.
Когда автоматический повтор лишь сжигает бюджет
Retry не создаёт информацию, которой нет в исходнике, не устраняет противоречие в запросе и не превращает генератор в точный типографский движок. Если человек полностью закрывает сложный объект, требуется длинный текст или пользователь просит одновременно пять преобразований, сначала нужно изменить постановку задачи.
Полезный лимит — один автоматический повтор по диагностированной причине. После него лучше показать понятную рекомендацию: выбрать другой исходник, разделить задачу или назвать объект точнее.
Что считать продуктовой команде
- Стоимость пригодного финала.Все кандидаты и проверки до выдачи.
- Доля спасённых retry.Сколько слабых первых попыток стали полезными.
- Задержка p50 и p95.Качество не должно превращаться в бесконечное ожидание.
- Причина повторов.Если одна ошибка доминирует, выгоднее чинить prompt builder.
- Действие после результата.Повтор, правка, оплата или уход показывают реальную ценность лучше score.
Три сценария с разной ценой ошибки
Аватарка. Потеря сходства делает красивый кадр бесполезным, поэтому один retry оправдан даже при высокой технической оценке. Удаление объекта. Повтор имеет смысл, если кандидат оставил артефакт или оборвал линию; если скрытый фон неизвестен, новый запуск лишь предложит другую догадку.
Творческая иллюстрация. Вариативность допустима, и контроль должен вмешиваться только при явном дефекте. Для карточки товара, напротив, изменённая упаковка или неверная надпись ведут к полной переделке. Порог retry должен зависеть от намерения, а не быть одинаковым для любого изображения.
Retry должен покупать качество, а не маскировать системную ошибку
Один диагностированный повтор разумен. Повторять без причины дорого и медленно. Главная метрика — не цена вызова, а цена результата, который пользователь готов сохранить или купить.
