Пользователи чаще приходят не «генерировать искусство», а решать конкретную проблему с фото
Мы обезличили последние 100 запросов и посмотрели на намерение, а не на формулировку. Самые крупные группы — точечные правки, творческие сцены и улучшение внешности. Это объясняет, почему ясное меню и хороший первый результат важнее огромной библиотеки стилей.
Что вошло в выборку и чего из неё нельзя заключить
Взяты 100 последовательных генераций из технического аудита. Тексты использовались только для категоризации; имена, фотографии и идентификаторы пользователей в статью не попали. Для 83 запросов классификатор сохранил intent, у 17 он отсутствовал в выгрузке.
Это срез поведения внутри одного продукта, а не исследование всего рынка. Он показывает реальные формулировки и узкие места интерфейса, но доли зависят от рекламы, бесплатных сценариев и текущего меню.
Что люди просили изменить
17 запросов не получили intent в доступной выгрузке; категории взаимоисключающие и основаны на основном намерении.
Люди пишут результат, а не техническое задание
Реальные команды короткие, разговорные и часто содержат опечатки: «убери фон», «улучши качество», «подними ступни». Пользователь ожидает, что продукт поймёт контекст изображения. Заставлять его изучать инженерный промпт — перекладывать работу интерфейса на человека.
«Убери лишнее» требует определить визуальную цель.
«Сделай красиво» скрывает свет, стиль и назначение.
Текст, лицо, фон и эмоция конкурируют в одном сообщении.
Опечатка не должна ломать очевидное намерение.
Глупый запрос и сложная задача — не одно и то же
Короткая команда может быть полностью достаточной, если объект однозначен на фото. А длинный запрос может оставаться невыполнимым из-за противоречий, точного текста или отсутствующей части лица. Поэтому система должна уточнять только решение, которое нельзя надёжно вывести из изображения.
В выборке 75 генераций завершились результатом, 25 — ошибкой или отклонением. Это не показатель качества по intent: среди неудач есть небезопасные сценарии, запросы на видео в фото-флоу и задачи с недоступной информацией. Для продуктового решения причины нужно разделять.
Пять выводов для AI-фоторедактора
- Точечная правка должна быть сценарием первого класса.Не прятаться внутри свободной генерации.
- Классификатор обязан терпеть опечатки.Исправлять очевидную форму, не меняя смысл.
- Один вопрос задаётся только при реальной неоднозначности.Не превращать каждую команду в анкету.
- Составные задачи лучше разбивать внутри пайплайна.Сохраняя главное действие приоритетным.
- Качество оценивается по intent.Для удаления важен фон, для портрета — лицо, для текста — каждая буква.
Какие проблемы скрываются внутри крупных категорий
За точечной правкой обычно стоит практический дефект: лишний человек, неудачный фон, надпись, свет или мелкая деталь лица. Ретушь часто означает желание получить пригодную аватарку без студии. Творческие запросы делятся на образ по собственному фото и новую сцену, где точное сходство может быть менее важным.
Отдельно стоят задачи на границе возможностей: длинный точный текст, восстановление полностью закрытого объекта, перенос нескольких людей между кадрами и просьба создать движение внутри фото-флоу. Их нельзя смешивать с обычным браком модели. Лучше распознать ограничение заранее и предложить другой процесс, чем запускать заведомо слабую генерацию.
Пользователю нужен не промпт, а предсказуемое изменение фотографии
Лучший продукт принимает обычный язык, понимает визуальный контекст и задаёт минимум уточнений. Библиотека эффектов привлекает внимание, но ежедневную ценность создают точные правки.
