генеративных сервисов. Они сравнили DALL-E, Midjourney и различные версии Stable Diffusion, и заказчик выбрал локальное решение на основе Stable Diffusion. В конвейере использовалось несколько подходов: text-to-image для базовых изображений, image-to-image для добавления или изменения признаков, ControlNet и IP Adapter для контроля на основе референсов, а также Compel для длинных запросов. Также была создана матрица совместимости атрибутов, чтобы решить, какие признаки можно задавать вместе, а какие следует добавлять поэтапно. Разделение сложных комбинаций на этапы помогло сохранить сходство лиц при добавлении таких аксессуаров, как очки, или при изменении пола. Кроме того, для каждого атрибута были подготовлены рекомендации по ключевым словам, чтобы повысить предсказуемость результатов.