Generación de MediosAplicaciones 🇷🇺 11.08.2026 08:02

Cómo generar personas realistas mediante decenas de atributos

OpenAIOpenAI MidjourneyMidjourney Stability AIStability AI
Una empresa necesitaba generar conjuntos de datos de imágenes humanas fotorrealistas para una aplicación biométrica, controladas por decenas de atributos. El equipo comparó DALL-E, Midjourney y Stable Diffusion, y eligió un flujo de trabajo local basado en Stable Diffusion. La conclusión clave fue que dividir los atributos en etapas mediante img2img y ControlNet mejora la previsibilidad.
El cliente necesitaba generar un conjunto de datos de imágenes fotorrealistas de personas basado en docenas de atributos específicos, como edad, género, rasgos faciales y cabello. La principal dificultad era controlar tantos atributos, ya que ponerlo todo en un solo prompt causaba conflictos y pérdida de características. El proyecto fue realizado por el equipo de Singularis antes de la generación actual de servicios generativos. Compararon DALL-E, Midjourney y varias versiones de Stable Diffusion, y el cliente eligió una solución local basada en Stable Diffusion. El pipeline utilizó múltiples enfoques: texto a imagen para imágenes base, imagen a imagen para añadir o cambiar características, ControlNet e IP Adapter para control basado en referencias, y Compel para prompts largos. También crearon una matriz de compatibilidad de atributos para decidir qué características podían establecerse juntas y cuáles debían añadirse por etapas. Dividir combinaciones complejas en etapas ayudó a mantener la similitud facial al añadir accesorios como gafas o cambiar el género. También prepararon recomendaciones de palabras clave para cada atributo a fin de mejorar la previsibilidad.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas