Los resultados son similares a los de Stable Diffusion XL, pero se generan más rápido.
Stability AI, los desarrolladores de Stable Diffusion, han presentado una nueva red neuronal llamada Stable Cascade. Utiliza la arquitectura Würstchen para reducir significativamente el espacio latente. Gracias a esto, la red neuronal requiere 16 veces menos recursos durante el entrenamiento.
Imagen del artículo generada por inteligencia artificial
En términos de resultados, Stable Cascade se asemeja a Stable Diffusion XL, pero debería funcionar más rápido. Sin embargo, los autores señalan que la red neuronal aún puede generar personas y rostros de manera incorrecta.
Entre las funciones adicionales se encuentran la creación de variaciones de imágenes y el prompting a partir de una imagen. En el primer caso, la red neuronal experimenta con la imagen proporcionada: analiza la imagen de origen y sugiere opciones similares. A continuación, un ejemplo de generación de variaciones sin un prompt adicional, donde la red neuronal simplemente recibió la imagen de la izquierda.
El prompting con una imagen funciona de manera un poco diferente. Se añade ruido a la imagen de origen para perder detalles, después se utiliza un modelo como base para la generación. En términos simples, la red neuronal crea algo con las mismas siluetas, pero con otros detalles, basándose en la descripción textual. En el ejemplo a continuación, se añadió un 80% de ruido a la imagen de origen y el prompt "Una persona montando un roedor".
Actualmente, se puede probar Stable Cascade en Hugging Face: es una demo en línea no oficial con capacidades limitadas: solo se puede generar a partir de una solicitud de texto. El código está disponible en GitHub.
Las imágenes generadas a través de Stable Cascade están destinadas únicamente para uso no comercial.
Comentarios
Sin comentarios
Agregar Comentario