Descripción
Make-An-Audio representa un avance significativo en la generación de texto a audio, aprovechando modelos de difusión mejorados por prompts para superar desafíos como los conjuntos de datos limitados de alta calidad y la complejidad de modelar secuencias de audio largas. El sistema introduce una novedosa técnica de mejora de prompts pseudo, utilizando un enfoque de "destilar y reprogramar" (distill-then-reprogram). Este método alivia eficazmente la escasez de datos al incorporar datos débilmente supervisados, incluidos audios sin lenguaje.
Además, Make-An-Audio emplea un autoencoder de espectrogramas para predecir representaciones de audio auto-supervisadas en lugar de formas de onda crudas. Esta elección arquitectónica, combinada con robustas representaciones de preentrenamiento contrastivo de lenguaje y audio (CLAP), permite al modelo lograr un rendimiento de vanguardia tanto en evaluaciones objetivas como subjetivas. El sistema demuestra una notable controlabilidad a través de la guía libre de clasificadores, permitiendo a los usuarios ajustar las salidas de audio generadas.
Más allá de la generación básica de texto a audio, Make-An-Audio muestra impresionantes capacidades de generalización para tareas X-a-Audio, encarnando el principio de "Ninguna modalidad se queda atrás" (No Modality Left Behind). Esto desbloquea la capacidad de generar audio de alta definición y alta fidelidad basado en entradas de modalidad definidas por el usuario. El sistema soporta la generación personalizada de texto a audio, permitiendo la inyección de objetos únicos en nuevas escenas y la transformación entre diferentes estilos. Ejemplos incluyen la generación de un "llanto de bebé" a partir de un sonido inicial de "trueno", resultando en audio realista y fiel. También soporta el inpainting de audio y la generación de imagen a audio, expandiendo su potencial creativo.
Aspectos destacados de Make-An-Audio
Modelo de difusión mejorado por prompts para generación de texto a audio
Mejora de prompts pseudo utilizando el enfoque "destilar y reprogramar"
Autoencoder de espectrogramas para predicción de representación de audio
Representaciones de preentrenamiento contrastivo de lenguaje y audio (CLAP)
Guía libre de clasificadores para controlabilidad
Generalización para tareas X-a-Audio (ej. imagen a audio, video a audio)
Generación personalizada de texto a audio con inyección de objetos y transformación de estilo
Capacidades de inpainting de audio
Genera audio de alta definición y alta fidelidad
Aborda la escasez de datos en la generación de audio
Primeros pasos con Make-An-Audio
Acceder al Modelo: Obtener acceso al modelo Make-An-Audio.
Integrar vía API: Conectarse a la API del modelo para uso programático.
Proporcionar Prompt de Texto: Introducir las descripciones de texto deseadas para la generación de audio.
Especificar Entrada de Modalidad (Opcional): Para X-a-Audio, proporcionar la imagen o video relevante.
Configurar Guía: Utilizar la guía libre de clasificadores para ajustar las características del audio.
Generar Audio: Iniciar el proceso de generación de audio.
Refinar Salida: Ajustar parámetros para audio personalizado o tareas de inpainting.
Casos de uso de Make-An-Audio
- Síntesis de Voz a partir de Texto
- Generación de Efectos de Sonido
- Inpainting de Audio
- Imagen a Audio
- Video a Audio
- Contenido de Audio Personalizado
- Generación de Música
- Investigación en IA


