Descrição
Make-An-Audio representa um avanço significativo na geração de áudio a partir de texto, aproveitando modelos de difusão aprimorados por prompt para superar desafios como conjuntos de dados limitados de alta qualidade e a complexidade de modelar sequências de áudio longas. O sistema introduz uma nova técnica de aprimoramento de pseudo-prompt, utilizando uma abordagem de "distill-then-reprogram" (destilar e reprogramar). Este método alivia efetivamente a escassez de dados ao incorporar dados fracamente supervisionados, incluindo áudios sem linguagem.
Além disso, o Make-An-Audio emprega um autoencoder de espectrograma para prever representações de áudio autossupervisionadas em vez de formas de onda brutas. Essa escolha arquitetônica, combinada com representações robustas de pré-treinamento contrastivo de linguagem-áudio (CLAP), permite que o modelo alcance desempenho de ponta em avaliações objetivas e subjetivas. O sistema demonstra controlabilidade notável através de orientação livre de classificador, permitindo que os usuários ajustem os áudios gerados.
Além da geração básica de áudio a partir de texto, o Make-An-Audio exibe impressionantes capacidades de generalização para tarefas X-para-Áudio, incorporando o princípio de "Nenhuma Modalidade Deixada Para Trás". Isso desbloqueia a capacidade de gerar áudio de alta definição e alta fidelidade com base em entradas de modalidade definidas pelo usuário. O sistema suporta a geração personalizada de áudio a partir de texto, permitindo a injeção de objetos únicos em novas cenas e a transformação entre diferentes estilos. Exemplos incluem a geração de um "choro de bebê" a partir de um som inicial de "trovão", resultando em áudio realista e fiel. Ele também suporta inpainting de áudio e geração de áudio a partir de imagem, expandindo seu potencial criativo.
Destaques de Make-An-Audio
Modelo de difusão aprimorado por prompt para geração de áudio a partir de texto
Aprimoramento de pseudo-prompt usando a abordagem "distill-then-reprogram"
Autoencoder de espectrograma para previsão de representação de áudio
Representações de pré-treinamento contrastivo de linguagem-áudio (CLAP)
Orientação livre de classificador para controlabilidade
Generalização para tarefas X-para-Áudio (por exemplo, imagem-para-áudio, vídeo-para-áudio)
Geração personalizada de áudio a partir de texto com injeção de objetos e transformação de estilo
Capacidades de inpainting de áudio
Gera áudio de alta definição e alta fidelidade
Aborda a escassez de dados na geração de áudio
Primeiros passos com Make-An-Audio
Acessar Modelo: Obtenha acesso ao modelo Make-An-Audio.
Integrar via API: Conecte-se à API do modelo para uso programático.
Fornecer Prompt de Texto: Insira as descrições de texto desejadas para a geração de áudio.
Especificar Entrada de Modalidade (Opcional): Para X-para-Áudio, forneça a imagem ou vídeo relevante.
Configurar Orientação: Utilize a orientação livre de classificador para ajustar as características do áudio.
Gerar Áudio: Inicie o processo de geração de áudio.
Refinar Saída: Ajuste os parâmetros para áudio personalizado ou tarefas de inpainting.
Casos de uso de Make-An-Audio
- Síntese de Fala a partir de Texto
- Geração de Efeitos Sonoros
- Inpainting de Áudio
- Áudio a partir de Imagem
- Áudio a partir de Vídeo
- Conteúdo de Áudio Personalizado
- Geração de Música
- Pesquisa em IA


