Pular para o conteúdo principal
ToolPotion

Make-An-Audio

Make-An-Audio é um sistema de geração de áudio a partir de texto que emprega modelos de difusão aprimorados por prompt. Ele aborda a escassez de dados e a complexidade do áudio usando aprimoramento de pseudo-prompt e autoencoders de espectrograma. O sistema alcança resultados de ponta e oferece controlabilidade para gerar áudio de alta definição e alta fidelidade a partir de várias entradas.

Visitar URL

Descrição

Make-An-Audio representa um avanço significativo na geração de áudio a partir de texto, aproveitando modelos de difusão aprimorados por prompt para superar desafios como conjuntos de dados limitados de alta qualidade e a complexidade de modelar sequências de áudio longas. O sistema introduz uma nova técnica de aprimoramento de pseudo-prompt, utilizando uma abordagem de "distill-then-reprogram" (destilar e reprogramar). Este método alivia efetivamente a escassez de dados ao incorporar dados fracamente supervisionados, incluindo áudios sem linguagem.

Além disso, o Make-An-Audio emprega um autoencoder de espectrograma para prever representações de áudio autossupervisionadas em vez de formas de onda brutas. Essa escolha arquitetônica, combinada com representações robustas de pré-treinamento contrastivo de linguagem-áudio (CLAP), permite que o modelo alcance desempenho de ponta em avaliações objetivas e subjetivas. O sistema demonstra controlabilidade notável através de orientação livre de classificador, permitindo que os usuários ajustem os áudios gerados.

Além da geração básica de áudio a partir de texto, o Make-An-Audio exibe impressionantes capacidades de generalização para tarefas X-para-Áudio, incorporando o princípio de "Nenhuma Modalidade Deixada Para Trás". Isso desbloqueia a capacidade de gerar áudio de alta definição e alta fidelidade com base em entradas de modalidade definidas pelo usuário. O sistema suporta a geração personalizada de áudio a partir de texto, permitindo a injeção de objetos únicos em novas cenas e a transformação entre diferentes estilos. Exemplos incluem a geração de um "choro de bebê" a partir de um som inicial de "trovão", resultando em áudio realista e fiel. Ele também suporta inpainting de áudio e geração de áudio a partir de imagem, expandindo seu potencial criativo.

Destaques de Make-An-Audio

  • Modelo de difusão aprimorado por prompt para geração de áudio a partir de texto

  • Aprimoramento de pseudo-prompt usando a abordagem "distill-then-reprogram"

  • Autoencoder de espectrograma para previsão de representação de áudio

  • Representações de pré-treinamento contrastivo de linguagem-áudio (CLAP)

  • Orientação livre de classificador para controlabilidade

  • Generalização para tarefas X-para-Áudio (por exemplo, imagem-para-áudio, vídeo-para-áudio)

  • Geração personalizada de áudio a partir de texto com injeção de objetos e transformação de estilo

  • Capacidades de inpainting de áudio

  • Gera áudio de alta definição e alta fidelidade

  • Aborda a escassez de dados na geração de áudio

Primeiros passos com Make-An-Audio

  1. Acessar Modelo: Obtenha acesso ao modelo Make-An-Audio.

  2. Integrar via API: Conecte-se à API do modelo para uso programático.

  3. Fornecer Prompt de Texto: Insira as descrições de texto desejadas para a geração de áudio.

  4. Especificar Entrada de Modalidade (Opcional): Para X-para-Áudio, forneça a imagem ou vídeo relevante.

  5. Configurar Orientação: Utilize a orientação livre de classificador para ajustar as características do áudio.

  6. Gerar Áudio: Inicie o processo de geração de áudio.

  7. Refinar Saída: Ajuste os parâmetros para áudio personalizado ou tarefas de inpainting.

Casos de uso de Make-An-Audio

  • Síntese de Fala a partir de Texto
  • Geração de Efeitos Sonoros
  • Inpainting de Áudio
  • Áudio a partir de Imagem
  • Áudio a partir de Vídeo
  • Conteúdo de Áudio Personalizado
  • Geração de Música
  • Pesquisa em IA

Perguntas frequentes de Make-An-Audio

Avaliações de Make-An-Audio

Carregando...

Ferramentas de IA populares como Make-An-Audio

Modelos de IA

AudioGen é um modelo de IA generativa autorregressiva que cria amostras de áudio com base em legendas de texto descritivas. Ele aborda desafios na geração de áudio, como separação…

Geradores de música com IA

Modelos de IA

AudioLDM é um framework de geração de áudio a partir de texto que utiliza modelos de difusão latente. Ele traduz várias modalidades para uma 'linguagem de áudio' (LOA) unificada…

Geradores de música com IA

Modelos de IA

SoundStorm é um modelo de IA para geração de áudio eficiente e não autorregressiva. Ele produz áudio de alta qualidade duas ordens de magnitude mais rápido do que métodos…

Modelos de IA e LLMs

Modelos de IA

MusicLM é um modelo de IA que gera música de alta fidelidade a partir de descrições textuais. Ele pode produzir música com até 24 kHz que permanece consistente por vários minutos,…

Geradores de música com IA

Repositórios de IA no GitHub

Audiocraft é uma biblioteca PyTorch para geração e processamento de áudio com deep learning. Ela oferece modelos de ponta como MusicGen para geração de música controlável e…

Geradores de música com IA

Modelos de IA

Voicebox é um modelo de IA generativa para fala que generaliza em várias tarefas com desempenho de ponta. Ele pode sintetizar fala, remover ruído, editar conteúdo, converter…

Geradores de voz com IA

Apps de IA

Stable Audio é uma ferramenta de IA generativa para criar música e efeitos sonoros originais. Permite aos usuários transformar prompts de texto em áudio de alta qualidade com até…

DestaqueGeradores de música com IA

Explore demonstrações de síntese de áudio impulsionadas pelo DiffWave, um modelo de difusão versátil. Este recurso exibe vocodificação neural, geração condicional por classe,…

Modelos de IA e LLMs