Visão Geral
MMAudio gera áudio sincronizado a partir do conteúdo de vídeo usando IA, resolvendo uma das partes mais demoradas da pós-produção de vídeo: encontrar ou criar som que realmente se encaixe no que está na tela. Na Picasso IA, você faz upload de um clipe silencioso ou com pouco áudio, descreve os sons desejados e o modelo sintetiza áudio que corresponde ao contexto visual. Um cineasta adicionando chuva ambiente a uma cena externa, um criador de mídia social precisando de sons sutis de pegadas para um vídeo de culinária, ou um animador querendo um suave zumbido de máquina para uma demonstração de tecnologia podem usar sem nenhum software de áudio. O resultado é um arquivo de vídeo para download com o áudio gerado já incorporado e pronto para usar.
Como Funciona
- Faça upload do seu arquivo de vídeo para o painel de entrada do modelo.
- Escreva um prompt de texto descrevendo os sons desejados, como "chuva leve em folhas" ou "ambiente movimentado de café."
- Opcionalmente, adicione um prompt negativo para excluir sons que não deseja, como música ou fala, para manter a saída focada no que você precisa.
- Ajuste a duração para corresponder ao comprimento do seu clipe e defina o número de passos de inferência para controlar o equilíbrio entre qualidade e velocidade.
- Envie o trabalho e baixe seu vídeo com a faixa de áudio sintetizado já anexada.
Perguntas Frequentes
Preciso de habilidades de programação ou conhecimento técnico para usar isso?
Não, basta abrir MMAudio na Picasso IA, ajustar as configurações desejadas e clicar em gerar.
MMAudio é gratuito para experimentar?
Sim, você pode executar o modelo gratuitamente na Picasso IA sem se inscrever. Créditos podem ser aplicados para gerações mais longas ou de qualidade superior.
Quanto tempo leva para obter resultados?
A maioria das gerações é concluída em menos de um minuto para clipes de até 8 segundos. Clipes mais longos ou contagens de passos de inferência mais altas podem levar um pouco mais.
Qual formato de saída o MMAudio retorna?
O modelo retorna um arquivo de vídeo com o áudio gerado já mesclado, pronto para download e colocado na sua linha do tempo de edição.
Posso personalizar o estilo ou conteúdo de áudio?
Sim. O prompt de texto permite descrever qualquer ambiente sonoro em linguagem simples, e o prompt negativo permite excluir tipos de sons específicos como música ou vozes. A configuração de força CFG controla como a saída segue seu prompt.
O que acontece se o áudio gerado não corresponder bem ao vídeo?
Tente refinar seu prompt de texto com descritores mais específicos, aumente o número de passos de inferência para melhor qualidade, ou use uma seed aleatória diferente para obter uma variação nova do áudio.