Um gerador de vídeo com IA pode acertar o movimento e ainda assim devolver um clipe sem nada na trilha de áudio, sem passos, sem ronco de motor, sem ambiente de sala, só silêncio embaixo de pixels em movimento. Essa lacuna é comum o bastante para existir um pequeno grupo de modelos dedicados só a fechar isso, olhando as imagens, calculando o que deveria estar soando e gerando uma trilha sincronizada para aquilo. É assim que funciona de verdade no Picasso IA, e é aí que ainda entra uma revisão humana.
Esses modelos recebem um arquivo de vídeo como entrada e devolvem o mesmo clipe com uma trilha de áudio gerada e sincronizada a ele. Por baixo do capô, eles leem os quadros, calculam o que se move e quando, e produzem uma forma de onda ajustada a esses momentos em vez de um loop genérico colocado embaixo. Essa é a diferença em relação às bibliotecas de som prontas: o áudio é construído para a sua filmagem específica, não procurado e cortado para caber nela.
O Picasso IA roda três modelos feitos para isso na parte de edição de vídeo do catálogo completo. O Mirelo video-to-sfx-v1.5 é feito para foley, passos, batidinhas, impactos, o tipo de som que precisa cair em um quadro específico. O MMAudio recebe um prompt curto de texto mais um prompt negativo opcional, o que o torna bom para camadas ambientes como trânsito, vento ou murmúrio de multidão enquanto exclui sons que você não quer. O Thinksound aceita uma legenda mais uma descrição de raciocínio passo a passo mais longa, então você pode detalhar várias fontes de som em uma cena e deixar o modelo raciocinar como elas se sobrepõem. Nenhum dos três gera música por design, os três são feitos para efeitos sonoros e ambiência.
Os três modelos se sobrepõem no que podem tentar, mas diferem no que realmente fazem bem, então escolher o certo desde o início economiza uma rodada de regeneração. Este é o retrato honesto, não uma comparação de marketing.
| Modelo | Você dá | Melhor em | Evite para |
|---|
| video-to-sfx-v1.5 (mirelo) | Só o clipe, palavras de estilo opcionais | Batidas de foley como passos, batidinhas, impactos | Camadas ambientes longas |
| mmaudio | Um prompt curto mais um prompt negativo | Ambiência controlável, ruído urbano, clima | Sincronia precisa em cortes rápidos |
| thinksound | Uma legenda e uma descrição de raciocínio | Cenas em camadas com várias fontes de som | Pedidos rápidos de uma palavra |
| video-audio-merge | Um arquivo de áudio pronto e o clipe original | Misturar ou substituir uma trilha após gerar | Gerar qualquer som em si |
Se o clipe é uma ação clara, uma porta fechando, uma bola quicando, comece com video-to-sfx-v1.5. Se é um plano ambiente amplo, uma rua, uma floresta, uma praia, comece com mmaudio e use o prompt negativo para manter a música de fora. Se a cena tem várias coisas acontecendo ao mesmo tempo e você consegue descrevê-las em ordem, o thinksound vale o esforço extra de digitação.
O próprio vídeo faz a maior parte do trabalho de sincronia, mas as palavras que você adiciona ainda guiam o que o modelo escuta no quadro. Estes são os hábitos que produzem de forma consistente uma primeira tomada utilizável em vez de uma terceira regeneração.
- Nomeie a fonte, não o clima: escreva passos sobre cascalho em vez de atmosfera tensa, porque os modelos respondem muito melhor a fontes de som concretas do que a adjetivos sobre sensação.
- Ajuste a duração ao clipe: defina a duração pedida como a duração real do clipe em vez do padrão, para a trilha não cortar no meio da ação nem continuar depois do último quadro.
- Gere mais de uma variação: crie duas ou três tomadas por clipe e escolha a que encaixa, porque o mesmo prompt pode produzir uma interpretação mais ajustada ou mais solta a cada execução.
- Diga o que deixar de fora: use o campo de prompt negativo no mmaudio para excluir música ou vozes quando você só quer som ambiente sob a cena.
- Mantenha a referência curta: uma frase clara vale mais que um parágrafo, e uma descrição de raciocínio no thinksound funciona melhor como uma lista ordenada de sons, não como um painel de clima.
Este é o percurso completo de um clipe mudo até um arquivo exportado com áudio sincronizado, usando os modelos acima e a ferramenta de mistura que vem depois. Ele presume apenas um arquivo de vídeo sem som utilizável.
- Envie o clipe mudo. Abra o Toolkit e escolha um arquivo de vídeo, um clipe gerado por IA ou uma gravação de celular funcionam do mesmo jeito aqui.
- Escolha um modelo de som. Selecione video-to-sfx-v1.5 para uma ação específica, mmaudio para ambiência, ou thinksound para uma cena com várias fontes de som em camadas.
- Escreva um prompt curto e concreto. Nomeie os sons que você espera ouvir e ajuste o prompt negativo se o modelo aceitar, depois defina a duração de acordo com o clipe.
- Gere algumas variações e compare. Reproduza cada tomada junto com o vídeo com o som ligado, não só como forma de onda, porque erros de sincronia são fáceis de passar despercebidos sem ver a imagem.
- Misture, substitua ou combine a trilha. Passe a tomada vencedora pelo video-audio-merge para combiná-la com o clipe original, substituindo o áudio por completo ou misturando sob qualquer som existente.
Uma trilha de efeitos sonoros gerada quase nunca soa pronta no momento em que sai do modelo, geralmente precisa se ajustar no nível certo em relação ao resto do que existe no clipe. O video-audio-merge existe exatamente para esse passo. Ele pega o vídeo original e um arquivo de áudio separado, deixa você escolher entre substituir o som original por completo ou misturar a trilha nova por cima, e aplica um multiplicador de volume antes de renderizar, então um efeito gerado que soa alto demais ou baixo demais é corrigido aqui em vez de você regenerar o som em si.
Mantenha um traço da ambiência original sob os efeitos gerados em vez de silenciá-la por completo, filmagens reais quase nunca têm silêncio de verdade, e um toque de ambiente de sala sob o novo som é o que impede a mistura de soar colada por cima.
Com os níveis certos, escolha um formato de saída e um codec, MP4 com H264 cobre a maioria dos destinos, e exporte. O processo inteiro, gerar, comparar, misturar, exportar, geralmente leva alguns minutos por clipe assim que você sabe qual modelo testar primeiro.
Uma página honesta diz onde a ferramenta para de funcionar. Para a geração de vídeo para efeitos sonoros existem limites reais que vale a pena conhecer antes de confiar nela para algo importante.
Cortes rápidos e sequências de várias ações seguidas podem superar a sincronia que esses modelos produzem, uma batida que deveria cair no quadro doze às vezes cai perto mas não exata, e você percebe em um loop mesmo que uma primeira visualização não mostre. Nenhum dos três modelos gera música, por design, então uma trilha que precise de uma trilha sonora ainda precisa de uma ferramenta musical separada ou de uma peça licenciada. O Mirelo video-to-sfx-v1.5 corta vídeos de origem mais longos para dez segundos por execução, então uma cena mais longa precisa mover o deslocamento inicial em várias passagens em vez de uma única geração. Diálogo e sincronia labial ficam totalmente fora do escopo, esses modelos adicionam efeitos e ambiência ao redor da fala, não geram nem alinham uma voz. E como o modelo está inferindo som a partir de pixels, uma ação incomum ou ambígua pode produzir um efeito que soa crível mas que simplesmente está errado para o que realmente aconteceu, por isso comparar o áudio com a imagem antes de publicar importa mais do que confiar na primeira tomada.
A IA consegue mesmo adicionar efeitos sonoros que combinem com o que acontece em um vídeo?
Sim, dentro de limites. Video-to-sfx-v1.5, mmaudio e thinksound leem os quadros de um clipe enviado e geram uma trilha de áudio ajustada à ação visível em vez de um loop genérico. Para uma ação única e clara como uma porta fechando ou passos sobre cascalho, a sincronia costuma ficar próxima. Para cortes rápidos ou várias coisas acontecendo ao mesmo tempo, revise o resultado junto com a imagem antes de confiar nele, porque a sincronia pode desviar em cenas complexas.
Qual modelo devo usar especificamente para sons de passos ou impactos?
Comece com o video-to-sfx-v1.5 da mirelo. Ele é feito para sons estilo foley que precisam cair em um quadro específico, passos, batidinhas, a tranca de uma porta, um impacto, e deixa você gerar várias variações por execução para escolher a tomada com a sincronia mais ajustada. Mmaudio e thinksound podem tentar o mesmo trabalho, mas costumam render melhor em camadas ambientes do que em uma batida única e precisa.
Isso gera música também ou só efeitos sonoros?
Só efeitos sonoros e ambiência, por design. Nenhum dos três modelos de vídeo para áudio no Picasso IA gera música, e o mmaudio, na verdade, já vem com um prompt negativo padrão que exclui música da saída para não adicionar sem querer uma trilha sonora que você não pediu. Se um clipe precisa de trilha sonora, isso é um passo separado com um modelo musical dedicado, não algo que essas ferramentas tentam fazer.
Qual é a duração máxima do vídeo?
Depende do modelo. O video-to-sfx-v1.5 corta um clipe de origem para dez segundos por geração, com um deslocamento inicial que você pode mover para cobrir um vídeo mais longo em várias passagens. Mmaudio e thinksound deixam você definir a duração diretamente, geralmente até a duração do clipe enviado. Para algo mais longo que uma única tomada, planeje gerar por segmentos e combinar os resultados em vez de esperar que uma única passagem cubra a cena inteira.
Posso controlar o estilo do som com um prompt de texto?
Sim, com profundidade diferente por modelo. O mmaudio recebe um prompt curto mais um prompt negativo opcional, então você pode pedir vento e trânsito distante enquanto exclui música ou vozes. O thinksound vai além com uma legenda e um campo de raciocínio passo a passo onde você descreve várias fontes de som em ordem. O video-to-sfx-v1.5 também aceita um prompt opcional, junto com um ajuste de criatividade que empurra o resultado para um realismo mais ajustado ou um áudio mais solto e estilizado.
E se o som gerado não combinar bem com o vídeo?
Regenere antes de reescrever o prompt. Os três modelos são estocásticos, então a mesma entrada pode produzir uma tomada notavelmente diferente na próxima execução, e o video-to-sfx-v1.5 aceita explicitamente gerar várias variações de uma vez por esse motivo. Se duas ou três tentativas erram no mesmo detalhe, é hora de ajustar o prompt ou trocar de modelo, mmaudio para ambiência versus thinksound para uma cena em camadas, geralmente resolve.
Posso misturar o som gerado com o áudio original do vídeo em vez de substituí-lo?
Sim. O video-audio-merge no Picasso IA tem um modo de mistura que sobrepõe a nova trilha ao som original em vez de substituí-lo por completo, junto com um multiplicador de volume para equilibrar os dois. Isso importa quando um clipe já tem ruído ambiente útil e você só quer adicionar efeitos específicos por cima, em vez de apagar tudo que já existia.
Isso funciona com clipes de vídeo gerados no próprio Picasso IA, ou só com filmagens enviadas?
Os dois. Um clipe gerado por um modelo de texto para vídeo ou de imagem para vídeo no Picasso IA baixa igual a qualquer outro vídeo, e você pode passá-lo direto para video-to-sfx-v1.5, mmaudio ou thinksound do mesmo jeito que uma filmagem gravada com celular ou câmera. Esse é, na verdade, o uso mais comum, porque clipes de vídeo gerados por IA costumam sair sem nenhuma trilha de áudio.
Quanto custa adicionar efeitos sonoros a um vídeo?
Cada geração custa créditos, e o valor depende do modelo e das configurações escolhidas, então um número específico aqui ficaria desatualizado rápido. Contas novas começam com créditos grátis, suficientes para testar video-to-sfx-v1.5, mmaudio e thinksound no mesmo clipe e comparar qual encaixa com a sua filmagem antes de gastar mais. Os planos atuais e as cotas de créditos ficam na página de preços, o único lugar confiável para números.
Isso substitui uma biblioteca de som ou um designer de som?
Para muito conteúdo curto, substitui bem o passo de busca: em vez de vasculhar uma biblioteca de stock por um passo ou o rangido de uma porta que quase encaixa, você gera um ajustado à sua filmagem real. Para um filme ou um projeto em que o design de som pesa de verdade, trate isso como uma primeira passagem rápida e não como a mixagem final, Picasso IA versus Artlist mostra onde uma biblioteca de stock ainda ganha em áudio curado à mão e mixado por pessoas.
Um clipe mudo está a um upload de distância de ter som. Abra o Toolkit, escolha video-to-sfx-v1.5, mmaudio ou thinksound, e dê ao seu próximo vídeo com IA algo para soar.