Un generador de video con IA puede clavar el movimiento y aun así devolver un clip sin nada en la pista de audio, sin pasos, sin ronroneo de motor, sin ambiente de sala, solo silencio bajo píxeles en movimiento. Ese vacío es lo bastante común como para que exista un pequeño grupo de modelos dedicados solo a cerrarlo, mirando el metraje, calculando qué debería sonar y generando una pista sincronizada para ello. Así funciona realmente en Picasso IA, y ahí es donde todavía hace falta una pasada humana.
Estos modelos toman un archivo de video como entrada y devuelven el mismo clip con una pista de audio generada y sincronizada. Por debajo, leen los fotogramas, calculan qué se mueve y cuándo, y producen una forma de onda ajustada a esos momentos en lugar de un loop genérico puesto debajo. Esa es la diferencia con las bibliotecas de sonido en stock: el audio se construye para tu metraje concreto, no se busca y se recorta para que encaje.
Picasso IA ejecuta tres modelos hechos para esto en la parte de edición de video del catálogo completo. Mirelo video-to-sfx-v1.5 está pensado para foley, pasos, golpecitos, impactos, el tipo de sonido que necesita caer en un fotograma concreto. MMAudio toma un prompt corto de texto más un prompt negativo opcional, lo que lo hace bueno para camas ambientales como tráfico, viento o murmullo de multitud mientras excluye sonidos que no quieres. Thinksound acepta un título más una descripción de razonamiento paso a paso más larga, así que puedes detallar varias fuentes de sonido en una escena y dejar que el modelo razone cómo se superponen. Ninguno de los tres genera música por diseño, los tres están hechos para efectos de sonido y ambiente.
Los tres modelos se solapan en lo que pueden intentar pero difieren en lo que realmente hacen bien, así que elegir el correcto desde el principio ahorra una ronda de regeneración. Este es el desglose honesto, no una comparación de marketing.
| Modelo | Le das | Mejor para | Evítalo para |
|---|
| video-to-sfx-v1.5 (mirelo) | Solo el clip, palabras de estilo opcionales | Golpes de foley como pasos, golpecitos, impactos | Camas ambientales largas |
| mmaudio | Un prompt corto más un prompt negativo | Ambiente controlable, ruido urbano, clima | Sincronización precisa en cortes rápidos |
| thinksound | Un título y una descripción de razonamiento | Escenas superpuestas con varias fuentes de sonido | Peticiones rápidas de una palabra |
| video-audio-merge | Un archivo de audio terminado y el clip original | Mezclar o reemplazar una pista tras generar | Generar cualquier sonido en sí |
Si el clip es una acción clara, una puerta que se cierra, una pelota que rebota, empieza con video-to-sfx-v1.5. Si es un plano ambiental amplio, una calle, un bosque, una playa, empieza con mmaudio y apóyate en el prompt negativo para dejar fuera la música. Si la escena tiene varias cosas ocurriendo a la vez y puedes describirlas en orden, thinksound merece el tecleo extra.
El propio video hace la mayor parte del trabajo de sincronización, pero las palabras que añadas siguen guiando lo que el modelo escucha en el fotograma. Estos son los hábitos que producen de forma constante una primera toma utilizable en lugar de una tercera regeneración.
- Nombra la fuente, no el ánimo: escribe pasos sobre grava en vez de atmósfera tensa, porque los modelos responden mucho mejor a fuentes de sonido concretas que a adjetivos sobre sensaciones.
- Ajusta la duración al clip: fija la duración pedida a la duración real del clip en lugar del valor por defecto, para que la pista no se corte a mitad de la acción ni siga sonando tras el último fotograma.
- Genera más de una variación: crea dos o tres tomas por clip y elige la que encaje, porque el mismo prompt puede producir una interpretación más ajustada o más suelta en cada ejecución.
- Di qué dejar fuera: usa el campo de prompt negativo en mmaudio para excluir música o voces cuando solo quieres sonido ambiental bajo la escena.
- Mantén la referencia corta: una frase clara vale más que un párrafo, y una descripción de razonamiento en thinksound funciona mejor como una lista ordenada de sonidos, no como un tablero de ánimo.
Este es el recorrido completo desde un clip mudo hasta un archivo exportado con audio sincronizado, usando los modelos anteriores y la herramienta de mezcla que viene después. Solo presupone un archivo de video sin sonido útil.
- Sube el clip mudo. Abre el Toolkit y elige un archivo de video, un clip generado con IA o una grabación de móvil funcionan igual aquí.
- Elige un modelo de sonido. Escoge video-to-sfx-v1.5 para una acción concreta, mmaudio para ambiente, o thinksound para una escena con varias fuentes de sonido superpuestas.
- Escribe un prompt corto y concreto. Nombra los sonidos que esperas oír y ajusta el prompt negativo si el modelo lo admite, luego fija la duración según el clip.
- Genera varias variaciones y compáralas. Reproduce cada toma junto al video con el sonido activado, no solo como forma de onda, porque los errores de sincronía son fáciles de pasar por alto sin ver la imagen.
- Mezcla, reemplaza o combina la pista. Pasa la toma ganadora por video-audio-merge para combinarla con el clip original, reemplazando el audio por completo o mezclándola bajo cualquier sonido existente.
Una pista de efectos de sonido generada casi nunca suena terminada en el momento en que sale del modelo, normalmente necesita sentarse al nivel correcto junto a lo demás que hay en el clip. Video-audio-merge existe justo para este paso. Toma el video original y un archivo de audio aparte, deja elegir entre reemplazar el sonido original por completo o mezclar la pista nueva encima, y aplica un multiplicador de volumen antes de renderizar, así que un efecto generado que suena demasiado alto o demasiado bajo se corrige aquí en lugar de regenerar el sonido en sí.
Deja un rastro del ambiente original bajo los efectos generados en lugar de silenciarlo del todo, el metraje real casi nunca tiene silencio verdadero, y un toque de ambiente de sala bajo el nuevo sonido es lo que evita que la mezcla suene pegada encima.
Una vez que los niveles están bien, elige un formato de salida y un códec, MP4 con H264 cubre la mayoría de destinos, y exporta. Todo el proceso, generar, comparar, mezclar, exportar, suele llevar unos minutos por clip una vez que sabes qué modelo probar primero.
Una página honesta dice dónde deja de funcionar la herramienta. Para la generación de video a efectos de sonido hay límites reales que conviene conocer antes de confiar en ella para algo importante.
Los cortes rápidos y las secuencias de varias acciones seguidas pueden superar la sincronización que producen estos modelos, un golpe que debería caer en el fotograma doce a veces cae cerca pero no exacto, y se nota en un bucle aunque no se note en un primer visionado. Ninguno de los tres modelos genera música, por diseño, así que una pista que necesite banda sonora sigue necesitando una herramienta musical aparte o una pieza con licencia. Mirelo video-to-sfx-v1.5 recorta los videos de origen más largos a diez segundos por ejecución, así que una escena más larga necesita mover el desplazamiento inicial en varias pasadas en lugar de una sola generación. El diálogo y la sincronía labial quedan totalmente fuera del alcance, estos modelos añaden efectos y ambiente alrededor del habla, no generan ni alinean una voz. Y como el modelo infiere el sonido a partir de píxeles, una acción inusual o ambigua puede producir un efecto que suena creíble pero que simplemente es incorrecto para lo que realmente pasó, por lo que comparar el audio con la imagen antes de publicar importa más que confiar en la primera toma.
¿La IA puede añadir de verdad efectos de sonido que coincidan con lo que pasa en un video?
Sí, con límites. Video-to-sfx-v1.5, mmaudio y thinksound leen los fotogramas de un clip subido y generan una pista de audio ajustada a la acción visible en lugar de un loop genérico. Para una acción única y clara como una puerta que se cierra o pasos sobre grava, la sincronía suele quedar cerca. Para cortes rápidos o varias cosas ocurriendo a la vez, revisa el resultado junto a la imagen antes de confiar en él, porque la sincronía puede desviarse en escenas complejas.
¿Qué modelo debería usar para sonidos de pasos o impactos en concreto?
Empieza con video-to-sfx-v1.5 de mirelo. Está pensado para sonidos tipo foley que necesitan caer en un fotograma concreto, pasos, golpecitos, el pestillo de una puerta, un impacto, y deja generar varias variaciones por ejecución para que elijas la toma con la sincronía más ajustada. Mmaudio y thinksound pueden intentar el mismo trabajo pero suelen rendir mejor en camas ambientales que en un golpe único y preciso.
¿Esto genera también música o solo efectos de sonido?
Solo efectos de sonido y ambiente, por diseño. Ninguno de los tres modelos de video a audio en Picasso IA genera música, y mmaudio de hecho trae por defecto un prompt negativo que excluye la música de su salida para que no añada sin querer una banda sonora que no pediste. Si un clip necesita música, eso es un paso aparte con un modelo musical dedicado, no algo que estas herramientas intenten.
¿Cuánto puede durar el video?
Depende del modelo. Video-to-sfx-v1.5 recorta un clip de origen a diez segundos por generación, con un desplazamiento inicial que puedes mover para cubrir un video más largo en varias pasadas. Mmaudio y thinksound dejan fijar la duración directamente, normalmente hasta la duración del clip que subas. Para algo más largo que un plano único, plantea generar por segmentos y combinar los resultados en lugar de esperar que una sola pasada cubra la escena entera.
¿Puedo controlar el estilo del sonido con un prompt de texto?
Sí, con distinta profundidad según el modelo. Mmaudio toma un prompt corto más un prompt negativo opcional, así que puedes pedir viento y tráfico lejano mientras excluyes música o voces. Thinksound va más allá con un título y un campo de razonamiento paso a paso donde describes varias fuentes de sonido en orden. Video-to-sfx-v1.5 también acepta un prompt opcional, junto a un ajuste de creatividad que empuja el resultado hacia un realismo más ajustado o hacia un audio más suelto y estilizado.
¿Qué pasa si el sonido generado no encaja bien con el video?
Regenera antes de reescribir el prompt. Los tres modelos son estocásticos, así que la misma entrada puede producir una toma notablemente distinta en la siguiente ejecución, y video-to-sfx-v1.5 admite explícitamente generar varias variaciones de una vez por esta razón. Si dos o tres intentos fallan en el mismo detalle, ahí es cuando ajustar el prompt o cambiar de modelo, mmaudio para ambiente frente a thinksound para una escena superpuesta, suele arreglarlo.
¿Puedo mezclar el sonido generado con el audio original del video en lugar de reemplazarlo?
Sí. Video-audio-merge en Picasso IA tiene un modo de mezcla que superpone la pista nueva sobre el sonido original en lugar de reemplazarlo por completo, junto con un multiplicador de volumen para equilibrar los dos. Esto importa cuando un clip ya tiene ruido ambiental útil y solo quieres añadir efectos concretos encima, en lugar de borrar todo lo que ya había.
¿Esto funciona con clips de video generados en el propio Picasso IA, o solo con metraje subido?
Ambos. Un clip generado por un modelo de texto a video o de imagen a video en Picasso IA se descarga igual que cualquier otro video, y puedes pasarlo directo a video-to-sfx-v1.5, mmaudio o thinksound igual que un metraje grabado con un móvil o una cámara. De hecho este es el uso más común, porque los clips de video generados con IA suelen salir sin ninguna pista de audio.
¿Cuánto cuesta añadir efectos de sonido a un video?
Cada generación cuesta créditos, y la cantidad depende del modelo y los ajustes que elijas, así que un número concreto aquí quedaría desfasado enseguida. Las cuentas nuevas empiezan con créditos gratis, suficiente para probar video-to-sfx-v1.5, mmaudio y thinksound sobre el mismo clip y comparar cuál encaja con tu metraje antes de gastar más. Los planes actuales y las asignaciones de créditos viven en la página de precios, el único sitio fiable para las cifras.
¿Esto sustituye a una biblioteca de sonido o a un diseñador de sonido?
Para mucho contenido corto, sustituye lo bastante el paso de búsqueda: en lugar de rastrear una biblioteca de stock por un paso o el crujido de una puerta que casi encaja, generas uno ajustado a tu metraje real. Para una película o un proyecto donde el diseño de sonido pesa de verdad, trátalo como una primera pasada rápida y no como la mezcla final, Picasso IA frente a Artlist repasa dónde una biblioteca de stock sigue ganando en audio curado a mano y mezclado por personas.
Un clip mudo está a una subida de tener sonido. Abre el Toolkit, elige video-to-sfx-v1.5, mmaudio o thinksound, y dale a tu próximo video con IA algo a lo que sonar.