Todo el mundo tiene una foto que le gustaría ver moverse. Un retrato, el dibujo de una mascota, un personaje de producto quieto sobre fondo blanco. Los modelos de transferencia de movimiento cierran esa brecha sin un solo fotograma de animación manual: les das una imagen fija y un video de referencia de alguien bailando, y generan un clip donde tu sujeto ejecuta los mismos movimientos, al mismo ritmo. Esta página explica cómo funciona eso en Picasso IA, cómo elegir entradas que produzcan movimiento limpio y dónde se rompe la técnica.
El baile es una de las cosas más difíciles de describir en un prompt de texto y una de las más fáciles de entregar como referencia. Una frase como hip hop enérgico con footwork rápido no le dice casi nada útil a un modelo de texto a video sobre el timing, el peso o el ritmo. Un clip de diez segundos de un bailarín real le dice a un modelo de transferencia de movimiento todo lo que necesita, porque lee posiciones articulares reales fotograma a fotograma en lugar de adivinar a partir de palabras.
Ese es el cambio que hacen estos modelos. En vez de generar movimiento a partir de una descripción, copian movimiento de un metraje y lo aplican a un sujeto distinto. El resultado se lee como coreografiado porque lo es: la coreografía ya ocurrió, delante de una cámara, antes de que tu foto entrara en el proceso. Todo lo que el modelo tiene que resolver es mapear ese movimiento sobre un nuevo personaje de forma convincente, un problema más acotado que inventar un baile desde cero.
Picasso IA ejecuta dos modelos construidos específicamente para esto: kling-v2.6-motion-control de kwaivgi y wan-2.2-animate-animation de wan-video, ambos dentro del apartado de texto a video del catálogo, junto a decenas de otros modelos de video. Le das a cualquiera de los dos una imagen de referencia y un video de referencia. El modelo lee las acciones, gestos y cambios de postura del video y los reproduce sobre el sujeto de tu imagen, fotograma a fotograma, sin que toques una línea de tiempo ni un rig.
Los dos se comportan de forma un poco distinta. Kling v2.6 Motion Control corre en modo Standard para borradores rápidos y económicos y en modo Professional para una salida más nítida, y puede conservar el audio original de tu clip de referencia. También te deja elegir si la orientación final sigue a tu foto o a tu video de referencia, lo que determina cuánto puede durar el clip: hasta diez segundos de una forma, hasta treinta de la otra. Wan 2.2 Animate Animation entrega salida en 720p o 480p, corre hasta a 24 cuadros por segundo, e incluye una opción experimental de fusión de audio. Pasar el mismo par de entradas por ambos es una forma razonable de ver cuál interpreta mejor tu metraje.
El video de referencia hace casi todo el trabajo, así que la calidad de tu resultado sigue la calidad de ese clip más que cualquier otra cosa del proceso. Un bailarín filmado de cuerpo entero, sobre un fondo liso, moviéndose a un ritmo humano normal, le da al modelo una señal limpia para copiar. Un clip de teléfono borroso de una multitud, o una rutina con giros rápidos y cortes de cámara, le da mucho menos con qué trabajar.
| Tipo de video de referencia | Qué transfiere bien | Buen punto de partida para |
|---|
| Coreografía en solitario, cuerpo entero en cuadro | Footwork, movimientos de brazos, giros | Clips de baile estilo redes sociales |
| Clip simple de gesto o medio cuerpo | Giros de cabeza, saludos, balanceo sutil | Animar un retrato o una mascota |
| Loop corto, de tres a diez segundos | Un solo movimiento limpio repetido | Pruebas rápidas, loops tipo sticker |
| Rutina completa hasta treinta segundos | Una secuencia entera de principio a fin | Ediciones de baile terminadas y listas para publicar |
| Movimiento lento y deliberado | Seguimiento articular preciso, pocos fallos | Un primer intento con una foto nueva |
El encuadre importa tanto como el metraje en sí. Ambos modelos quieren que el personaje de tu imagen de referencia esté en una orientación parecida a la de la persona del video, así que un retrato recortado a la altura de los hombros combinado con un clip de cuerpo entero suele confundir el mapeo. Empieza con una foto que muestre tanto cuerpo como muestra tu video de referencia.
Reutiliza un clip de referencia que te funcione bien en varias fotos de personajes antes de salir a buscar metraje nuevo. Una vez que sabes que un video transfiere de forma limpia, pasar tus siguientes tres sujetos por ese mismo clip es más rápido y mucho más predecible que arriesgarte con uno desconocido cada vez.
El flujo cabe en una sola sesión una vez que tienes tus dos entradas listas: una foto clara del sujeto y un video de referencia de los movimientos que quieres que ejecute.
- Elige una foto limpia del sujeto. Una imagen bien iluminada con el sujeto de frente a la cámara y la parte relevante del cuerpo visible, recortada de forma parecida a como está encuadrado tu video de referencia.
- Escoge un clip de baile de referencia. Cuerpo entero para un resultado de cuerpo entero, medio cuerpo para un retrato animado más sutil, filmado con firmeza y con el bailarín bien separado del fondo.
- Abre Kling v2.6 Motion Control o Wan 2.2 Animate Animation. En el toolkit de Picasso IA, sube la foto como imagen de personaje y el clip como referencia de movimiento.
- Ajusta el modo y la orientación. Modo Standard para una comprobación rápida, Professional para un pase final más limpio, y haz coincidir la orientación con la entrada que muestre más cuerpo.
- Genera, revisa y refina. Mira el clip a tamaño completo buscando manos deformadas o un rostro que se desvía, vuelve a generar con un clip de referencia más estable o un recorte de foto distinto si algo se ve mal, y sube la resolución del resultado con el flujo de escalado de video si necesitas un archivo final más nítido.
Un puñado de hábitos separa un clip de baile convincente de uno inestable, y ninguno requiere habilidad técnica, solo atención a lo que le entregas al modelo antes de generar.
- Haz coincidir el encuadre: mantén el recorte de tu foto parecido al de tu video de referencia, cuerpo entero con cuerpo entero o medio cuerpo con medio cuerpo, para que el modelo no estire el movimiento sobre una pose que no encaja.
- Ilumina el sujeto de forma pareja: las sombras duras sobre un rostro o torso se leen como detalle extra durante el movimiento, lo que se traduce en parpadeo apenas empieza a moverse el sujeto.
- Empieza en modo Standard: corre un borrador barato primero para confirmar que la combinación funciona antes de gastar una generación en modo Professional en un clip que quizá necesite otra referencia.
- Mantén el fondo simple: un fondo liso o desenfocado en tu foto le da al modelo una cosa menos que conciliar con el movimiento que llega del video de referencia.
- Prueba una variable a la vez: si un resultado se ve mal, cambia la foto o el clip de referencia entre corridas, no ambos, para poder saber cuál entrada causó el problema.
Esta técnica es genuinamente útil y genuinamente limitada, y ambas cosas vale la pena decirlas con claridad. Una coreografía rápida y compleja con giros veloces o trabajo de suelo confunde el mapeo de movimiento más seguido que una caminata o un saludo, y eso se nota en extremidades borrosas o una pose que pierde brevemente la forma del cuerpo. Las manos siguen siendo la parte más difícil de animar bien en cualquier figura, y un clip de baile con mucho detalle de dedos cerca de la cámara es donde más probable es ver una articulación de más o un agarre deformado. Los clips largos cerca del tope de treinta segundos se desvían más que los cortos, con pequeños errores de forma facial acumulándose a medida que avanza la secuencia. Dos bailarines moviéndose juntos, un dúo o una rutina grupal, queda fuera de lo que cualquiera de los dos modelos está construido para hacer, ya que cada generación mapea una sola interpretación de referencia sobre una sola imagen de personaje. La fusión de audio, cuando está disponible, es explícitamente experimental: espera un timing cercano pero no exacto al fotograma.
También hay una cuestión de derechos que vale la pena tomarse en serio antes de publicar nada. El modelo copia movimiento, no identidad, así que no reproduce el rostro ni la apariencia del bailarín original. Sí reproduce su coreografía específica, algo que algunos creadores consideran su obra creativa sin importar quién termine ejecutándola en el clip final. Usa metraje que filmaste tú mismo, que tienes permiso de referenciar, o que está claramente licenciado, el mismo estándar que aplicarías a cualquier otra fuente creativa.
¿Cualquier foto se puede convertir en un video de baile con IA?
La mayoría de las fotos funcionan, pero los resultados más limpios vienen de un sujeto bien iluminado, de frente a la cámara, con la parte relevante del cuerpo visible y sin obstrucciones. Las fotos muy recortadas, mal iluminadas o que muestran al sujeto en un ángulo raro tienden a producir movimiento deformado o inestable. Si un primer intento se ve tosco, prueba un recorte distinto de la misma foto o un video de referencia con un encuadre parecido antes de dar por hecho que la técnica no funciona para ese sujeto.
¿Necesito grabar mi propio video de baile para usarlo como referencia?
No, aunque ayuda si puedes. Cualquier video que muestre con claridad los movimientos que quieres transferir sirve como referencia, ya sea que lo filmaste tú mismo o que usaste metraje sobre el que tienes derechos. Lo que importa técnicamente es que el bailarín esté claramente visible frente al fondo y moviéndose a un ritmo normal y rastreable, no de dónde salió originalmente el metraje.
¿El video de baile con IA mantiene mi rostro y mi ropa fieles?
En su mayoría sí, ya que el video de referencia solo aporta el movimiento y la imagen del sujeto aporta todo lo relacionado con cómo se ve el personaje, incluyendo rostro, atuendo y fondo. Espera cierto suavizado del detalle fino cuando la pose cambia rápido, y espera que los clips más largos se desvíen un poco más que los cortos a medida que se acumulan pequeños errores a lo largo de más fotogramas.
¿Cuánto puede durar un video de baile generado desde una foto?
Depende del modelo y del ajuste de orientación que elijas. Kling v2.6 Motion Control genera hasta diez segundos cuando la salida sigue la orientación de tu foto y hasta treinta segundos cuando sigue la orientación del video de referencia. Wan 2.2 Animate Animation sigue la duración del clip de referencia que proporciones. Para una primera prueba, un clip corto es más rápido de revisar y más barato de iterar que uno largo.
¿Qué modelo es mejor para videos de baile, Kling Motion Control o Wan 2.2 Animate Animation?
Ninguno gana de forma absoluta, por eso Picasso IA ofrece ambos. Kling v2.6 Motion Control da una división de calidad Standard y Professional además de duración flexible, mientras que Wan 2.2 Animate Animation corre a un ritmo constante de 24 cuadros por segundo con una opción integrada de fusión de audio. Pasar la misma foto y el mismo clip de referencia por ambos toma minutos y es la forma más rápida de ver cuál maneja mejor tu metraje.
¿Puedo conservar la música de mi video de referencia en el clip final?
Ambos modelos ofrecen una opción de audio. Kling v2.6 Motion Control tiene un interruptor sencillo para conservar el sonido original del video de referencia. Wan 2.2 Animate Animation ofrece un ajuste de fusión de audio que el propio modelo describe como experimental, lo que significa que el timing puede no encajar a la perfección. Si la sincronía precisa importa, trata el audio fusionado como un borrador y prepárate para añadir música por separado después.
¿Hay alguna forma gratuita de probar esto antes de pagar algo?
Las cuentas nuevas de Picasso IA arrancan con créditos gratuitos, suficientes para correr una primera prueba de transferencia de movimiento y ver si la técnica funciona bien con tu foto y tu clip de referencia antes de gastar más. Más allá de los créditos gratuitos, los planes actuales y sus límites están listados en la página de precios, el único lugar que vale la pena revisar para números actualizados.
¿Se puede animar la misma foto con más de un estilo de baile?
Sí, y esta es una de las partes más útiles del flujo. La foto del sujeto se mantiene fija mientras cambia el clip de referencia, así que puedes pasar la misma imagen de personaje por varios videos de baile distintos y terminar con una pequeña biblioteca de clips diferentes a partir de una sola foto original, sin volver a generar el personaje cada vez.
¿Por qué el movimiento se ve mal en algunos intentos?
Las dos causas más comunes son un desajuste entre cómo están encuadradas la foto y el video de referencia, y un metraje de referencia que se mueve demasiado rápido o corta entre ángulos de cámara para que el modelo lo siga con limpieza. Recorta de nuevo la foto para que coincida con el encuadre del video de referencia, o elige un clip de referencia más estable y continuo, y vuelve a generar antes de concluir que el sujeto simplemente no funciona.
¿Está bien animar una foto usando la coreografía de otra persona?
El modelo no copia el rostro ni la identidad de una persona, solo el patrón de movimiento del metraje que proporcionas, así que usar tus propias fotos no plantea ningún problema de parecido. La coreografía en sí es una cuestión aparte: algunos bailarines y coreógrafos consideran una rutina específica su obra creativa, así que usa metraje que filmaste tú mismo, que tienes permiso explícito de referenciar, o que está claramente licenciado para este tipo de uso, en lugar de cualquier clip que encuentres por ahí.
Una foto quieta en tu carrete es una sola subida de distancia de convertirse en un clip en movimiento. Abre el toolkit de Picasso IA, elige un video de referencia y descubre cómo se ve tu propia foto bailando.