Una foto se detiene en el instante en que se disparó el obturador. El video sigue adelante, y durante años la única forma de pasar de uno a otro era haber filmado el momento desde el principio. Los modelos de imagen a video cierran esa brecha a posteriori: les das una sola foto y una frase que describe lo que debería pasar a continuación, y unos segundos después tienes un clip con cámara en movimiento, sujeto en movimiento o ambos, construido a partir de una imagen que nunca se movió.
La mayoría de las fotos que ya tienes nunca se grabaron como video, y volver a grabar rara vez es una opción: la boda ya pasó, la muestra del producto se devolvió, el abuelo de la foto ya no está. La generación de imagen a video trabaja con lo que ya tienes. Lee la imagen como un primer fotograma y la extiende hacia adelante en el tiempo, siguiendo el movimiento que describa tu prompt.
Picasso IA ejecuta esto a través de varios modelos construidos específicamente para esta tarea, incluidos kwaivgi/kling-v2.6, wan-video/wan-2.7-i2v, luma/ray-3.2 y minimax/hailuo-02, todos accesibles desde el mismo Toolkit sin instalar nada. Cada uno maneja el movimiento de forma un poco distinta, así que la misma foto puede volver como un avance cinematográfico lento con un modelo y una animación del sujeto más viva con otro; vale la pena explorar el catálogo completo para ver qué más genera video. Las cuentas nuevas empiezan con créditos gratis, suficientes para probar varias fotos antes de decidir si el resultado merece pagar.
La decisión más importante no es qué modelo elegir, es qué tipo de movimiento estás pidiendo. Un prompt que nombra el tipo equivocado de movimiento para la foto es la razón más común por la que un primer intento se ve rígido o falso, más que cualquier ajuste del propio modelo.
| Estilo de movimiento | Qué escribir | Mejor para |
|---|
| Cinemagrafía ambiental | Solo el agua ondula y las hojas se mecen, todo lo demás queda quieto | Fotos de paisaje y naturaleza, bucles de fondo |
| Avance o barrido de cámara | Dolly cinematográfico lento hacia adelante, la cámara se desplaza de lado a lado | Fotos de producto, inmobiliarias, planos de establecimiento |
| Movimiento del sujeto | Ella gira la cabeza y sonríe, una brisa suave mueve su cabello | Retratos, fotos de perfil, fotos familiares |
| Movimiento combinado de escena | La cámara orbita despacio mientras el bailarín gira y el público aplaude | Clips sociales, resúmenes de eventos, anuncios |
| Puente entre primer y último fotograma | La flor se abre por completo, los pétalos se despliegan uno a uno | Revelaciones de antes y después, transformaciones de producto |
Nombrar el estilo de esta tabla en tu prompt, en lugar de describir toda la escena desde cero, suele ser la forma más rápida de acercarte a lo que imaginaste en el primer o segundo intento.
El movimiento de cámara y el movimiento del sujeto también cargan riesgos distintos. El movimiento de cámara mantiene quieto al sujeto y mueve el punto de vista, la opción más segura cuando el sujeto es un rostro, porque al rostro nunca se le pide que cambie. El movimiento del sujeto anima lo que hay dentro del cuadro, más arriesgado porque las caras y las manos son justo donde estos modelos suelen introducir una distorsión. Combinar ambos es la opción más cinematográfica y la más propensa a necesitar un segundo intento, así que genera primero una versión solo con movimiento del sujeto para confirmar que el movimiento se ve bien antes de añadir movimiento de cámara encima.
El flujo de abajo no presupone más que una foto y una idea del movimiento que quieres. Funciona igual sea el origen una foto de producto, un retrato o una vieja foto familiar que estás trayendo de vuelta a la vida.
- Elige una foto de origen clara. Enfoque nítido, el sujeto completo dentro del encuadre y nada que necesites recortar de los bordes, ya que el modelo trabaja exactamente con lo que la imagen muestra.
- Abre el Toolkit y elige un modelo de imagen a video. Kling v2.6 y Wan 2.7 I2V aceptan un fotograma inicial directamente, Ray 3.2 y Hailuo 02 también, y cada uno lee ese primer fotograma como el ancla para todo lo que sigue.
- Escribe un prompt de movimiento corto. Nombra el sujeto, la acción y la cámara en una o dos frases sencillas, tomando prestado el vocabulario de estilo de la tabla anterior en lugar de escribir toda una descripción de escena.
- Ajusta duración y relación de aspecto y genera. La mayoría de estos modelos ofrece clips de 5 o 10 segundos en 16:9, 9:16 o 1:1, así que ajusta la plataforma antes de generar en lugar de recortar después.
- Revisa el movimiento, no solo el primer fotograma. Mira el clip completo buscando manos deformadas, rostros que se desvían o un movimiento de cámara que se pasa de frenada, y vuelve a generar con un prompt ajustado o un modelo distinto si algo se rompe a mitad de camino.
Un prompt de foto a video hace un trabajo más acotado que uno de texto a video: la imagen ya fija el sujeto, el encuadre y la luz, así que el prompt solo necesita describir qué cambia. Tener esta distinción en mente es lo que separa un prompt que se lee como un pie de foto de uno que realmente dirige el movimiento.
Nombra el movimiento concreto en lugar del ambiente: "gira la cabeza y parpadea" le da a la reconstrucción algo concreto que animar, mientras que "hazla cobrar vida" no le da nada de dónde partir y recae en el movimiento que más ha visto. Limita la acción a una sola cosa clara por generación, porque un prompt que pide cinco movimientos simultáneos tiende a mezclarlos todos en una versión más pequeña y confusa de cada uno. Un prompt negativo vale la pena usarlo siempre que un primer intento vuelva deformado: nombrar lo que no quieres, como dedos de más o un cuadro tembloroso, orienta el siguiente intento mejor que reescribir el prompt positivo otra vez.
Consejo: cuando una generación se ve casi bien pero el movimiento es demasiado agresivo, repite exactamente el mismo prompt con la opción de duración más corta en lugar de reescribirlo. Un clip más corto le da al modelo menos tiempo para alejarse de la foto original, y suele ser la solución más rápida.
Una descripción honesta de esta herramienta incluye dónde deja de funcionar. Para convertir una sola foto en video, cinco límites aparecen lo bastante seguido como para planificarlos:
- Rostros con movimiento fuerte: un rostro que gira lejos de su ángulo original o abre mucho la boca es la fuente más común de deformación visible, así que mantén el movimiento facial sutil en fotos donde el rostro es el punto central.
- Manos y detalle fino: dedos, joyas y texto pequeño en la foto original son las partes con más probabilidad de mancharse o multiplicarse al añadir movimiento real, la misma debilidad que estos modelos cargan al generar imágenes fijas.
- Fondos que la cámara nunca vio: un avance o barrido de cámara inventa lo que hay justo fuera del encuadre original, y esa invención es una suposición, no la reconstrucción de un espacio real.
- Duración: los modelos actuales llegan hasta unos 10 segundos por generación, así que una secuencia más larga significa unir varios clips en lugar de una sola corrida continua.
- Precisión física: el movimiento parece plausible más que físicamente exacto, lo cual está bien para un clip social o un adelanto de producto y no cumple el estándar que necesitaría un uso científico o forense.
Nada de esto descarta la herramienta. Descarta tratar el primer resultado como definitivo sin ver el clip completo.
La restauración de fotos familiares es el caso de uso que la gente describe de forma más personal: una sola foto de un familiar se convierte en unos segundos de esa persona parpadeando o sonriendo, y para muchos es la primera vez que ven moverse a esa persona en años. Combina bien con el trabajo de restauración de fotos antiguas, ya que un escaneo limpio se anima de forma más convincente que un original rayado.
Las inmobiliarias y los listados de producto usan animación con movimiento de cámara para convertir una sola foto principal en un breve clip de establecimiento sin contratar a un videógrafo, un flujo que se apoya en los recorridos más completos de videos de recorridos inmobiliarios. Los creadores de redes sociales usan movimiento del sujeto para convertir un retrato o una foto de producto estática en algo que detiene el scroll, muchas veces como los primeros segundos de una pieza más larga construida con las técnicas de videos demo de producto con IA. Quien esté comparando herramientas antes de decidirse puede ver cómo se compara el rango de modelos de aquí con un servicio de un solo modelo en el análisis Picasso IA vs Kling AI.
¿De verdad puedo animar cualquier foto en un video?
La mayoría de las fotos funcionan, pero el resultado varía según lo que muestre la foto. Una foto clara, bien iluminada, con el sujeto completo dentro del encuadre y no demasiado pequeño le da al modelo más con qué trabajar, y retratos, productos y paisajes se animan de forma confiable. Las fotos ya borrosas, muy recortadas o tomadas en un ángulo inusual tienden a producir un movimiento que se ve algo raro, porque el modelo tiene que adivinar detalles que la imagen original nunca capturó con claridad.
¿Qué modelo debería usar para animar una foto?
No hay un único mejor, y ese es justo el argumento para tener varios. Kling v2.6 y Hailuo 02 manejan bien el movimiento natural del sujeto, como girar la cabeza o gesticular, y añaden audio sincronizado. Wan 2.7 I2V permite fijar tanto un primer como un último fotograma para una transición controlada. Ray 3.2 se inclina hacia lo cinematográfico, con salida HDR y seis relaciones de aspecto para planos más amplios. Pasar la misma foto por dos de ellos y comparar toma solo un par de minutos.
¿Cuánto puede durar el video generado?
La mayoría de los modelos de imagen a video en Picasso IA generan clips de 5 o 10 segundos en una sola corrida, y algunos limitan la opción más larga a una resolución menor. Eso alcanza para un clip social, un adelanto de producto o un solo momento animado. Para algo más largo, lo práctico es generar varios clips cortos y unirlos con una herramienta de edición, en lugar de esperar que una sola generación cubra una escena completa.
¿Puedo controlar exactamente cómo se mueve la foto?
Tienes control significativo, no control fotograma a fotograma. Tu prompt marca la dirección del movimiento, y varios modelos te permiten fijar un fotograma inicial, uno final o ambos, así que el clip abre y cierra en imágenes que elegiste tú. Lo que no puedes hacer es marcar a mano una trayectoria exacta como harías en un software de animación; el modelo interpreta tu instrucción y rellena el movimiento por su cuenta.
¿La IA añade sonido a mi foto animada?
Algunos modelos sí. Kling v2.6, por ejemplo, genera audio sincronizado por defecto junto con el video, ajustado a lo que pasa en pantalla, y Wan 2.7 I2V puede sincronizar el movimiento con un archivo de audio que subas tú. Otros devuelven solo video mudo. Si el sonido importa para tu clip, revisa las opciones del modelo específico antes de generar, ya que esto cambia de modelo a modelo y no es una función universal.
¿Esto funciona con fotos antiguas o dañadas?
Puede funcionar, y hacer primero una limpieza suele ayudar. Una foto con rayas, color desvanecido o mucho ruido le da al modelo un fotograma inicial más tosco, así que el movimiento que añade puede heredar esos defectos. Pasar la foto por restauración de fotos antiguas o una pasada de colorización antes de animarla suele producir un resultado más suave y natural que animar el original dañado directamente.
¿Puedo convertir una foto en un video en bucle?
Sí, algunos modelos admiten el bucle directamente como ajuste, produciendo un clip que se repite sin un corte visible, útil para un fondo de sitio web o una pantalla ambiental. En modelos sin opción de bucle integrada, fijar el mismo fotograma como primero y último se acerca bastante al mismo efecto, ya que el movimiento vuelve al punto donde empezó.
¿Qué resolución y relación de aspecto puedo exportar?
Depende del modelo, pero la mayoría cubre las plataformas que realmente usarías. Las opciones comunes van de 480p a 1080p, y las relaciones de aspecto suelen incluir 16:9 para pantalla ancha, 9:16 para formatos verticales sociales y 1:1 para publicaciones cuadradas. Ajustar la relación de aspecto antes de generar, en lugar de recortar el clip terminado, conserva la composición que el modelo realmente pensó.
¿Cuánto cuesta animar una foto?
Cada generación se paga en créditos, y el costo exacto depende del modelo, la resolución y la duración que elijas, ya que un clip más largo o de mayor resolución exige más cómputo. Las cuentas nuevas reciben créditos gratis para probar esto antes de gastar nada, y los planes actuales viven en la página de precios, el único lugar fiable para una cifra real.
¿Puedo usar el video animado con fines comerciales?
Revisa dos cosas antes. Que tengas los derechos de la foto original, ya que animar una imagen no cambia a quién pertenece lo que muestra. Y los términos de licencia de tu plan, que rigen cómo se pueden usar los resultados. Como con cualquier contenido generado por IA, dale una revisión humana a un clip comercial antes de publicarlo, igual que revisarías un texto o un diseño antes de sacarlo al mundo.
Una foto que lleva años quieta está a un prompt de volver a moverse. Abre el Toolkit, sube una y descubre qué le añaden unos segundos de movimiento.