Un cortometraje no es una generación larga, y tratarlo como tal es la forma más rápida de acabar con ocho segundos de nada aprovechable. Todos los modelos de texto a video actuales generan un solo plano de pocos segundos cada vez. Una película o un trailer es lo que ocurre después: varios de esos planos, elegidos, recortados y unidos en un orden que se lee como una sola historia. Esta página recorre esa cadena de montaje de principio a fin, desde la lista de planos hasta el corte exportado, con los modelos reales implicados en cada etapa.
El instinto es pedir la escena entera en un solo prompt y esperar que el modelo la sostenga durante treinta segundos. No lo hará, todavía no. Lo que los modelos de texto a video hacen realmente bien es un solo plano: un personaje que se gira hacia cámara, un coche que entra en el encuadre, una puerta que se abre a una habitación iluminada. En cuanto aceptas el plano como la unidad de trabajo en lugar de la película, el flujo deja de pelear contra la herramienta.
Esto también explica por qué un catálogo ayuda más aquí que con un solo estilo de imagen. Un trailer suele necesitar un plano general, un momento de personaje, algo rápido y un golpe final, y ningún modelo de video gana en los cuatro. Picasso IA ejecuta 488 modelos detrás de una sola interfaz, con varios motores de texto a video y una categoría de edición de video separada para todo lo que ocurre después de la generación.
El hábito que separa un corte coherente de treinta segundos de una carpeta de clips sin relación es escribir la lista de planos primero, en papel o en una app de notas, antes de abrir el Toolkit. Enumera cada momento que la película necesita en orden: el plano general, la entrada del personaje, el giro, la revelación, el fotograma final. Dos o tres frases por plano bastan, escritas como describirías una sola fotografía, porque esa concreción es justo lo que premia un prompt de video.
Mantén la duración de cada plano fiel a lo que el modelo entrega de verdad. La mayoría de las generaciones de texto a video se mueven entre cuatro y diez segundos, así que un trailer de treinta segundos son en realidad seis u ocho generaciones separadas, no una. Seis generaciones cortas que aciertan su momento se cortan juntas mucho mejor que una generación larga que se diluye a mitad de camino.
Escribe también el diálogo o la narración, si lo hay, dentro de la lista de planos, aunque pienses grabarlo aparte. Un plano generado para encajar con una línea concreta convive con su audio de forma mucho más natural que uno generado primero y narrado encima después, como un añadido de última hora.
No todos los momentos de un trailer quieren el mismo motor, y aquí es donde la lista de planos vuelve a dar sus frutos: te dice, antes de generar nada, qué tipo de plano estás a punto de pedir. La tabla de abajo es un punto de partida, no una regla, y cada modelo listado está en la categoría de texto a video del catálogo junto a docenas más que merece la pena probar.
| Tipo de plano | Un modelo que probar | Por qué encaja |
|---|
| Plano general de apertura | google/veo-3.1 | Coherencia de escena fuerte y audio ambiental nativo |
| Primer plano o giro de personaje | kwaivgi/kling-v2.6 | Maneja con soltura el movimiento de un solo sujeto |
| Acción rápida o persecución | bytedance/seedance-1-pro | Sostiene el movimiento rápido sin que el fotograma se rompa |
| Revelación de producto u objeto | lightricks/ltx-2-pro | Movimiento limpio y de alta resolución para el golpe final |
| Plano de montaje narrado | kwaivgi/kling-v2.6 o google/veo-3.1 | Movimiento simple y legible sobre el que apoyar una narración |
Genera cada plano dos o tres veces antes de avanzar. La generación de video es menos predecible que una imagen fija, y la diferencia entre una toma aprovechable y una rígida suele estar en el tercer intento. Elegir el clip más fuerte por momento cuesta minutos y ahorra un remontaje completo.
Generar es la mitad visible del trabajo; el montaje es donde una lista de planos se convierte de verdad en una película. Este es el orden que convierte seis u ocho clips separados en un corte exportado, usando los modelos de edición de la categoría de edición de video junto a los generadores de arriba.
- Genera cada plano de tu lista. Pasa cada momento por el modelo de texto a video que le encaja, guarda las dos o tres mejores tomas por plano y descarta el resto antes de seguir.
- Recorta cada clip a su tramo utilizable. Corta los fotogramas iniciales y finales donde una generación arranca o se desvía, con una herramienta de recorte como trim-video, para que solo el movimiento limpio pase al montaje.
- Une los clips recortados en un solo archivo. Pasa los clips ya ordenados por video-merge, que los concatena en secuencia y puede igualar el frame rate y la resolución entre planos que vinieron de modelos distintos.
- Añade música, efectos de sonido o narración. Superpone una pista sonora o una narración sobre el archivo unido con video-audio-merge, o genera sonido ambiental directamente a partir de la imagen con un modelo como mmaudio cuando un plano necesita textura que el clip original no traía.
- Subtitula y exporta el corte final. Pasa la secuencia terminada por autocaption si el trailer necesita texto incrustado, y exporta a la resolución que pida tu plataforma, reencuadrando primero con reframe-video si el destino necesita otra relación de aspecto.
Ninguno de estos cinco pasos requiere software fuera del navegador. Cada uno es su propio modelo con sus propios ajustes, así que un montaje fallido o un corte mal medido es volver a ejecutar cinco minutos, no perder una tarde entera en un editor de línea de tiempo.
La señal más clara de que un corte se montó a partir de generaciones separadas, y no rodado en un mismo set, es un personaje o un lugar que cambia sutilmente entre planos: una chaqueta distinta, una cara distinta, una gradación de color que cambia a mitad de camino. Arreglar esto es más un hábito que una elección de modelo: genera o elige una imagen de referencia fuerte para tu protagonista y para tu lugar clave, y usa esa misma referencia en cada plano que la necesite en lugar de redescribir al personaje desde cero cada vez.
La técnica es la misma que se cubre en personajes consistentes con IA: fija una imagen de referencia y varía solo la pose, el ángulo y la acción por plano. En un trailer esto importa todavía más que en un retrato suelto, porque el ojo detecta la inconsistencia más rápido entre cortes, en el medio segundo entre dos planos de la misma persona.
Consejo: genera primero la imagen de referencia de tu protagonista, sola, con luz neutra, antes de escribir un solo prompt de plano. Cada plano posterior parte de esa misma imagen en lugar de una descripción de texto nueva, y esa única decisión hace más por la continuidad visual que cualquier redacción de prompt.
Las palabras de estilo también ayudan, igual que en una imagen fija: elige dos o tres adjetivos constantes, como gradación teal apagada o look documental a pulso, y repítelos en el prompt de cada plano. La página de efectos reúne looks predefinidos, una forma más rápida de encontrar ese vocabulario que ir adivinando plano a plano.
Una página honesta sobre un flujo de trabajo dice dónde deja de funcionar, y para el cine montado con IA esta lista no es corta. Cuenta con estos cinco límites antes de empezar y ninguno te sorprenderá a mitad de proyecto.
- Duración del plano: los modelos actuales de texto a video devuelven unos pocos segundos por generación, así que cualquier cosa más larga que un trailer implica decenas de planos separados, y el tiempo de edición escala con ese número, no con la duración final.
- Diálogo con labios sincronizados: los modelos pueden hacer que un personaje hable, pero un sincronismo labial ajustado y fiel al guion en una línea completa sigue siendo poco fiable, y un trailer con narración sobre la imagen evita el problema por completo.
- Continuidad entre planos: incluso con una imagen de referencia fija, detalles pequeños, la posición exacta de un objeto, el pliegue de una chaqueta, se desvían entre generaciones separadas de una forma que un plano continuo real nunca haría.
- Cohesión del diseño sonoro: la música, el sonido ambiental y el diálogo llegan de herramientas distintas y necesitan una mezcla manual; nada en la plataforma equilibra los niveles de un corte completo por ti.
- Narrativa de larga duración: este flujo está pensado para un trailer o un corto, unos pocos minutos de planos montados como mucho, no para una película de larga duración con escenas continuas y un reparto entero sostenido durante horas.
Nada de esto va en contra del flujo. Va a favor de construir trailers, teasers y piezas cortas, los formatos donde un puñado de planos fuertes pesa de verdad más que una sola toma continua.
¿Puede la IA generar de verdad un cortometraje completo de una sola vez?
No, y cualquier herramienta que diga lo contrario está describiendo una demo, no un producto entregable. Todo modelo de texto a video actual genera un plano de pocos segundos cada vez. Un cortometraje o trailer es siempre un montaje de varios de esos planos, elegidos y unidos después, igual que una película real se rueda en tomas separadas y se edita junta en lugar de filmarse de una sola vez del guion a los créditos.
¿Qué modelos de Picasso IA debería usar para los planos en sí?
No hay un mejor único, y ese es el argumento para probar varios en tu plano concreto. google/veo-3.1 y kwaivgi/kling-v2.6 manejan momentos de personaje con buena coherencia, bytedance/seedance-1-pro sostiene bien el movimiento rápido, y lightricks/ltx-2-pro produce planos de alta resolución que funcionan bien para una revelación final. La categoría de texto a video del catálogo tiene decenas más que probar contra tu plano concreto.
¿Cómo combino los clips separados en un solo video?
Una vez que cada plano está generado y recortado, video-merge en la categoría de edición de video concatena los clips en un solo archivo en el orden en que los subes, y puede normalizar el frame rate y la resolución entre planos que vinieron de modelos distintos. Funciona igual si unes dos clips o veinte.
¿Puedo añadir música o narración al corte terminado?
Sí. Una vez que los planos están unidos en un solo archivo, video-audio-merge superpone una pista musical, una narración grabada o un efecto de sonido sobre la imagen. Si un plano concreto necesita textura ambiental que la generación original no traía, pasos, viento, una puerta que se cierra, un modelo como mmaudio puede generar audio directamente a partir del video antes de que ese clip entre en el montaje.
¿Cómo mantengo el mismo personaje reconocible en cada plano?
Genera primero una imagen de referencia fuerte del personaje, con luz neutra, antes de escribir ningún prompt de plano, y usa esa misma imagen en cada generación que lo necesite en lugar de describirlo de nuevo cada vez. Es el mismo enfoque que se usa para personajes consistentes con IA, y es el cambio que más aporta a la continuidad visual en un corte de varios planos.
¿El diálogo se sincroniza de verdad con la boca del personaje?
A veces, no de forma lo bastante fiable como para construir un trailer alrededor de eso. Los modelos de video actuales pueden hacer que un personaje hable, pero un sincronismo labial exacto con una línea de guion concreta sigue siendo irregular a lo largo de una frase completa. El patrón más fiable es construir el trailer alrededor de una narración que suene sobre la imagen y dejar el sincronismo generado para líneas cortas y permisivas, no una escena de diálogo completa.
¿Cuánto debería durar cada plano generado?
Cuenta con entre cuatro y diez segundos por generación, que es lo que devuelven la mayoría de los modelos actuales de texto a video en una sola ejecución. Un trailer de treinta segundos hecho con seis planos de cinco segundos se monta con limpieza; una generación larga estirada hasta los treinta segundos tiende a diluirse mucho antes de llegar ahí.
¿Qué pasa si la relación de aspecto tiene que cambiar para otra plataforma?
Reencuadra el corte ya montado con reframe-video en lugar de regenerar cada plano a una nueva relación. Ajusta el encuadre a una nueva relación de aspecto, vertical para pantalla de móvil o cuadrada para un feed, sin tocar las generaciones originales, lo cual es más rápido y mantiene intacto el contenido de cada plano.
¿Puedo añadir subtítulos o texto en pantalla al trailer?
Sí, una vez que el corte está completamente montado. autocaption lee la pista de audio, ya sea diálogo, narración o una narración que añadiste durante el montaje, e incrusta subtítulos con control sobre la fuente, el color y la posición. Ejecutarlo como último paso, con imagen y sonido ya cerrados, evita tener que rehacer los subtítulos cada vez que cambia un plano anterior.
¿Cuánto cuesta generar un cortometraje o trailer completo?
Cada generación de plano y cada pase de edición cuesta créditos, y el total depende de cuántos planos generes, cuántas tomas te quedes y qué modelos elijas, así que cualquier cifra escrita aquí estaría equivocada en un mes. Las cuentas nuevas empiezan con créditos gratis, suficientes para probar el flujo antes de comprometerte más, y los planes actuales viven en la página de precios.
Tu lista de planos es lo único que separa una idea de un corte que de verdad puedas ver. Abre el Toolkit y genera el primer plano, o mira cómo la comparativa Picasso IA vs Runway plantea este mismo flujo frente a un editor de un solo modelo.