Saltar al contenido
Vídeo

Prompts de IA para vídeo: Sora, Runway y Veo

Los modelos de texto a vídeo premian el lenguaje del cine, no las etiquetas. Así se hacen prompts para Sora, Runway y Veo con planos que parecen intencionados.

Ilustración sobre cómo escribir prompts de IA para modelos de texto a vídeo

Escribe «un dragón volando sobre una ciudad» en un modelo de imagen y obtienes un fotograma. Escríbelo en Sora o Veo y obtienes cinco segundos de decisiones: cómo se inclina el dragón al girar, si la cámara lo persigue o se queda quieta, cómo baten las alas el aire, dónde cambia la luz cuando gira. Cada una de esas decisiones es algo que tú especificaste o algo que el modelo adivinó por ti. Hacer buenos prompts para vídeo consiste, en su mayor parte, en adivinar menos.

Eso cambia la forma de escribir. Una imagen fija es un sustantivo. Un plano es un verbo.

Los prompts de vídeo no son prompts de imagen con movimiento

El mayor error que la gente arrastra de Midjourney es tratar un clip como una foto que se mueve un poco. No lo es. Un prompt de foto describe un estado. Un prompt de vídeo describe un estado *y cómo cambia a lo largo de la toma*. Ahora eres responsable de tres cosas que una imagen fija nunca te exigía: el movimiento (qué se mueve y cómo), el tiempo (qué pasa primero y qué después) y el ritmo (a qué velocidad ocurre todo).

Por eso los prompts de IA para vídeo viven o mueren por los verbos. «Una mujer con abrigo rojo, calle de neón, lluvia» es un buen brief de imagen y un mal brief de vídeo, porque ahí no se mueve nada. Añade el movimiento y cobra vida: «camina hacia la cámara, el abrigo se balancea, la lluvia cruza los neones». La misma escena, pero ahora el modelo sabe qué animar en vez de inventarse el movimiento por su cuenta.

Mantén la misma disciplina que usarías para cualquier buen prompt: los fundamentos para escribir una instrucción clara siguen valiendo. Solo has añadido un eje temporal, y el eje temporal es donde los clips se tuercen.

La anatomía de un prompt de plano

Un prompt de plano tiene partes, y nombrarlas en un orden aproximado evita que te olvides de las que los modelos suelen fallar. Piénsalo como una claqueta:

  • Sujeto + acción — quién o qué, haciendo exactamente una cosa.
  • Ángulo y movimiento de cámara — dónde se coloca el objetivo y cómo se desplaza.
  • Objetivo y encuadre — gran angular, 35mm, primer plano, poca profundidad de campo.
  • Iluminación — dirección, calidad, temperatura de color.
  • Ambiente y escenario — el lugar y la sensación.
  • Duración y ritmo — cuánto dura, más o menos, y a qué velocidad se lee la acción.

Los mejores prompts de IA para vídeo rara vez rellenan las seis casillas, pero siempre clavan las dos primeras, porque el sujeto y la cámara son los que sostienen todo. Así queda la plantilla rellenada:

Slow dolly-in sobre un faro solitario al amanecer, niebla deslizándose sobre rocas mojadas, luz de contra cálida del sol bajo, 35mm, poca profundidad de campo, tranquilo y cinematográfico, 5 segundos

Fíjate en que hay un sujeto, un movimiento de cámara, un momento del día. Esa contención es todo el truco. Si estás acostumbrado a apilar descriptores para imágenes fijas, un generador de prompts de imagen entrena el hábito de enumerar objetivo y luz de forma explícita: aprovéchalo y añade la cláusula de movimiento que la imagen fija nunca necesitó.

Habla el idioma de la cámara

Los modelos de vídeo se entrenaron con metraje real, así que responden al vocabulario de cine de verdad mucho mejor que a palabras vagas como «dinámico». Aprende un puñado de movimientos de cámara y tus prompts de texto a vídeo se afilan de la noche a la mañana:

  • Dolly — la cámara misma avanza o retrocede («slow dolly-in»).
  • Paneo / tilt — la cámara pivota de izquierda a derecha o de arriba abajo desde un punto fijo.
  • Tracking — la cámara se desplaza junto a un sujeto en movimiento.
  • Grúa / jib — la cámara sube o baja por el espacio.
  • Cámara en mano — temblor deliberado para dar energía de documental.
  • Zoom — el *objetivo* se cierra, algo que se ve distinto de un dolly y los modelos lo saben.

Nombra el movimiento, nombra su velocidad y elige uno. «Slow tracking shot» se lee limpio; «dolly-zoom-paneo-grúa» se lee como ruido y el modelo lo promediará hasta convertirlo en papilla.

Tracking shot siguiendo a un ciclista por un callejón de adoquines mojados, la cámara se desplaza a su lado a la misma velocidad, luz plana de cielo nublado, 50mm, salpicaduras saltando de las ruedas, crudo y cinético, sensación de cámara en mano, 6 segundos

Describir el movimiento y la física

Lo más difícil para estas herramientas es la verosimilitud física: la tela, el pelo, el agua, el peso, la inercia. Puedes guiarla. En vez de «una capa», escribe «una pesada capa de lana que se levanta despacio con el viento». En vez de «explosión», escribe «un estallido de brasas a cámara lenta que se elevan flotando». Dale al modelo dirección, velocidad y material, y tendrá algo que simular. Déjalo en blanco y por defecto te dará una media blandengue y flotante.

Unas cuantas palancas que dan resultado:

  • Palabras de velocidad: «a cámara lenta», «a tiempo real», «time-lapse», «gradual», «repentino».
  • Pistas de peso: «pesado», «delicado», «lento y torpe», «que se recoge de golpe».
  • Dirección: «desplazándose de izquierda a derecha», «cayendo hacia la cámara», «ascendiendo».

Las contradicciones son lo que lo rompe. «Un plano fijo congelado con movimiento rápido y caótico» le da al modelo dos objetivos incompatibles, y elige uno al azar.

Close-up de la cabeza de semillas de un diente de león, una ráfaga de viento levanta las semillas una a una, desplazándose despacio hacia la derecha a cámara lenta suave, a contraluz del sol dorado y bajo, foco corto, 5 segundos
Consejo: Escribe tu primer borrador y luego borra todos los adjetivos que no se mueven ni cambian a lo largo del clip. «Precioso», «increíble», «épico» no le dicen al modelo nada que animar. Las palabras que sobreviven al recorte son las que hacen el trabajo.

Un plano, una idea, y a cortar

No puedes plantear una escena entera en un solo prompt y esperar cubrirla toda. Pide «una persecución por un mercado, luego un duelo en una azotea, luego lluvia» y obtendrás un borrón confuso que no es ninguna de las tres. Los montajes de verdad se construyen plano a plano, así que haz el prompt plano a plano.

Para una secuencia, guioniza antes en lenguaje llano —tres o cuatro tiempos, cada uno su propio clip generado— y luego móntalos en un editor:

  • Plano 1: gran plano general de situación, el sujeto pequeño en el encuadre.
  • Plano 2: plano medio, el sujeto reacciona.
  • Plano 3: primer plano, el detalle que importa.

La coherencia entre esos planos es la verdadera dificultad. Repite la descripción de anclaje palabra por palabra —mismo vestuario, misma localización, misma luz—, cambiando solo el encuadre y la acción. Una biblioteca de prompts guardada se gana el sueldo aquí, porque reutilizarás ese bloque de personaje y escenario en cada clip, y una pequeña variación en las palabras provoca saltos de continuidad visibles. La misma lógica que hace que un conjunto de ilustraciones parezca de la misma familia hace que tus planos parezcan una sola escena.

Imagen a vídeo y fotogramas de referencia

El texto no es tu única entrada. La mayoría de estas herramientas aceptan una imagen de partida y la animan, lo que resuelve la coherencia de un solo golpe: fijas el aspecto como imagen fija y luego describes solo el movimiento. Es la forma más fiable de controlar el personaje y el estilo, porque el fotograma carga con todo lo que a las palabras les cuesta concretar.

Vale la pena montar el flujo de trabajo en torno a esto. Genera un buen primer fotograma en un modelo de imagen —la guía de prompts de imagen y el generador de prompts de Midjourney explican cómo acertar con ese fotograma— y luego pásaselo con una instrucción de solo movimiento:

Anima esta imagen: gentle push-in, el pelo del sujeto se mueve levemente con la brisa, vapor subiendo de la taza de café, semáforos lejanos parpadeando desenfocados, sutil y tranquilo, 4 segundos

Como el fotograma está fijo, el prompt solo tiene que responder «¿qué se mueve?», una pregunta mucho más fácil que «¿qué aspecto tiene todo?».

Sora, Runway, Veo, Kling: leer las diferencias

Las herramientas se solapan más de lo que sugiere el marketing, y las versiones cambian rápido, así que trata los detalles concretos como blancos móviles. A grandes rasgos, eso sí, tienen temperamentos distintos:

  • Sora (OpenAI) tiende a clips más largos y narrativos, y lee bien las descripciones de escena. Los buenos prompts para Sora suelen escribirse como una lista de planos, no como una ensalada de palabras clave.
  • Runway nació de un conjunto de herramientas de edición, así que combina la generación con controles finos de movimiento, ajustes de cámara e imagen a vídeo.
  • Google Veo apunta a un movimiento de alta fidelidad y físicamente verosímil, y responde bien al lenguaje cinematográfico explícito.
  • Kling y Luma destacan en movimiento realista y son herramientas habituales para imagen a vídeo.

No te obsesiones con la sintaxis exacta de una sola herramienta; el oficio de fondo —sujeto claro, un movimiento de cámara, movimiento con nombre, duración sensata— sirve en todas partes. Si un prompt suena torpe, pásalo por un optimizador de prompts para apretar la redacción antes de gastar otro render.

Errores que queman renders

Los clips cuestan tiempo y créditos, así que los fallos que vale la pena nombrar son los que malgastan ambos:

  • Sobrecargar. Seis acciones, cuatro movimientos de cámara, tres ambientes. Recorta a uno de cada.
  • Instrucciones contradictorias. «Plano fijo y bloqueado, movimiento de cámara salvaje». Elige un carril.
  • «Cinematográfico» a secas. La palabra sola no hace casi nada. Di *qué* es cinematográfico: el destello anamórfico, la iluminación en clave baja, el push lento. La concreción es el estilo.
  • Ignorar la duración. Un clip de cinco segundos no aguanta una historia de tres tiempos. Ajusta la ambición a la duración.
  • Pelearte con la capa fija. Si el primer fotograma está mal, el movimiento no lo salvará: arregla primero el fotograma.

Escribe como un director rellenando una claqueta, no como un poeta describiendo un sueño. Los modelos escuchan bien y leen la mente fatal, y los mejores prompts de IA para vídeo simplemente dejan menos cosas a la adivinación.

Referencias

Ponlo en práctica. Aplica lo que acabas de leer con nuestra herramienta gratuita: Generador de Prompts de Imágenes →
FAQ

Preguntas frecuentes

Descríbelo como un plano: sujeto y acción, luego cámara (ángulo, movimiento), objetivo, iluminación, ambiente, escenario y ritmo. «Un slow dolly-in sobre un faro solitario al amanecer, niebla deslizándose, luz cálida, cinematográfico» gana a «un vídeo de un faro».
Sora, Runway, Veo y Kling producen clips potentes, con fortalezas distintas en duración, movimiento y control. Prueba el mismo prompt en un par y quédate con el que mejor maneje tu tipo de plano.
Los modelos de vídeo descartan detalles cuando un prompt está sobrecargado o es contradictorio. Mantén un sujeto y una acción claros por plano, pon lo más importante al principio y genera varias tomas.
Sí. Nombrar planos y movimientos —dolly, paneo, tilt, tracking, grúa, cámara en mano— guía el movimiento mucho más fielmente que palabras vagas como «dinámico».

Escribe tu próximo prompt en segundos

Convierte una idea difusa en un prompt claro y estructurado que cualquier IA pueda seguir. Gratis, privado y sin cuenta.

Abrir el Optimizador de PromptsVer todas las herramientas