Para crear vídeos con IA a partir de fotos, empieza por elegir una secuencia de imágenes que cuente una historia. Después decide cuáles necesitan movimiento: puedes generar un clip corto desde cada una y unir los clips con imágenes estáticas en un editor. Revisa que las personas y objetos se mantengan reconocibles entre escenas. Si solo quieres mover una foto, consulta la guía para animar una imagen.
La guía general para crear vídeos con IA ayuda a escoger ruta y herramienta. Aquí el punto de partida es una colección de fotos propias y el resultado deseado es una pieza montada, no un único clip aislado.
Selección y preparación de la fotografía base
Ordena las fotos por la secuencia que quieres contar: apertura, acción y cierre. Elige una imagen principal para cada clip. La imagen de entrada orienta el primer fotograma y la composición, pero el modelo puede alterar detalles al producir movimiento; conserva el original para compararlo.
Si aparecen personas, objetos de valor o un lugar concreto, anota qué debe mantenerse constante entre clips. No presupongas que dos generaciones separadas conservarán el mismo rostro, ropa o disposición de la escena. Planifica cortes donde la continuidad no dependa de un detalle fino.
Definición del movimiento y redacción del prompt
Una vez seleccionada la fotografía, el siguiente paso es orientar a la IA sobre cómo debe evolucionar la escena a lo largo del tiempo. A diferencia de la generación basada únicamente en texto, cuando se parte de una imagen no es necesario volver a describir minuciosamente los colores o los objetos presentes.
De acuerdo con la guía de prompting para imagen a video de Runway, la indicación textual debe concentrarse en describir el movimiento, ya sea la acción de los sujetos o el recorrido de la cámara, en lugar de reiterar lo que ya se visualiza en el archivo original.
Para obtener resultados estructurados, es útil dividir la instrucción en dos componentes:
- Movimiento de cámara: Describir desplazamientos concretos como paneos laterales (pan), acercamientos (zoom in) o tomas estáticas.
- Movimiento del sujeto o entorno: Explicar acciones puntuales y verosímiles, como «la persona gira la cabeza hacia la izquierda y sonríe» o «el viento mueve suavemente las hojas de los árboles».
Evitar indicaciones contradictorias con la postura inicial de la foto reduce significativamente los artefactos de deformación.
Configuración técnica del formato y duración
Antes de procesar la solicitud, deben determinarse los parámetros estructurales del archivo de video resultante. La compatibilidad de relaciones de aspecto y resoluciones depende del modelo generativo subyacente implementado.
Por ejemplo, la documentación técnica de Veo en la API de Google Gemini detalla que este modelo admite la generación de video a partir de imágenes combinadas con texto, permitiendo definir relaciones de aspecto estándar como 16:9 (horizontal) o 9:16 (vertical para formatos móviles).
Decide antes del montaje si la pieza será horizontal o vertical y revisa cómo recorta cada foto la herramienta. Una relación de aspecto diferente puede exigir recortar, añadir margen o recomponer el encuadre; no presupongas que la generación resolverá esa decisión sin pérdida.
Generación, revisión de sujetos y control de distorsiones
Genera primero un clip de prueba por foto. Revisa cada uno antes de ensamblarlos, prestando atención a tres áreas:
- Fidelidad de los rostros: Comprobar que los rasgos faciales no se transformen en otra persona durante los giros o movimientos.
- Extremidades y manos: Vigilar que no aparezcan dedos adicionales ni extremidades fusionadas con el fondo al interactuar con objetos.
- Firmeza del fondo: Detectar si los elementos estáticos (como edificios o muebles) sufren ondulaciones o cambios espontáneos de textura (morphing).
Si un clip presenta deformaciones, prueba un movimiento más simple o deja esa foto estática. Después une los fragmentos en un editor, añade transiciones con moderación y comprueba que la duración total y el orden transmiten la historia que querías contar. La herramienta de generación de clips y el montaje final son tareas distintas.