Referencia universal a video: IA a partir de imágenes, clips y audio

Combina imágenes de referencia, clips de video y audio con un prompt para generar un video con IA. La zona de subida muestra solo lo que admite el modelo elegido.

Modelos compatibles: Seedance 2.5 · Seedance 2.0 · Seedance 2.0 Fast · Seedance 2.0 Mini · MiniMax H3 · Wan 3.0 · Wan 3.0 Prime · Kling v3 · Kling v3 Omni · Veo 3 · Veo 3.1 Fast · Gemini Omni Flash · Grok Video 1.5 · Grok Video 1.0 · Wan 2.6 · Wan 2.6 Flash · HappyHorse 1.0 · HappyHorse 1.1

¿Qué es la referencia universal a video?

La referencia universal a video genera un video con IA a partir de un prompt de texto y una mezcla de referencias: imágenes para personajes y estilo, clips de video para el movimiento y audio para el ritmo o la voz. El texto a video parte de palabras y la imagen a video anima una sola imagen; la referencia a video te permite controlar varios aspectos del resultado a la vez.

Cada modelo acepta referencias distintas. Wan 3.0 admite hasta 21 referencias entre imágenes, clips y audio; MiniMax H3 acepta hasta 9 imágenes, 3 clips de video y 3 archivos de audio; y HappyHorse 1.0 usa hasta 9 imágenes de referencia. La zona de subida se adapta automáticamente y solo muestra los espacios que el modelo elegido puede usar.

Qué puedes hacer con referencia a video

  • Personajes coherentes

    Mantén la misma cara, ropa y accesorios en varios planos usando imágenes del personaje como referencia.

  • Copiar el movimiento de un clip

    Usa un video de referencia para guiar el movimiento, la coreografía o el trabajo de cámara.

  • Visuales guiados por la música

    Añade una referencia de audio para que el ritmo y el ambiente sigan la pista.

  • Videos de producto con material real

    Combina fotos de producto con una referencia de escena de uso para anuncios coherentes con tu marca.

  • Transferencia de estilo al video

    Aplica el aspecto de una obra o de una imagen de marca a una escena nueva.

  • Del storyboard al plano final

    Convierte viñetas de storyboard y un clip provisional en una secuencia terminada.

Modelos de IA para referencia a video

Los límites de referencias varían según el modelo. La columna Salida muestra el rango de resolución y la duración de los clips.

ModeloIdeal paraSalida
Wan 3.0La combinación más amplia: hasta 21 referencias de imagen, video y audio, con clips de hasta 30 segundos480p–1080p · 2–30s
MiniMax H3Imágenes, clips y audio a la vez: hasta 9 imágenes, 3 clips y 3 archivos de audio480p–4K · 4–15s
HappyHorse 1.0Referencias de personaje con hasta 9 imágenes720p–1080p · 3–15s
Veo 3.1 FastHasta 3 imágenes de referencia con audio generado720p–4K · 4–8s
Wan 2.6Clips de video de referencia que guían el movimiento720p–1080p · 5–10s

Cómo crear un video a partir de referencias

  1. 1

    Elige un modelo

    Elige un modelo de video. Los espacios de referencia cambian a las imágenes, clips y audio que acepta ese modelo.

  2. 2

    Añade referencias y un prompt

    Sube tus referencias y describe cómo debe influir cada una en el video. Si el modelo lo permite, escribe @ para mencionar una imagen añadida en el prompt.

  3. 3

    Genera y descarga

    Revisa los créditos estimados, genera y descarga el video terminado desde tu historial.

Consejos para trabajar con referencias

  1. Da a cada referencia una función en el prompt, por ejemplo: usa la imagen 1 para el personaje y el clip para los pasos de baile.
  2. Usa referencias limpias: un retrato de frente o una hoja de personaje funciona mejor que una foto de grupo recargada.
  3. Mantén los clips de referencia cortos y centrados en el único movimiento que quieres copiar.
  4. Usa las referencias de audio para el ritmo y el ambiente, y describe en el prompt los visuales que quieres.
  5. Empieza con pocas referencias y añade más cuando el resultado base se vea bien.
Prompt
Usa la imagen 1 como personaje principal y el clip de referencia para los pasos de baile; azotea iluminada con neones de noche, cámara en mano, video vertical

Preguntas frecuentes

¿Qué es la referencia universal a video?
Genera un video con IA a partir de un prompt de texto y referencias de imagen, clips de video y audio, lo que te da más control sobre personajes, movimiento y ambiente que el texto o una sola imagen.
¿En qué se diferencia de imagen a video?
Imagen a video anima una sola imagen y solo acepta imágenes. Referencia a video combina varias referencias, como imágenes, clips y audio, para dirigir una escena nueva.
¿Qué referencias puedo añadir y cuántas?
Depende del modelo. Wan 3.0 acepta hasta 21 referencias en total, MiniMax H3 hasta 9 imágenes, 3 clips de video y 3 archivos de audio, y HappyHorse 1.0 hasta 9 imágenes. La zona de subida solo muestra lo que admite el modelo elegido.
¿Qué formatos de archivo se admiten?
Imágenes en formatos habituales como JPG, PNG y WebP, clips de video en MP4, MOV o M4V, y archivos de audio como MP3.
¿Cuántos créditos cuesta?
El coste depende del modelo, la resolución y la duración; en algunos modelos, la duración de los clips de referencia se suma a la duración facturada. La estimación se muestra antes de generar.
¿Cuánto tarda la generación?
Normalmente desde menos de un minuto hasta varios minutos, según el modelo, las referencias y la duración. Se ejecuta en segundo plano, así que puedes revisar tu historial más tarde.
¿Los videos tienen marca de agua?
Las descargas sin marca de agua están incluidas en los planes de pago. Consulta la página de precios para ver qué incluye cada plan.
¿Puedo mantener el mismo personaje en varios videos?
Sí. Reutiliza las mismas imágenes del personaje como referencia en cada generación y describe al personaje de la misma forma en tus prompts.