Référence universelle vers vidéo : IA à partir d'images, de clips et d'audio

Combinez images de référence, clips vidéo et audio avec un prompt pour générer une vidéo IA. La zone d'import n'affiche que ce que le modèle choisi accepte.

Modèles pris en charge : Seedance 2.5 · Seedance 2.0 · Seedance 2.0 Fast · Seedance 2.0 Mini · MiniMax H3 · Wan 3.0 · Wan 3.0 Prime · Kling v3 · Kling v3 Omni · Veo 3 · Veo 3.1 Fast · Gemini Omni Flash · Grok Video 1.5 · Grok Video 1.0 · Wan 2.6 · Wan 2.6 Flash · HappyHorse 1.0 · HappyHorse 1.1

Qu'est-ce que la référence universelle vers vidéo ?

La référence universelle vers vidéo génère une vidéo IA à partir d'un prompt texte et d'un mélange de références : des images pour les personnages et le style, des clips vidéo pour le mouvement et de l'audio pour le rythme ou la voix. Le texte en vidéo part des mots et l'image vers vidéo anime une seule image ; la référence vers vidéo permet de piloter plusieurs aspects du résultat à la fois.

Chaque modèle accepte des références différentes. Wan 3.0 prend jusqu'à 21 références entre images, clips et audio ; MiniMax H3 accepte jusqu'à 9 images, 3 clips vidéo et 3 fichiers audio ; HappyHorse 1.0 utilise jusqu'à 9 images de référence. La zone d'import s'adapte automatiquement et n'affiche que les emplacements utilisables par le modèle choisi.

Ce que vous pouvez faire avec la référence vers vidéo

  • Personnages cohérents

    Gardez le même visage, la même tenue et les mêmes accessoires d'un plan à l'autre grâce à des images de référence.

  • Reprendre le mouvement d'un clip

    Utilisez une vidéo de référence pour guider le mouvement, la chorégraphie ou le travail de caméra.

  • Visuels guidés par la musique

    Ajoutez une référence audio pour que le rythme et l'ambiance suivent le morceau.

  • Vidéos produit à partir de vrais visuels

    Combinez photos produit et référence de mise en situation pour des publicités fidèles à la marque.

  • Transfert de style en vidéo

    Appliquez le rendu d'une œuvre ou d'un visuel de marque à une nouvelle scène.

  • Du storyboard au plan final

    Transformez des vignettes de storyboard et un clip brut en séquence aboutie.

Modèles IA pour la référence vers vidéo

Les limites de références varient selon le modèle. La colonne Sortie indique la plage de résolution et les durées de clip.

ModèleIdéal pourSortie
Wan 3.0Le mélange le plus large : jusqu'à 21 références image, vidéo et audio, clips jusqu'à 30 secondes480p–1080p · 2–30s
MiniMax H3Images, clips et audio ensemble : jusqu'à 9 images, 3 clips et 3 fichiers audio480p–4K · 4–15s
HappyHorse 1.0Références de personnage avec jusqu'à 9 images720p–1080p · 3–15s
Veo 3.1 FastJusqu'à 3 images de référence avec audio généré720p–4K · 4–8s
Wan 2.6Clips vidéo de référence qui guident le mouvement720p–1080p · 5–10s

Comment créer une vidéo à partir de références

  1. 1

    Choisissez un modèle

    Sélectionnez un modèle vidéo. Les emplacements de référence s'adaptent aux images, clips et audio acceptés par ce modèle.

  2. 2

    Ajoutez références et prompt

    Importez vos références, puis décrivez comment chacune doit influencer la vidéo. Si le modèle le permet, tapez @ pour mentionner une image ajoutée dans le prompt.

  3. 3

    Générez et téléchargez

    Vérifiez les crédits estimés, générez, puis téléchargez la vidéo finale depuis votre historique.

Conseils pour travailler avec des références

  1. Donnez un rôle à chaque référence dans le prompt, par exemple : l'image 1 pour le personnage, le clip pour les pas de danse.
  2. Utilisez des références propres : un portrait de face ou une fiche personnage fonctionne mieux qu'une photo de groupe chargée.
  3. Gardez les clips de référence courts et centrés sur le seul mouvement à reproduire.
  4. Servez-vous des références audio pour le rythme et l'ambiance, et décrivez les visuels voulus dans le prompt.
  5. Commencez avec peu de références et ajoutez-en quand le résultat de base vous convient.
Prompt
Utiliser l'image 1 comme personnage principal et le clip de référence pour les pas de danse ; toit éclairé au néon la nuit, caméra à l'épaule, vidéo verticale

Questions fréquentes

Qu'est-ce que la référence universelle vers vidéo ?
Elle génère une vidéo IA à partir d'un prompt texte et de références image, clips vidéo et audio, pour mieux contrôler personnages, mouvement et ambiance qu'avec un texte ou une seule image.
Quelle différence avec l'image vers vidéo ?
L'image vers vidéo anime une seule image et accepte uniquement des images. La référence vers vidéo combine plusieurs références — images, clips et audio — pour diriger une nouvelle scène.
Quelles références puis-je ajouter, et combien ?
Cela dépend du modèle. Wan 3.0 accepte jusqu'à 21 références au total, MiniMax H3 jusqu'à 9 images, 3 clips vidéo et 3 fichiers audio, HappyHorse 1.0 jusqu'à 9 images. La zone d'import n'affiche que ce que le modèle choisi accepte.
Quels formats de fichier sont pris en charge ?
Les images aux formats courants comme JPG, PNG et WebP, les clips vidéo en MP4, MOV ou M4V, et les fichiers audio comme le MP3.
Combien de crédits cela coûte-t-il ?
Le coût dépend du modèle, de la résolution et de la durée ; sur certains modèles, la durée des clips de référence s'ajoute à la durée facturée. L'estimation s'affiche avant de générer.
Combien de temps prend la génération ?
Généralement de moins d'une minute à plusieurs minutes selon le modèle, les références et la durée. Elle se déroule en arrière-plan, vous pouvez consulter votre historique plus tard.
Les vidéos ont-elles un filigrane ?
Les téléchargements sans filigrane sont inclus dans les offres payantes. Consultez la page des tarifs pour voir ce que comprend chaque offre.
Puis-je garder le même personnage sur plusieurs vidéos ?
Oui. Réutilisez les mêmes images du personnage en référence à chaque génération et décrivez-le de la même façon dans vos prompts.