Velokey
Tutoriels

Comment créer des vidéos IA de 30 secondes avec Seedance 2.5

Seedance 2.5 crée des clips en plan-séquence de 30 secondes. Comment structurer le prompt, maintenir la cohérence sur 50 références et l’appeler via API, étape par étape.

Comment créer des vidéos IA de 30 secondes avec Seedance 2.5

TL;DR

  • Structurez le prompt en trois temps : mise en place, action ou révélation, cadre final. Seedance 2.5 suit mieux l’architecture d’une scène qu’une longue description interminable.
  • Une image de référence par sujet : un plan de chaque personnage, produit ou accessoire. Les images préservent l’apparence sur 30 secondes bien mieux que les mots.
  • Un arc de mouvement, pas cinq : un seul mouvement de caméra ou narratif ("walks to the window as the camera tightens"). Utilisez la durée pour le ralenti, pas pour le chaos.
  • Corrigez avec l’édition par région : changez le seul élément incorrect au lieu de régénérer et de perdre les bonnes parties.
  • Notez la limite : 2.5 est lancé en 720p. La 4K native arrive, mais n’est pas encore disponible.

Seedance 2.5 est le premier modèle qui crée un vrai clip de 30 secondes en une seule prise, sans assemblage. Cette durée est puissante et facile à gaspiller. Donnez-lui un paragraphe vague et vous obtenez 30 secondes de dérive. Donnez-lui un brief structuré et vous obtenez une scène cohérente. Voici comment réussir cette deuxième option.

Pourquoi le one-shot de 30 seconds change-t-il votre façon de prompter ?

Parce que vous dirigez désormais une scène, vous ne décrivez pas une image. Les anciens modèles produisaient des clips si courts qu’une seule phrase suffisait à les couvrir. Thirty seconds est assez long pour contenir un début, un milieu et une fin, donc le modèle a besoin d’un début, d’un milieu et d’une fin vers lesquels tendre. Donnez-lui une description plate et il dérive, parce que rien ne lui indique comment le plan doit évoluer au fil du temps.

C’est le changement de perspective. Vous écrivez une liste de plans, pas une légende. Le reste de ce guide explique comment écrire cette liste de plans pour que Seedance 2.5 la suive réellement.

Comment diviser 30 secondes en trois temps ?

Environ dix secondes chacun, avec une fonction par temps. Le premier temps plante le décor et présente le sujet. Le deuxième fait le vrai travail : l’action, la révélation du produit, le tournant dans l’histoire. Le troisième conclut, avec un dernier geste ou une pause qui donne à la séquence une fin plutôt qu’un arrêt brutal.

Chaque clip doit-il en avoir exactement trois ? Non, mais trois est le juste équilibre pour 30 secondes. Deux temps peuvent sembler maigres sur cette durée, et cinq transforment le tout en montage chaotique que le modèle ne peut pas maintenir. Gardez un seul lieu et un seul arc de mouvement sous-jacent aux trois temps, afin qu’ils ressemblent à des moments d’une même scène, et non à des clips séparés collés ensemble. C’est cette structure qui donne à un long plan unique une impression d’intention.

Structurer un clip Seedance 2.5 de 30 secondes en trois temps : mise en place, action, conclusion

Comment réaliser une vidéo de 30 secondes avec Seedance 2.5 ?

Suivez ces étapes dans l’ordre et vous éliminerez la plupart des dérives dès le premier rendu :

  1. Découpez le clip en trois temps. Mise en place, puis action ou révélation du produit, puis image de clôture. Seedance 2.5 suit cette architecture structurée plus fiable qu’une description continue.
  2. Ajoutez une image de référence pour chaque sujet. Un plan par personnage, produit et accessoire clé. Les références visuelles maintiennent l’apparence pendant les 30 secondes complètes, là où le texte seul dérive.
  3. Choisissez un seul arc de mouvement. Un mouvement unique qui évolue, comme un personnage traversant la pièce tandis que la caméra avance lentement. Utilisez la durée pour un mouvement lent et délibéré.
  4. Verrouillez l’apparence. Indiquez une seule ambiance d’éclairage et de couleur et tenez-vous-y. Les indications contradictoires cassent le clip.
  5. Prévisualisez avant de valider. Utilisez la passe de prévisualisation 3D whitebox pour vérifier la caméra et le mouvement, puis effectuez le rendu final.
  6. Corrigez avec l’édition par région. Lorsqu’un élément est incorrect, redessinez uniquement celui-ci ; ne régénérez pas tout le clip au risque d’abîmer les parties qui fonctionnaient déjà.

Comment rédiger le prompt ?

Utilisez un cadre de type réalisateur et remplissez-le dans le même ordre à chaque fois : Sujet + Action → Environnement → Apparence → Caméra → Audio, avec des libellés de coupe explicites entre les temps. Cet ordre compte, car il met en avant ce sur quoi le modèle se fixe d’abord (qui et ce qui se passe) avant le style.

Voici la structure, remplie pour un clip produit :

[Beat 1 - setup] A woman in a navy coat stands in a bright minimalist kitchen,
morning light. Camera: slow push-in.
[Beat 2 - reveal] She lifts a matte-black coffee maker onto the counter and
presses the top button; steam rises. Camera: tighten to the product.
[Beat 3 - close] She takes a sip, smiles, looks off-frame. Camera: hold.
Look: warm, clean, commercial. Audio: soft ambient kitchen, no dialogue.

Remarquez ce que cela fait. Chaque temps nomme un sujet et une action, puis l’environnement, puis une direction d’apparence et une direction audio pour l’ensemble du clip. Les libellés de coupe donnent sa structure au modèle. Cela se lit comme un storyboard, parce que c’est ce à quoi Seedance 2.5 répond.

Texte-vers-vidéo ou image-vers-vidéo ?

Seedance 2.5 fait les deux, et choisir le bon point d'entrée vous évite des batailles plus tard. Texte-vers-vidéo construit toute la scène à partir de votre prompt, ce qui est le bon choix quand rien n'existe encore et que vous voulez que le modèle invente l'apparence. Image-vers-vidéo anime une image fixe que vous avez déjà, le bon choix quand vous possédez le cadre exact, une photo produit, un visuel clé de marque, et que vous avez simplement besoin de le mettre en mouvement.

Pour le travail de marque et de produit, image-vers-vidéo l'emporte généralement. Vous partez de la vraie photo du produit, donc l'objet est déjà correct et le modèle l'anime autour de lui au lieu d'en deviner la forme. Partir d'un cadre verrouillé est l'un des moyens les plus sûrs de garder un clip de 30-secondes conforme à la marque. Utilisez texte-vers-vidéo pour les scènes originales, image-vers-vidéo lorsque l'ancre existe déjà.

Comment gardez-vous les personnages et les produits cohérents ?

Appuyez-vous sur des références, pas sur des adjectifs. Seedance 2.5 accepte jusqu’à 50 entrées multimodales, soit environ 30 images, 10 clips vidéo et 10 clips audio, et c’est là que ce budget prend tout son sens. Importez une prise de vue nette de chaque personnage et produit que vous nommez dans le prompt. Le modèle s’aligne sur l’image bien plus fiablement que sur une description textuelle comme "a matte-black coffee maker," qu’il réinventera autrement à chaque seconde.

Pour un personnage récurrent, donnez-lui quelques angles : face, trois quarts, profil. Pour un produit, donnez-lui la photo principale et une photo de détail. Plus le modèle peut voir, moins il devine, et c’est le fait de deviner qui produit cet aspect de visage changeant qui crie AI. Sur un clip de 30 secondes, la cohérence est surtout un problème de références, et Seedance 2.5 a la marge nécessaire pour le résoudre.

Comment appeler Seedance 2.5 depuis l’API ?

La génération vidéo s’exécute comme une tâche asynchrone : vous soumettez une requête, interrogez le statut, puis téléchargez le résultat lorsqu’il est prêt. Via une passerelle compatible OpenAI comme Velokey, la structure ressemble à ceci :

import requests, time

BASE = "https://api.velokey.ai/v1"
headers = {"Authorization": "Bearer $VELOKEY_API_KEY"}

# 1. submit the job
job = requests.post(f"{BASE}/videos/generations", headers=headers, json={
    "model": "seedance-2.5",
    "prompt": "<your three-beat prompt>",
    "references": ["https://.../character.png", "https://.../product.png"],
    "duration": 30,
}).json()

# 2. poll until it's done
while True:
    r = requests.get(f"{BASE}/tasks/{job['id']}", headers=headers).json()
    if r["status"] == "completed":
        print(r["results"][0])   # video URL
        break
    time.sleep(5)

C’est le modèle d’utilisation, pas la liste finale des paramètres, car les champs exacts évoluent au fil du déploiement du modèle. Pour le schéma de requête actuel, le format de réponse et la tarification par vidéo, consultez notre guide API Seedance 2.5, qui suit les détails en direct. L’avantage d’une passerelle ici, c’est que passer à Veo ou Kling pour un autre plan revient au même appel avec un nom de modèle différent.

Qu’en est-il de l’audio dans Seedance 2.5 ?

Nouveauté de la 2.5, le modèle génère l’audio synchronisé dans la même passe, ce qui vous permet de diriger le son directement dans le prompt. Restez simple. Indiquez une seule intention audio par clip, comme « soft ambient kitchen, no dialogue » ou « upbeat background music », et laissez-la accompagner les visuels. L’ambiance et la musique sont les domaines où l’audio de Seedance est le plus fort.

Les dialogues lourds sont une autre histoire. Si votre clip repose entièrement sur une réplique parlée qui doit tomber parfaitement en synchronisation, Veo 3.1 reste en tête pour les dialogues en 48kHz, et le clip plus court en vaut la peine pour ce cas précis. Pour la plupart des travaux produit et narratifs de 30 secondes, toutefois, les sons d’ambiance et la musique de Seedance suffisent, et les générer dans la même passe vaut mieux que d’ajouter l’audio en postproduction.

Qu’en est-il de la résolution ? Le piège du 720p

Fixez les attentes avant de lancer le rendu : Seedance 2.5 est lancé avec une limite à 720p. La 4K native et la couleur 10-bit figurant dans sa fiche technique sont sur la feuille de route, pas disponibles au lancement. Pour les réseaux sociaux, le mobile et le web, le 720p convient et vous ne remarquerez jamais la différence. Pour un clip qui doit être net sur un grand écran aujourd’hui, c’est une vraie limite, et Seedance 2.0 propose toujours du 1080p et de la 4K dans ses offres supérieures. Planifiez la résolution en fonction de l’endroit où la vidéo sera réellement diffusée.

Comment itérer sans brûler des rendus ?

La correction la moins chère d'abord, la plus coûteuse en dernier. Un rendu complet de 30-secondes coûte le plus cher, donc vous ne voulez pas y recourir chaque fois qu'un détail cloche légèrement. Commencez par la prévisualisation : repérez les problèmes de caméra et de mouvement dans la passe whitebox avant de payer pour un clip finalisé. Puis lancez le rendu.

Un détail incorrect dans le rendu final ? Modifiez la région concernée. Redessinez l'unique élément et conservez tout ce qui fonctionnait déjà, au lieu de relancer tout le clip et de risquer les bonnes parties. Gardez une régénération complète pour les cas où tout le concept est à côté, pas lorsqu'une veste n'est pas de la bonne couleur. Travaillez dans cet ordre : prévisualisation, puis modification de région, puis rendu complet uniquement en dernier recours, et vous dépenserez une fraction des crédits qu'une habitude de tout relancer consomme.

Un exemple concret : une publicité produit de 30 secondes

Voici la boucle complète sur un seul clip. Imaginons que vous réalisiez une publicité de 30 secondes pour une cafetière. D’abord, rassemblez les références : le visuel hero du produit, un gros plan de détail et une photo de votre présentateur. Ensuite, rédigez le prompt en trois temps : mise en place dans la cuisine, révélation du produit et préparation du café, puis gorgée finale, avec un rendu publicitaire chaleureux et un son d’ambiance de cuisine. Enfin, lancez la prévizz whitebox et vérifiez que la caméra se resserre bien sur le produit au moment de la révélation, pas avant.

Quelque chose cloche ? Corrigez-le sur place. Si la veste du présentateur est sortie dans la mauvaise couleur, modifiez la région de la veste et laissez intact le plan de préparation déjà validé. Rendez en 720p pour la version réseaux sociaux. Si le client a besoin d’un master 4K aujourd’hui, générez ce plan sur Seedance 2.0 comme solution provisoire en attendant l’arrivée de la 4K de 2.5. C’est une passe de production complète sans jamais régénérer depuis zéro.

Quelles sont les erreurs courantes ?

Trois erreurs gâchent la plupart des tentatives de 30 secondes, et toutes les trois sont faciles à éviter une fois qu’on les connaît :

  • En mettre trop. Plusieurs lieux et une foule de personnages dans un seul clip de 30 secondes, c’est plus que ce que le modèle peut maintenir ensemble. Si votre idée comporte trois décors et quatre personnes, divisez-la en clips séparés et assemblez-les dans un éditeur. Une scène cohérente par génération.
  • Une direction contradictoire. Des indications qui se contredisent, comme "dark moody noir lighting" et "bright clean commercial look" dans le même prompt, produisent quelque chose d’incohérent. Choisissez une ambiance. Choisissez une palette. Laissez les temps forts porter le changement, pas des adjectifs contradictoires.
  • Aucun arc de mouvement. Trente secondes statiques, ce sont trente secondes ennuyeuses. Si rien n’évolue, le clip donne l’impression d’un rendu figé maintenu trop longtemps. Donnez-lui un mouvement, un rapprochement, un panoramique, un personnage qui traverse le cadre, afin que la durée paraisse intentionnelle plutôt que du remplissage.

Réussissez ces trois points, structurez le prompt en temps forts et faites référence à chaque sujet, et les 30 secondes de Seedance 2.5 passent d’un pari à un résultat assez reproductible.

Foire aux questions

Quelle peut être la durée d'une vidéo Seedance 2.5 ?

Jusqu'à 30 secondes en une seule génération native, soit le double des 15 de Seedance 2.0. Le clip entier est rendu en un seul passage, il peut donc inclure des changements de scène et un arc narratif sans assembler des clips séparés. Ces 30 secondes en un seul plan sont la capacité phare du modèle.

Comment rédiger un bon prompt Seedance 2.5 ?

Structurez-le en trois temps, mise en place, action et conclusion, et utilisez un cadre de réalisateur : Sujet + Action, puis Environnement, Style visuel, Caméra et Audio, avec des libellés de coupe entre les temps. Ajoutez une image de référence pour chaque sujet. Gardez une seule ambiance lumineuse et un seul arc de mouvement sur l'ensemble du clip.

Seedance 2.5 peut-il créer des vidéos 4K ?

Pas au lancement. Seedance 2.5 est limité à 720p aujourd'hui, avec la 4K native prévue sur la feuille de route pour un déploiement ultérieur. Si vous avez besoin de 4K dès maintenant, Seedance 2.0 la propose dans ses offres supérieures. Pour les sorties sociales et mobiles, la résolution de lancement 720p est généralement suffisante.

Comment garder un personnage cohérent dans un clip Seedance ?

Utilisez des images de référence, pas du texte. Importez plusieurs angles du personnage, de face, de trois quarts et de profil, et Seedance 2.5 s'y conforme bien plus fiablement qu'à une description. Son budget de 50 références est conçu exactement pour cela, c'est pourquoi la cohérence sur un long clip dépend surtout de bonnes références.

Comment corriger une partie d'une vidéo Seedance 2.5 ?

Utilisez l'édition par région. Elle vous permet de redessiner un seul élément, comme un vêtement, un arrière-plan ou un produit, tandis que la performance, le mouvement et l'éclairage restent verrouillés. C'est mieux que de régénérer tout le clip, ce qui risque de faire perdre les parties déjà réussies. C'est le moyen le plus rapide d'itérer sur un détail.

Comment appeler Seedance 2.5 via une API ?

Soumettez une tâche asynchrone avec votre prompt et vos URLs de référence, interrogez la tâche jusqu'à son achèvement, puis téléchargez la vidéo. Via un endpoint compatible OpenAI comme Velokey, il s'agit d'une requête avec le modèle défini sur Seedance 2.5, et passer à un autre modèle vidéo correspond au même appel avec un nom différent.

Faut-il utiliser text-to-video ou image-to-video dans Seedance 2.5 ?

Utilisez image-to-video lorsque vous disposez déjà de l'image exacte, comme une photo produit ou un visuel de marque, afin que le modèle anime un objet correct au lieu d'en inventer un. Utilisez text-to-video pour des scènes originales créées de zéro. Pour les clips de marque et de produit, partir d'une image réelle est la voie la plus fiable vers la cohérence sur les 30 secondes complètes.