Velokey
Tutoriales

Cómo hacer videos de IA de 30 segundos con Seedance 2.5

Seedance 2.5 crea clips de 30 segundos en una sola toma. Cómo estructurar el prompt, mantener la consistencia en 50 referencias y llamarlo mediante API, paso a paso.

Cómo hacer videos de IA de 30 segundos con Seedance 2.5

TL;DR

  • Estructura el prompt en tres tiempos: planteamiento, acción o revelación, encuadre final. Seedance 2.5 sigue mejor la arquitectura de escena que una descripción larga y atropellada.
  • Una imagen de referencia por sujeto: una toma de cada personaje, producto o accesorio. Las imágenes mantienen la apariencia durante 30 segundos mucho mejor que las palabras.
  • Un arco de movimiento, no cinco: un solo movimiento de cámara o de historia ("walks to the window as the camera tightens"). Usa la duración para cámara lenta, no para el caos.
  • Corrige con edición por región: cambia el elemento incorrecto en lugar de regenerar y perder las partes buenas.
  • Ten en cuenta el límite: 2.5 se lanza a 720p. El 4K nativo está en camino, pero aún no está disponible.

Seedance 2.5 es el primer modelo que crea un clip real de 30 segundos de una sola vez, sin empalmes. Esa duración es potente y fácil de desperdiciar. Dale un párrafo vago y obtendrás 30 segundos de deriva. Dale un brief estructurado y obtendrás una escena coherente. Así es como se consigue lo segundo.

¿Por qué 30 segundos en una sola toma cambian la forma en que escribes prompts?

Porque ahora estás dirigiendo una escena, no describiendo un fotograma. Los modelos anteriores generaban clips tan cortos que una sola frase bastaba para cubrirlos. Treinta segundos es suficiente para contener un principio, un desarrollo y un final, así que el modelo necesita un principio, un desarrollo y un final hacia los que apuntar. Dale una descripción plana y se desviará, porque nada le indica cómo debería evolucionar la toma con el tiempo.

Ese es el cambio mental. Estás escribiendo una lista de tomas, no un pie de foto. El resto de esta guía explica cómo escribir esa lista de tomas para que Seedance 2.5 realmente la siga.

¿Cómo divides 30 segundos en tres tiempos?

Aproximadamente diez segundos cada uno, una tarea por tiempo. El primer tiempo establece la escena e introduce el sujeto. El segundo hace el trabajo real: la acción, la presentación del producto, el giro de la historia. El tercero lo remata, con un gesto final o una pausa que le da al clip un cierre en lugar de un corte brusco.

¿Cada clip necesita exactamente tres? No, pero tres es el punto ideal para 30 segundos. Dos tiempos pueden sentirse escasos para esa duración, y cinco lo convierten en un montaje caótico que el modelo no puede sostener. Mantén una ubicación y un arco de movimiento funcionando por debajo de los tres, para que los tiempos se sientan como momentos de una sola escena, no como clips separados pegados entre sí. Esa estructura es lo que hace que una toma única larga se perciba como deliberada.

Estructura un clip de Seedance 2.5 de 30 segundos en tres tiempos: planteamiento, acción, cierre

¿Cómo se hace un video de 30 segundos con Seedance 2.5?

Sigue estos pasos en orden y eliminarás la mayor parte de la deriva en el primer render:

  1. Divide el clip en tres tiempos. Preparación, luego acción o revelación del producto, y después un fotograma de cierre. Seedance 2.5 sigue esta arquitectura estructurada de forma más fiable que una descripción continua.
  2. Añade una imagen de referencia para cada sujeto. Una toma por personaje, producto y accesorio clave. Las referencias visuales mantienen la apariencia durante los 30 segundos completos, mientras que el texto por sí solo deriva.
  3. Elige un arco de movimiento. Un único movimiento evolutivo, como un personaje que cruza la habitación mientras la cámara se acerca lentamente. Usa la duración para un movimiento lento y deliberado.
  4. Bloquea el estilo. Indica una iluminación y un ambiente de color, y mantenlos. Las indicaciones contradictorias rompen el clip.
  5. Previsualiza antes de comprometerte. Usa el pase de previz whitebox 3D para comprobar la cámara y el movimiento, luego renderiza de verdad.
  6. Corrige con edición por regiones. Cuando un elemento esté mal, redibuja solo eso, no regeneres todo el clip y arriesgues las partes que ya funcionaban.

¿Cómo escribes el prompt?

Usa un marco de estilo director y complétalo siempre en el mismo orden: Sujeto + Acción → Entorno → Aspecto → Cámara → Audio, con etiquetas de corte explícitas entre momentos. Ese orden importa, porque antepone aquello en lo que el modelo se fija primero (quién y qué está ocurriendo) antes del estilo.

Esta es la estructura, completada para un clip de producto:

[Beat 1 - setup] A woman in a navy coat stands in a bright minimalist kitchen,
morning light. Camera: slow push-in.
[Beat 2 - reveal] She lifts a matte-black coffee maker onto the counter and
presses the top button; steam rises. Camera: tighten to the product.
[Beat 3 - close] She takes a sip, smiles, looks off-frame. Camera: hold.
Look: warm, clean, commercial. Audio: soft ambient kitchen, no dialogue.

Fíjate en lo que hace. Cada momento nombra un sujeto y una acción, luego el entorno, después una indicación de aspecto y una de audio para todo el clip. Las etiquetas de corte le dan al modelo su estructura. Se lee como un storyboard porque eso es a lo que responde Seedance 2.5.

¿Texto a video o imagen a video?

Seedance 2.5 hace ambas cosas, y elegir el punto de entrada correcto te ahorra peleas más adelante. Texto a video construye toda la escena a partir de tu prompt, que es la opción cuando aún no existe nada y quieres que el modelo invente el aspecto. Imagen a video anima una imagen fija que ya tienes, la opción cuando tienes el encuadre exacto, una foto de producto, un visual clave de marca, y solo necesitas que se mueva.

Para trabajos de marca y producto, imagen a video suele ganar. Empiezas desde la toma real del producto, así que el objeto ya es correcto y el modelo anima alrededor de él en lugar de adivinar su forma. Empezar desde un encuadre bloqueado es una de las formas más seguras de mantener un clip de 30 segundos alineado con la marca. Usa texto a video para escenas originales, imagen a video cuando el ancla ya existe.

¿Cómo mantienes la coherencia de personajes y productos?

Apóyate en referencias, no en adjetivos. Seedance 2.5 acepta hasta 50 entradas multimodales, aproximadamente 30 imágenes, 10 clips de video y 10 clips de audio, y aquí es donde ese presupuesto se gana su lugar. Sube una toma limpia de cada personaje y producto que menciones en el prompt. El modelo se ajusta a la imagen con mucha más fiabilidad que a una descripción de texto como "una cafetera negro mate", que de lo contrario reinventará cada segundo.

Para un personaje recurrente, dale algunos ángulos: frontal, tres cuartos, perfil. Para un producto, dale la toma principal y una toma de detalle. Cuanto más pueda ver el modelo, menos adivina, y adivinar es lo que produce ese aspecto de rostro cambiante que grita IA. En un clip de 30 segundos, la coherencia es sobre todo un problema de referencias, y Seedance 2.5 tiene margen para resolverlo.

¿Cómo se llama a Seedance 2.5 desde la API?

La generación de video se ejecuta como un trabajo asíncrono: envías una solicitud, consultas el estado y luego descargas el resultado cuando está listo. A través de una pasarela compatible con OpenAI como Velokey, la estructura se ve así:

import requests, time

BASE = "https://api.velokey.ai/v1"
headers = {"Authorization": "Bearer $VELOKEY_API_KEY"}

# 1. submit the job
job = requests.post(f"{BASE}/videos/generations", headers=headers, json={
    "model": "seedance-2.5",
    "prompt": "<your three-beat prompt>",
    "references": ["https://.../character.png", "https://.../product.png"],
    "duration": 30,
}).json()

# 2. poll until it's done
while True:
    r = requests.get(f"{BASE}/tasks/{job['id']}", headers=headers).json()
    if r["status"] == "completed":
        print(r["results"][0])   # video URL
        break
    time.sleep(5)

Ese es el patrón, no la lista final de parámetros, ya que los campos exactos cambian a medida que el modelo se implementa. Para el esquema de solicitud actual, el formato de respuesta y los precios por video, consulta nuestra guía de la API de Seedance 2.5, que sigue los detalles en vivo. La ventaja de una pasarela aquí es que cambiar a Veo o Kling para una toma diferente es la misma llamada con un nombre de modelo distinto.

¿Qué pasa con el audio en Seedance 2.5?

Nuevo en 2.5, el modelo genera audio sincronizado en la misma pasada, así que puedes dirigir el sonido directamente en el prompt. Mantenlo simple. Nombra una intención de audio por clip, como "cocina con ambiente suave, sin diálogo" o "música de fondo animada", y deja que quede bajo las imágenes. El ambiente y la música son donde el audio de Seedance es más fuerte.

El diálogo intenso es otra historia. Si tu clip depende por completo de que una línea hablada encaje perfectamente sincronizada, Veo 3.1 sigue liderando en diálogo de 48kHz, y vale la pena aceptar el clip más corto para esa tarea concreta. Para la mayoría de trabajos de producto y narrativos de 30 segundos, sin embargo, el sonido ambiente y la música de Seedance son suficientes, y generarlos en la misma pasada supera añadir audio después en postproducción.

¿Qué pasa con la resolución? El detalle de 720p

Define las expectativas antes de renderizar: Seedance 2.5 se lanza con un límite de 720p. El 4K nativo y el color de 10 bits en su hoja de especificaciones están en la hoja de ruta, no disponibles en el lanzamiento. Para redes sociales, móviles y web, 720p está bien y nunca lo notarás. Para un clip que tiene que verse nítido hoy en una pantalla grande, esto es una limitación real, y Seedance 2.0 todavía ofrece 1080p y 4K en sus niveles superiores. Planifica la resolución según dónde se reproducirá realmente el video.

¿Cómo iteras sin quemar renders?

Primero la solución más barata, al final la más cara. Un render completo de 30 segundos cuesta más, así que no conviene recurrir a él cada vez que algo está ligeramente mal. Empieza con previz: detecta problemas de cámara y movimiento en el pase whitebox antes de pagar por un clip terminado. Luego renderiza.

¿Un detalle incorrecto en el final? Edítalo por región. Vuelve a dibujar ese único elemento y conserva todo lo que ya funcionó, en lugar de rehacer todo el clip y apostar las partes buenas. Reserva una regeneración completa para cuando todo el concepto esté mal, no cuando una chaqueta tenga el color equivocado. Trabaja en ese orden, previz, luego edición por región, luego un rerenderizado completo solo como último recurso, y gastarás una fracción de los créditos que consume el hábito de rehacerlo todo.

Un ejemplo práctico: un anuncio de producto de 30 segundos

Aquí está el ciclo completo en un solo clip. Supongamos que estás haciendo un anuncio de 30 segundos para una cafetera. Primero, reúne referencias: la toma hero del producto, una toma de detalle y una foto de tu presentador. Segundo, escribe el prompt de tres momentos: preparación en la cocina, la revelación del producto y la preparación del café, el sorbo final, con un aspecto comercial cálido y audio ambiental de cocina. Tercero, ejecuta la previz de whitebox y comprueba que la cámara realmente se cierre sobre el producto en la revelación, no antes.

¿Algo no encaja? Corrígelo en su sitio. Si la chaqueta del presentador salió del color equivocado, edita por región la chaqueta y deja intacta la toma aprobada de la preparación del café. Renderiza a 720p para el corte social. Si el cliente necesita hoy un máster en 4K, genera esa única toma en Seedance 2.0 como solución provisional hasta que llegue el 4K de 2.5. Eso es una pasada de producción completa sin tener que regenerar nunca desde cero.

¿Cuáles son los errores comunes?

Tres errores arruinan la mayoría de los intentos de 30 segundos, y los tres son fáciles de evitar una vez que los conoces:

  • Meter demasiado. Varias ubicaciones y una multitud de personajes en un solo clip de 30 segundos es más de lo que el modelo puede mantener unido. Si tu idea tiene tres escenarios y cuatro personas, divídela en clips separados y móntalos en un editor. Una escena coherente por generación.
  • Dirección contradictoria. Las indicaciones que chocan entre sí, como "dark moody noir lighting" y "bright clean commercial look" en el mismo prompt, producen algo incoherente. Elige un estado de ánimo. Elige una paleta. Deja que los beats conduzcan el cambio, no adjetivos contradictorios.
  • Sin arco de movimiento. Treinta segundos estáticos son treinta segundos aburridos. Si nada evoluciona, el clip se siente como un render congelado mantenido demasiado tiempo. Dale un movimiento, un push-in, un paneo, un personaje cruzando, para que la duración se perciba como intencional en lugar de relleno.

Si aciertas con esos tres, estructuras el prompt en beats y haces referencia a cada sujeto, los 30 segundos de Seedance 2.5 pasan de ser una apuesta a un resultado bastante repetible.

Preguntas frecuentes

¿Cuánto puede durar un video de Seedance 2.5?

Hasta 30 segundos en una sola generación nativa, el doble de los 15 de Seedance 2.0. Todo el clip se renderiza en una sola pasada, por lo que puede incluir cambios de escena y un arco narrativo sin unir clips separados. Esos 30 segundos en una sola toma son la capacidad principal del modelo.

¿Cómo se escribe un buen prompt para Seedance 2.5?

Estructúralo en tres partes, planteamiento, acción y cierre, y usa un marco de director: Sujeto + Acción, luego Entorno, Estilo visual, Cámara y Audio, con etiquetas de corte entre partes. Añade una imagen de referencia para cada sujeto. Mantén un solo ambiente de iluminación y un solo arco de movimiento durante todo el clip.

¿Puede Seedance 2.5 crear video en 4K?

No en el lanzamiento. Seedance 2.5 está limitado hoy a 720p, con 4K nativo en la hoja de ruta para un despliegue posterior. Si necesitas 4K ahora mismo, Seedance 2.0 lo ofrece en sus niveles superiores. Para contenido social y móvil, la resolución de lanzamiento de 720p suele ser suficiente.

¿Cómo mantienes la coherencia de un personaje a lo largo de un clip de Seedance?

Usa imágenes de referencia, no texto. Sube varios ángulos del personaje, frontal, tres cuartos y perfil, y Seedance 2.5 se ajusta a ellos con mucha más fiabilidad que a una descripción. Su presupuesto de 50 referencias está pensado exactamente para esto, por eso la coherencia en un clip largo depende principalmente de tener buenas referencias.

¿Cómo corriges una parte de un video de Seedance 2.5?

Usa edición por región. Te permite redibujar un solo elemento, como la ropa, un fondo o un producto, mientras la interpretación, el movimiento y la iluminación permanecen fijos. Eso supera regenerar todo el clip, lo que arriesga perder las partes que ya salieron bien. Es la forma más rápida de iterar un detalle.

¿Cómo llamas a Seedance 2.5 mediante una API?

Envía un trabajo asíncrono con tu prompt y las URLs de referencia, consulta la tarea hasta que se complete y luego descarga el video. A través de un endpoint compatible con OpenAI como Velokey, es una solicitud con el modelo configurado como Seedance 2.5, y cambiar a otro modelo de video es la misma llamada con un nombre diferente.

¿Deberías usar texto a video o imagen a video en Seedance 2.5?

Usa imagen a video cuando ya tengas el fotograma exacto, como una foto de producto o un recurso visual de marca, para que el modelo anime un objeto correcto en lugar de inventar uno. Usa texto a video para escenas originales creadas desde cero. Para clips de marca y producto, partir de una imagen real es el camino más fiable hacia la coherencia durante los 30 segundos completos.