Skip to main content
Contenido de la guía

Contenido de la guía

Tiempo de estudio: 18 min
#higgsfield#cinema-studio#soul-2#video-generation#ai-video#ugc#api
NEWIntermedio18 min

Guía completa de Higgsfield Cinema Studio 4.0: gestión de escenas, Soul 2.0 y automatización vía API

Análisis práctico detallado de la gran actualización de Higgsfield: Cinema Studio 4.0, personajes consistentes con Soul 2.0, generación mediante API y un pipeline UGC listo para producción.

Publicado:
PARA AGENTE IAChatGPTClaude

El ecosistema Higgsfield ha recibido una importante actualización tecnológica: Cinema Studio 4.0 ofrece un conjunto ampliado de herramientas de control directo de la escena, el módulo Soul 2.0 garantiza una fijación estable de los personajes entre fotogramas, y el catálogo de API abre el acceso a más de 50 modelos de redes neuronales para la automatización integral de la producción de vídeo.

Esta guía práctica analiza en detalle todas las novedades clave de la plataforma y los escenarios reales de su implementación, desde la fina configuración manual de la óptica y las emociones del protagonista hasta el pipeline de vídeo programático y la creación autónoma de creativos UGC.

Herramienta / MóduloPropósito principalEscenario de uso óptimo
Cinema Studio 4.0Control preciso fotograma a fotograma de la direcciónCreación de planos autorales con control de cámara, luz, ritmo y óptica
Soul 2.0 (Soul ID)Fijación de la identidad del personajeProducción en serie de vídeos con un único héroe en diferentes ubicaciones
Higgsfield APIGeneración por lotes programáticaIntegración en productos B2B, embudos automáticos, renderizado masivo
Pipeline UGC (Claude + Seedance)Generación de publicidad a partir de fotos de productoLanzamiento rápido de creativos de marketing sin equipo de rodaje

1. Principales actualizaciones de la plataforma Higgsfield

El evento central del lanzamiento fue la presentación de Cinema Studio 4.0. El cambio conceptual principal es la transición de intentar condensar todas las indicaciones de dirección en un único prompt textual largo, hacia herramientas físicamente precisas de previsualización de la escena antes de iniciar el renderizado.

Las mejoras técnicas clave incluyen:

  • Aumento de la duración: la duración máxima de un clip generado completo se ha incrementado de 15 a 30 segundos;
  • Carga por lotes de referencias: envío simultáneo de hasta 50 imágenes en lugar de las 9 anteriores;
  • Biblioteca de movimientos de cámara: más de 30 presets cinematográficos calibrados en sustitución de los 9 básicos;
  • Tipos de cámaras de rodaje: 4 tipos de sistemas de captura en lugar de 3;
  • Estilos de color: más de 50 presets profesionales de corrección de color en lugar de 8;
  • Controles dedicados: se han añadido reguladores independientes de ritmo (Tempo), época (Era Selector) y rueda de emociones (Emotion Wheel);
  • Extensión bidireccional de la escena: se han implementado las herramientas Forward Extend (extensión hacia adelante) y Backward Extend (reconstrucción del inicio);
  • Física de lentes ópticas: las propiedades de las lentes ahora se integran directamente en el algoritmo de difusión durante el proceso de generación, en lugar de aplicarse como un filtro posterior.

Paralelamente, la plataforma desarrolla dos direcciones estratégicas: la arquitectura Soul 2.0 para avatares digitales consistentes y una REST API con acceso a más de 50 modelos especializados para construir pipelines de vídeo personalizados.


2. Cinema Studio 4.0: cambios y posibilidades clave

En la cuarta versión de Cinema Studio, los parámetros básicos de rodaje se han extraído de la descripción textual a selectores de sistema independientes. Esto elimina las alucinaciones de la red neuronal y proporciona un resultado predecible.

Duración de generación de hasta 30 segundos

Una sola generación puede durar hasta 30 segundos. Este timing es suficiente no solo para un cambio rápido de plano, sino para una escena dramática completa con desarrollo de acción, exposición y clímax, sin necesidad de editar manualmente fragmentos de dos segundos.

Multirreferencias: hasta 50 referencias simultáneamente

Ahora se pueden transferir hasta 50 imágenes originales a un único contexto de generación. Esto permite fijar simultáneamente:

  • Rostro del personaje: ángulos de retrato desde diferentes perspectivas;
  • Producto comercial: embalaje, forma, logotipo, texturas físicas;
  • Referencia de ubicación: interior, arquitectura o paisaje natural;
  • Estética visual: estilo general del encuadre y gama cromática;
  • Detalles del atrezzo: objetos clave del entorno material.

El modelo procesa todo el conjunto de imágenes en un único embedding, evitando el difuminado de los detalles del producto o la distorsión del rostro del héroe.

Más de 30 movimientos de cámara de rodaje

El instrumental de Cinema Studio 4.0 incluye más de 30 presets dinámicos de movimiento de cámara virtual, entre ellos:

  • POV (Point of View): grabación subjetiva en primera persona con balanceo natural;
  • Robot Arm: desplazamientos ultra suaves y precisos siguiendo trayectorias complejas de grúa industrial manipuladora;
  • Pan Left / Pan Right: panorámica horizontal de la escena manteniendo el horizonte nivelado;
  • Helicopter Shot: planos generales extensos desde vista aérea;
  • Tracking: seguimiento de un objeto en movimiento manteniendo la distancia;
  • Pedestal Down / Up: desplazamiento vertical del trípode en altura sin inclinar el eje óptico.

Parámetros directos de control de la escena

Los controladores de la interfaz permiten gestionar directamente la física del encuadre:

  • Tempo: establece el ritmo interno del movimiento y la dinámica de montaje;
  • Era: estiliza la imagen según un período histórico;
  • Emotion Wheel: fija la mímica y la intensidad emocional del personaje;
  • Colour Palette: define la gama profesional de gradación de color;
  • Lighting: configura el esquema de colocación de fuentes de luz de estudio.

Además, la herramienta permite cargar un vídeo externo ya listo y continuar su desarrollo hacia adelante sin costuras, o reconstruir los eventos precedentes mediante Forward / Backward Extend.


3. Configuración cinematográfica básica: Genre, Era y Tempo

Antes de lanzar la generación, la secuencia de vídeo se calibra mediante tres parámetros fundamentales: género de la puesta en escena, época histórica y ritmo de montaje.

Estilización por género (Genre)

El selector Genre influye de manera integral en el carácter de la iluminación, la densidad del encuadre, el ángulo de inclinación de la cámara y la velocidad de los acontecimientos:

  • General: imagen equilibrada con contraste cinematográfico estándar sin un acento genérico marcado;
  • Action: seguimiento dinámico activo del objeto, encuadres cerrados, efecto de presencia;
  • Epic: planos generales panorámicos, perspectiva profunda, máximo detalle del entorno;
  • Drama: planos medios y primeros planos, énfasis en los rostros, larga duración del plano, patrón suave de luces y sombras;
  • Comedy: composición frontal abierta, alta exposición, espacio para la mise-en-scène y la gestualidad;
  • Horror: ángulos holandeses marcados (Dutch angle), encuadre claustrofóbico, zonas contrastadas de oscuridad profunda;
  • Noir: luz direccional dura, sombras profundas con bordes definidos, composición silueteada.

Época histórica (Era)

El selector Era ajusta automáticamente el tipo de grano de película, la colorimetría y el carácter de las distorsiones ópticas según la década seleccionada:

  • Auto: adaptación neutra al estilo del prompt;
  • 1920s: contraste monocromático, parpadeo marcado del cine temprano, enfoque suave;
  • 1950s: Technicolor temprano saturado, luz de estudio cálida característica;
  • 1970s: gama cálida apagada, tonos amarillo-anaranjados característicos, destello vintage;
  • 1980s: acentos neón, ligero blur VHS, destellos horizontales anamórficos;
  • 1990s: grano denso de película de 35 mm, reproducción de color analógica natural;
  • 2000s: nitidez digital temprana con grading frío característico;
  • Modern: imagen digital moderna cristalina con amplio rango dinámico (HDR);
  • Future: hiperrealismo futurista, aberraciones cromáticas, reflejos neón.

Ritmo y montaje (Tempo)

El parámetro Tempo regula la intensidad del movimiento dentro del fotograma:

  • Calm: desarrollo meditativo y fluido de los eventos para diálogos dramáticos o paisajes;
  • Single Shot: plano continuo estable para mostrar unboxing o presentaciones de producto;
  • Dynamic: movimiento enérgico, óptimo para spots publicitarios y promos;
  • Chaotic: cambios rápidos y bruscos de ángulo y alta velocidad de acción para escenas de persecución y acción.

4. Emotion Wheel: ajuste preciso de las emociones del personaje

Emotion Wheel elimina la necesidad de buscar decenas de sinónimos en la descripción textual para hacer que el héroe sonría o se asuste.

El sistema permite asignar un vector emocional exacto a un héroe específico mediante sintaxis de texto:

text
@character_name Fear

o

text
@character_name Joy

Entre los estados emocionales básicos disponibles:

  • Joy: alegría abierta, sonrisa natural, expresión facial relajada;
  • Sadness: tristeza, mirada baja, lágrimas, pérdida de tono emocional;
  • Anger: agresión, cejas fruncidas, mandíbula apretada, cuello tenso;
  • Fear: susto, ojos muy abiertos, cuerpo retrocediendo;
  • Surprise: sorpresa repentina, cejas levantadas, boca entreabierta;
  • Disgust: asco, nariz arrugada, labio superior elevado;
  • Calm: calma emocional neutral, mirada relajada;
  • Anticipation: espera tensa, atención enfocada.

El controlador también permite regular la intensidad de la manifestación del sentimiento y definir emociones transitorias complejas.


5. Colour Palette y Lighting: color y luz como ajustes independientes

En Cinema Studio 4.0, el esquema de color y la iluminación de estudio ya no entran en conflicto durante el proceso de difusión.

Paleta de colores (Colour Palette)

El usuario dispone de más de 50 presets cinematográficos profesionales, incluyendo:

  • Teal & Orange: contraste clásico de blockbuster hollywoodense entre tonos cálidos de piel y sombras frías;
  • Nostalgic Blue: azul cinematográfico apagado con luces suaves;
  • Vintage Warm: espectro cálido de lámpara con énfasis en tonos ámbar;
  • Cyberpunk Neon: combinaciones neón contrastantes de púrpura, turquesa y violeta;
  • Bleach Bypass: colores desvaídos con microcontraste duro y medios tonos plateados;
  • Black & White: monocromo puro de alto contraste con rica gradación de grises.

Esquemas de iluminación de estudio (Lighting)

La iluminación se configura independientemente de la corrección de color:

  • Soft Natural: luz diurna difusa y suave desde una ventana sin transiciones de sombra duras;
  • Rim Light: luz contra-luz que separa claramente la silueta del héroe del fondo oscuro;
  • Volumetric (God Rays): rayos de luz volumétricos atravesando humo, niebla o persianas;
  • Studio Softbox: iluminación comercial calibrada sin caídas profundas en las sombras;
  • Harsh Sunlight: sol del mediodía con sombras profundas y nítidas y máxima contraste;
  • Moody Shadows: patrón dramático de luz y sombra (claroscuro) dominado por la penumbra.

6. Óptica y carácter del encuadre: Camera, Lens y Aperture

El modelo físico de la óptica determina la composición, la geometría y la sensación de profundidad espacial.

Sistemas de cámara (Camera)

  • Cinema Camera: trípode clásico de operador o rieles con estabilización perfecta;
  • Handheld: toma viva desde la mano con ligero temblor de operador que aporta autenticidad documental;
  • Drone View: toma aérea fluida con gran angular;
  • Action Cam: ultra gran angular dinámico con efecto de inmersión en el epicentro de los eventos.

Conjuntos de lentes (Lens)

  • Vintage Anamorphic: compresión horizontal, destellos ovalados, bordes suaves del encuadre;
  • 35mm Film: ángulo estándar reportaje con transmisión natural de la perspectiva;
  • 50mm Standard: ángulo de visión lo más cercano posible al ojo humano;
  • 85mm Portrait: geometría facial ideal sin distorsiones de perspectiva en nariz y pómulos;
  • Ultra-Wide 14mm: perspectiva dramática profunda con ligera extensión de los bordes;
  • Macro Lens: primerísimo plano con máxima detalle de texturas del producto.

Diafragma y profundidad de campo (Aperture)

  • f/1.2 — Shallow: profundidad de campo extremadamente reducida, bokeh cinematográfico marcado, fondo desenfocado hasta textura cremosa;
  • f/2.8 — Moderate: separación equilibrada de planos, objeto nítido y entorno suave;
  • f/8 — Medium: planos delantero y medio nítidos, óptimo para escenas grupales y de estudio;
  • f/16 — Deep Focus: máxima nitidez en todo el campo del encuadre desde el borde frontal hasta el horizonte.

7. Multi-References y Extend: expansión de la secuencia de video

La generación individual rara vez resuelve tareas complejas de producción. Para tomas difíciles, se emplean herramientas avanzadas de entrada y línea de tiempo.

Trabajo práctico con 50 referencias

Al enviar por lotes hasta 50 imágenes, se recomienda estructurar la pila de referencias por capas:

  1. Identidad (3–5 fotos): rostro del modelo desde diferentes ángulos con iluminación neutra;
  2. Producto (5–10 fotos): producto en primer plano, con etiqueta, sostenido en las manos, desde distintos ángulos;
  3. Entorno (5–10 fotos): referencias de interiores, paredes y texturas del entorno;
  4. Estilo / Color (2–3 fotos): fotograma de referencia objetivo para luz y corrección de color.

Esta separación garantiza que la red neuronal tome la apariencia del modelo, mientras que las texturas y los logotipos provienen directamente de las fotos del producto, sin mezclarlos entre sí.

Herramientas Forward Extend y Backward Extend

Si una toma resultó exitosa pero requiere desarrollo, no es necesario generar una alternativa desde cero:

  • Forward Extend: analiza el último fotograma del clip, conserva el vector de movimiento de la cámara y genera una continuación fluida hacia adelante en el tiempo;
  • Backward Extend: analiza el fotograma inicial y construye los 5–10 segundos previos, mostrando la historia previa de la escena.

El nuevo fragmento se forma dentro de la misma fase lumínica y geométrica del archivo de video original.


8. Ensamblaje paso a paso de la escena en Cinema Studio 4.0

Para lograr una calidad cinematográfica estable, se recomienda seguir un algoritmo estricto de configuración de parámetros.

Paso 1. Seleccionamos el Género

Defina el marco dramático de la escena. El género calibra inmediatamente la composición y la luz. Para una persecución dinámica elegimos Action, para una confesión íntima o diálogo — Drama.

Paso 2. Configuramos la óptica de filmación

Establecemos secuencialmente el tipo de cámara, lente, apertura y paleta.

Ejemplo de configuración lista:

text
Camera: 35mm Film Lens: Vintage Anamorphic Aperture: f/4 Moderate Colour Palette: Nostalgic Blue

En este mismo paso cargamos las referencias preparadas del héroe y del producto.

Paso 3. Seleccionamos el ritmo de montaje (Tempo)

  • Calm — para pausas emocionales y retratos;
  • Single Shot — para demostrar la interacción con el producto;
  • Dynamic — para videos promocionales y videoclips musicales;
  • Chaotic — para clímax explosivos.

Paso 4. Definimos el estado emocional del personaje

A través de Emotion Wheel vinculamos la emoción al marcador del personaje:

text
@character_name Joy

Paso 5. Formamos el prompt de texto

Dado que toda la ingeniería de filmación (cámara, lente, paleta, luz, tempo) ya está configurada mediante selectores independientes, el prompt de texto se libera del ruido técnico. En él se describe exclusivamente la acción física:

text
Молодая женщина в льняной рубашке делает глоток кофе у панорамного окна, смотрит на дождливую улицу и улыбается входящему другу.

Paso 6. Color Grading final

Después de generar el clip base, el editor integrado permite realizar el posprocesamiento:

  • Temperature: ajuste fino de la temperatura cálida/fría del fotograma;
  • Contrast & Saturation: equilibrio de contraste y saturación;
  • Sharpness & Film Grain: adición de textura de película o nitidez digital;
  • Highlights & Exposure: alineación de luces altas y sombras profundas.

9. Soul 2.0: creación y fijación de un personaje permanente

El principal problema de la generación de video con IA es el cambio de apariencia del héroe de una toma a otra. La tecnología Soul ID resuelve este problema mediante la creación de una huella digital de identidad.

La red neuronal entrena con un conjunto de datos y fija:

  • Arquitectura y antropometría facial;
  • Proporciones de pómulos, forma de nariz y rasgo de ojos;
  • Tono y microtextura de la piel;
  • Tipo, línea de crecimiento y color del cabello.

Después de guardar el Soul ID, el personaje puede colocarse en cualquier locación, cambiar la iluminación, la edad, el vestuario y los ángulos de cámara sin perder el reconocimiento.

Creación paso a paso del Soul ID

Navegue por la ruta en la interfaz: Character → Soul ID Character → Create

  1. Preparación del conjunto de datos: cargue entre 20 (umbral mínimo) y 70 fotografías de alta calidad de una sola persona;
  2. Requisitos para las referencias:
    • Ángulos variados (frontal, perfil, tres cuartos, mirada arriba/abajo);
    • Iluminación difusa estable y neutral;
    • Alta resolución sin artefactos de compresión;
    • Ausencia de filtros fuertes, máscaras y rostros ajenos en el cuadro;
  3. Entrenamiento del modelo: el sistema genera un token de ID único (por ejemplo, @alex_soul), que se guarda en la biblioteca del perfil.

Redacción de prompts para el personaje entrenado

Tras entrenar el Soul ID, desaparece la necesidad de describir detalladamente el color de ojos o la forma de la barbilla. Toda la apariencia se invoca mediante el token del sistema:

text
@alex_soul сидит за столиком в уличном парижском кафе, в темно-синем блейзере, читает утреннюю газету, мягкое солнце, малая глубина резкости, 9:16

Soul responde por la identidad anatómica, mientras que el prompt controla la ropa, la escenografía, el entorno y el movimiento.


10. Higgsfield API: generación autónoma sin interfaz

La REST API de Higgsfield permite integrar la generación de foto y video directamente en sistemas B2B propios, servicios web y scripts automatizados sin trabajo manual en la interfaz web. El catálogo de API reúne más de 50 modelos avanzados.

Catálogo de modelos de generación de video

  • Seedance 2.5: generación sincronizada de video, voz realista, lip-sync y ambiente sonoro;
  • Kling 3.0: física de movimiento cinematográfica de primer nivel y detalle;
  • Wan 3.0: generación de interacciones físicas complejas;
  • MiniMax H3: dinámica corporal humana de alta calidad;
  • LTX 2.5 Pro: generación ultrarrápida con alta densidad de píxeles;
  • PixVerse 6: renderizado estable del movimiento de objetos;
  • Grok Imagine Video: estilización creativa;
  • Higgsfield DoP: operador virtual especializado.

Catálogo de generadores de imágenes

  • Soul 2 & Soul Cinema: generación de retratos fotorrealistas y tomas cinematográficas con fijación facial;
  • Marketing Studio Image: fotografía de productos y embalajes;
  • Recraft 4.1, Ideogram 4.0, Qwen Image 3: generación de gráficos, tipografía y fotorrealismo.

Conexión a la API

  1. Registre una cuenta de desarrollador en console.higgsfield.ai;
  2. Recargue el saldo en dólares con tarjeta;
  3. Genere un token secreto de API;
  4. Envíe solicitudes HTTP mediante Python SDK, TypeScript SDK o cURL.

El formato de la API está estandarizado: cambiar entre Kling, Seedance o Wan se realiza modificando el parámetro "model_id".


11. Pipeline práctico de API: personaje → fotograma → video

La forma más económica y de mayor calidad para crear videos es mediante un flujo de trabajo multietapa, donde cada fase es ejecutada por el modelo especializado óptimo.

Paso 1. Generación del personaje base o producto

Generamos un fotograma estático del personaje mediante Soul 2 ($0.0032 por generación) o una toma de producto mediante Marketing Studio Image ($0.0059):

bash
curl -X POST https://api.higgsfield.ai/v1/images/generations -H "Authorization: Bearer $HIGGSFIELD_API_KEY" -H "Content-Type: application/json" -d '{ "model": "soul-2", "prompt": "Professional businesswoman in modern office, neutral expression, high detail", "aspect_ratio": "9:16" }'

Paso 2. Refinamiento del fotograma a nivel cinematográfico

La imagen obtenida se envía a Soul Cinema ($0.0032). El modelo establece iluminación cinematográfica, profundidad de campo y gradación de color (grading). Cuanto más preciso y de alta calidad sea el fotograma estático original, menos artefactos aparecerán durante la animación posterior.

Paso 3. Animación del fotograma en el modelo de video

El fotograma estático preparado se envía a Kling 3.0 o Seedance para generar el movimiento:

bash
curl -X POST https://api.higgsfield.ai/v1/videos/generations -H "Authorization: Bearer $HIGGSFIELD_API_KEY" -H "Content-Type: application/json" -d '{ "model": "kling-3.0", "image_url": "https://storage.higgsfield.ai/renders/step2_cinematic.jpg", "prompt": "Camera slowly tracks forward as the woman turns head and speaks, natural movement", "duration_seconds": 10 }'

Paso 4. Obtención del resultado final

La generación se ejecuta de forma asíncrona. La API devuelve un request_id, cuyo estado puede consultarse mediante polling o recibirse a través de un webhook. El video terminado se almacena en los servidores de Higgsfield durante un mínimo de 7 días, tras lo cual debe descargarse a su propio almacenamiento S3.


12. Precios y costos de uso de la API de Higgsfield

La API funciona bajo un modelo transparente de pago por uso (pay-as-you-go) con recarga previa del saldo. El costo de los videos se calcula por segundo y el de las imágenes por unidad.

Modelo / MotorTipo de facturaciónCosto unitario
Soul 2Imagen$0.0032 / generación
Soul CinemaImagen$0.0032 / generación
Marketing Studio ImageImagen$0.0059 / generación
Qwen Image 3Imagen$0.03 / generación
Recraft 4.1Imagen$0.035 / generación
Grok Imagine 2.0Imagen$0.06 / generación
Ideogram 4.0Imagen$0.06 / generación
Higgsfield DoPGeneración de video$0.125 / generación
Seedance 2.5Video con audio$0.0738 / segundo
Kling 3.0Video de alta calidad$0.112 / segundo
PixVerse 6Video$0.115 / segundo
MiniMax H3Video$0.13 / segundo
LTX 2.5 ProVideo$0.17 / segundo
Wan 3.0Video$0.20 / segundo
Grok Imagine Video 1.5Video$0.25 / segundo
Consejo

Cálculo del costo del ciclo completo de producción: Generar un retrato en Soul 2 ($0.0032) + refinamiento cinematográfico en Soul Cinema ($0.0032) + 10 segundos de video en Kling 3.0 ($1.12) tiene un costo total de $1.126 — ¡menos de $1.30 por una toma premium terminada de 10 segundos!

Reglas clave de facturación:

  • No hay cuotas ocultas ni suscripciones mensuales obligatorias;
  • El saldo de la API es independiente de la suscripción web en higgsfield.ai (los créditos no son transferibles);
  • Las generaciones fallidas o rechazadas no descuentan fondos;
  • El depósito es válido durante 1 año calendario desde el momento de la carga.

13. Matriz de selección de herramientas según tareas específicas

Dependiendo del formato del proyecto, elija la ruta de implementación óptima:

  • Cinema Studio 4.0: ideal cuando se requiere un clip autoral único con control manual máximo sobre dirección, cámara, óptica y emociones del personaje;
  • Soul 2.0 (Soul ID): necesario para videos narrativos y series donde el mismo personaje debe aparecer en diferentes locaciones sin deformación facial;
  • Higgsfield API: esencial para integrar la generación de video en aplicaciones móviles y web, crear servicios SaaS y renderizar automáticamente cientos de creativos;
  • Pipeline multimodelo (Soul 2 → Soul Cinema → Kling/Seedance): ofrece la mejor relación calidad/costo en la producción por lotes de contenido de video comercial.

14. Flujo de trabajo UGC listo: producción de publicidad desde una foto de producto usando Claude y Higgsfield

Existe un pipeline de producción abierto y listo que permite transformar una sola foto estática de un producto en un video UGC completo y orientado a conversión, utilizando la combinación de Claude Code / Codex y Higgsfield.

EtapaFase del pipelineArtefacto de salidaRol y optimización
1Product ProfileReferencia aislada del productoFijación de dimensiones, materiales y ergonomía
2Marketing BriefConcepto y storyboard de 3 tomasAprobación creativa antes de iniciar el render
3Base CharacterRetrato del personaje sin productoReferencia limpia de identidad facial
4StoryboardTríptico panorámico unificado 9:16Fijación sincronizada del actor y la geometría del producto
5Script & AudioTexto de 15 seg con fonéticaDirectiva "no subtitles" para un fotograma limpio
6Seedance RenderVideo + Voz + Lip-sync + AmbienteResolución 720p (67 créditos en lugar de 134 por 1080p)
7Post-productionAnuncio MP4 finalEdición local: música, énfasis de zoom, subtítulos

Flujo de trabajo integral de generación de anuncios de video UGC:

(1) Product Profile ➔ (2) Marketing Brief ➔ (3) Base Character ➔ (4) Storyboard (Tríptico) ➔ (5) Script & Audio ➔ (6) Seedance Render ➔ (7) Post-production

La entrada del flujo de trabajo consiste en una fotografía del producto, la descripción del público objetivo y un brief básico. El proceso consta de siete etapas secuenciales:

1. Product Profile

Claude realiza un análisis detallado del producto:

  • Registra dimensiones, forma geométrica y materiales;
  • Describe las características del empaque y la legibilidad de la etiqueta;
  • Determina la ergonomía real de uso (cómo se sostiene el objeto con los dedos, cómo se abre la tapa);
  • Crea una referencia limpia y aislada del producto sobre fondo transparente.

2. Marketing Brief

Se construye el marco conceptual del anuncio publicitario:

  • Definición del gancho principal (problema / disparador de la audiencia);
  • Estructura dramática para un spot de 15 segundos;
  • Guion gráfico (storyboard) dividido en tres tomas clave;
  • Parámetros técnicos de renderizado.

La aprobación del brief en una etapa temprana evita rehacer trabajos durante la costosa fase de generación de video.

3. Base Character

Se genera un retrato fotorealista de alta calidad del modelo — estrictamente sin el producto en las manos. Este retrato sirve como referencia de identidad base para fijar la apariencia del actor.

4. Storyboard

Se crea un tríptico panorámico único compuesto por tres cuadros verticales en formato 9:16:

  1. Selfie-hook: primer plano del protagonista enunciando el problema o una tesis intrigante;
  2. Macro-shot: superprimer plano de la interacción con el producto (aplicación de crema, pulsación de botón, sorbo de bebida);
  3. Call-to-Action: plano medio del protagonista satisfecho con la recomendación final.

A la IA se le proporcionan simultáneamente la foto del personaje y la referencia del producto, fijando la geometría de ambos objetos antes de iniciar la generación de video.

5. Script & Audio Design

Claude redacta un guion de voz en off de 15 segundos, dividido en 3 bloques temporizados.

  • Adaptación fonética: los nombres complejos de marcas se escriben transliterados tal como debe pronunciarlos el sintetizador de voz, para evitar distorsiones en la acentuación;
  • Directiva no subtitles: al prompt del generador de video se añade obligatoriamente la bandera para excluir subtítulos del sistema, evitando así la generación de ruido visual dentro de la red neuronal.

6. Generación de video en Seedance

En Seedance se transmiten simultáneamente tres referencias: el storyboard, el retrato del personaje, la foto del producto y el guion de audio listo. El modelo genera en una sola pasada:

  • Video realista con micro-movimientos orgánicos;
  • Voz natural del narrador;
  • Lip-sync preciso (sincronización labial con el audio);
  • Ruido ambiental espacial de fondo (ambience).

Se recomienda ejecutar el renderizado en resolución 720p: la generación cuesta solo 67 créditos, mientras que 1080p cuesta el doble sin ventajas visibles para redes sociales móviles.

7. Postproducción local final

La etapa final se ejecuta en la máquina local mediante un script automático de ffmpeg, sin consumir créditos de video:

  • Superposición de música de fondo licenciada;
  • Generación de subtítulos dinámicos cuadro a cuadro con resaltado de color en la palabra activa;
  • Adición de énfasis de zoom suaves y destellos en las uniones de edición.
Importante

Filosofía de producción eficiente con IA: Nunca exija a la red neuronal un anuncio publicitario terminado a partir de un único prompt abstracto. Divida el proceso en etapas preparatorias económicas (perfil del producto, aprobación del guion, generación del storyboard estático) y lance el modelo de video solo cuando todos los elementos originales hayan sido verificados y aprobados.

Esta guía es completamente gratuita. Si te ahorró una noche, puedes apoyar el crecimiento del proyecto.
Apoyar al autor