Existe una regla que todo el mundo en vídeo con IA repite como escritura: el texto no sobrevive a la generación. Las pantallas se vuelven sopa de letras, los carteles se derriten en jeroglíficos, y cualquier palabra más larga que una preposición se convierte en la escena de un crimen tipográfico. Así que el apaño del sector se volvió dogma: nunca generes texto, compón siempre en posproducción.
Hicimos una prueba controlada en el laboratorio y derribamos esa regla. No con un prompt ingenioso. Con un cambio de canal.
Por qué la IA genera texto equivocado, para empezar
Un motor de vídeo no escribe. Pinta. Cuando escribes una pantalla de móvil mostrando la palabra AMANECER en sin serifa negrita, el motor no compone la palabra. Alucina la estadística visual del texto: trazo, espaciado, el ritmo del dibujo de letra. A veces se acerca. Normalmente produce algo que parece una palabra hasta que lo lees.
Los acentos lo empeoran todo. Caracteres acentuados, cedillas, tildes, cualquier cosa fuera del ASCII más simple, y la tasa de fallo sube hacia la certeza. Si tu trabajo atraviesa idiomas, y el nuestro lo atraviesa, São Paulo ya es una prueba de estrés por sí solo, hacer prompt de texto es una lotería que pierdes.
El error no es del motor. El error es el canal. El prompt es descripción, y la tipografía no es algo que se describe. Es algo que se muestra.
El método de la referencia para texto en vídeo con IA
Aquí está lo que probamos en Seedance 2.5. En lugar de describir el texto, lo construimos.
Paso uno: crea el texto terminado como imagen. Tipografía de verdad, kerning de verdad, acentos de verdad, compuesto en una herramienta de imagen o en un modelo de imagen que maneje bien el texto, colocado en contexto: letras en una pantalla dentro de la escena, una etiqueta en un producto, un rótulo en un monitor.
Paso dos: alimenta esa imagen al motor de vídeo como referencia, junto al start frame que define el mundo.
Paso tres: haz prompt del movimiento, no del texto. El prompt nunca menciona qué dicen las palabras. La referencia ya las lleva.
El resultado en nuestras rondas controladas: la tipografía sobrevivió. Los caracteres acentuados sobrevivieron. El motor trató la letra como trata un producto o un rostro alimentado como referencia: como una identidad a preservar, no como una textura a reinventar. En una prueba, una referencia con texto acentuado sostuvo el acento durante todo el plano generado, algo que ninguna redacción de prompt había logrado en decenas de intentos.
Una imagen de referencia lleva tipografía mejor de lo que ningún prompt la va a llevar jamás. El texto puede pasar por imagen a vídeo. Simplemente no puede pasar por el prompt.
La referencia ancla el objeto, y el texto es un objeto
Esto funciona por un mecanismo más profundo que mapeamos en pruebas separadas. En imagen a vídeo, la imagen de referencia ancla el objeto: su identidad, sus detalles, su verdad de superficie. El start frame ancla el encuadre: mundo, luz, composición. El prompt dirige movimiento e intención.
Una vez que ves el texto como objeto en lugar de como lenguaje, el método es obvio. Una palabra compuesta en tipo es una forma con identidad, exactamente como un frasco o un logo. Aliméntala por el canal que protege la identidad. El motor deja de intentar escribir y empieza a intentar preservar, y preservar es lo que los motores hacen bien de verdad.
Dónde cambia esto la producción
Para un estudio, esto no es un truco de fiesta. Reestructura el pipeline.
Planos de interfaz. Pantalla de móvil, panel, tótem dentro de una escena: construye la pantalla como imagen terminada, úsala como referencia, y genera la escena a su alrededor en movimiento. Se acabó componer en posproducción una pantalla plana sobre una perspectiva en movimiento.
Cartelería y entorno. El nombre de una tienda, un póster en una pared, un letrero de neón: compón el tipo en la imagen fija, deja que la referencia lo sostenga mientras la cámara se mueve.
Trabajo multilingüe. Los acentos dejan de ser una categoría de riesgo. El acento vive en los píxeles de la referencia, y los píxeles no cometen faltas de ortografía.
Momentos de título dentro de la ficción. Cuando una palabra necesita existir dentro del mundo de la película en lugar de encima de él, el método de la referencia es hoy el único camino fiable.
Lo que no sustituye: los rótulos, los subtítulos y el texto legal siguen perteneciendo al montaje, donde los controlas fotograma a fotograma. El método de la referencia es para el texto que vive dentro de la escena, no para el texto que vive encima del vídeo.
La disciplina que hace que se sostenga
Tres notas de dirección de nuestras sesiones de laboratorio, porque el método falla cuando se trata a la ligera.
Termina el tipo antes de generar. La referencia tiene que llevar la letra final, el peso final, el color final. El motor preserva lo que ve; no va a mejorar una referencia descuidada.
Mantén el texto lo bastante grande en el encuadre. Un tipo minúsculo en un plano general se degrada. Si la palabra importa, dale espacio o planifica un plano más cerrado para ella.
No repitas el texto en el prompt. Describir las palabras invita al motor a repintarlas. Deja que la referencia hable sola y gasta tu prompt en cámara y movimiento.
Esto es el método Sentimagem aplicado a un problema testarudo, dirección por encima de generación: probar qué hace el motor con el texto en lugar de confiar en la regla recibida, localizar dónde vive de verdad el fallo, en el canal y no en la capacidad, y convertir el montaje que funciona en un estándar.
La tipografía sobrevive a la generación con IA cuando entra como imagen de referencia con la letra terminada, porque la referencia es un canal de preservación mientras que el prompt es solo descripción.
