Cuatro modelos de video generativo, la misma foto de partida y el mismo prompt: una persona con brackets riéndose a carcajadas. El detalle que casi todos rompen — y el test que muestra cuál lo aguanta.
✅ El mejor — brackets estables en todos los frames, identidad facial intacta.
✅ Pasa — brackets bien; tiende a agachar la cabeza al reír (se corrige por prompt).
✅ Pasa — brackets bien y el movimiento más expresivo del test.
⚠️ No pasa — los brackets se emborronan en el pico de la risa; piel saturada.
Los generadores de video a partir de imagen mejoraron muchísimo — hasta que les pedís algo con detalle fino sobre una zona que se mueve rápido. La boca es el peor caso: al reír, los dientes aparecen y desaparecen, y el modelo tiene que "inventar" el interior de la boca en cada frame. Con brackets es todavía más difícil: una estructura metálica precisa, con geometría propia, sobre cada diente. El resultado típico: brackets que se funden en una mancha gris, dientes que cambian de forma entre frames, sonrisas que "flotan". En una pieza donde la sonrisa es el producto, un solo frame roto mata el clip.
Esto salió de un caso real: una campaña para una marca de ortodoncia donde cada plano hero es una persona con brackets riéndose. No había benchmark público que midiera esto — así que lo medimos.
Una sola variable: el modelo. La misma foto de partida (generada con Nano Banana Pro / Gemini, dirigida para que la carcajada con brackets sea la protagonista), el mismo prompt de movimiento, la misma resolución (720p, 9:16), los cuatro modelos corridos por API en paralelo.
Los cuatro clips de arriba son el resultado crudo, sin edición ni cherry-picking: primera generación de cada modelo. Costo total del test: menos de USD 2,50.
Dos decisiones importan acá: cámara clavada (si no la declarás, los modelos meten un push-in que arruina el plano) y los brackets declarados como inmutables — decirle al modelo qué NO puede cambiar funciona mejor que esperar que lo infiera.
Completely static camera, locked off — no zoom, no pan, no push-in. All the movement comes from the people, never from the camera. The woman at the center keeps laughing naturally: her laugh peaks, softens into a wide genuine smile, then bursts into laughter again. She wears tidy METAL BRACES; the braces must stay clearly visible, stable and unchanged on her teeth throughout — no morphing teeth, no extra teeth, the mouth keeps its exact real anatomy in every frame. Her friends keep chatting and laughing subtly beside her. Warm indoor party light stays constant, realistic smartphone-video look, no slow motion.
Un video puede "verse bien" reproducido y esconder frames rotos. El QA real es objetivo: se extraen los frames con ffmpeg (6 por segundo), se recorta la zona de la boca y se arma una grilla — y ahí no hay dónde esconderse. Esto es lo que vio el ojo en cada modelo:
| Modelo | Costo relativo | Veredicto para boca/brackets |
|---|---|---|
| Veo 3.1 | ≈ 2× el barato | El elegido para planos hero. Brackets estables, identidad intacta, hasta el fondo queda legible. |
| Seedance 2.0 | ≈ 2× | Pasa. Expresivo; hay que dirigirle la cara («face toward the camera») porque tiende a agachar la cabeza. |
| Kling O3 Pro | ≈ 2,3× | Pasa. El movimiento más vivo del test — alternativa cuando el plano pide dinamismo. |
| Kling 2.5 Turbo | 1× (el barato) | No pasa para primeros planos. Sirve para planos donde la boca no es protagonista. |