Blog / 6 min read · 2026-05-24
Modos de fallo de Gemini Omni: texto, manos, deriva multitiro y longitud de los prompts
Dónde falla Gemini Omni: el texto en pantalla se degrada, la articulación de las manos deriva, la identidad se rompe tras 4 tomas y los prompts largos pierden precisión.
La cobertura del lanzamiento de Gemini Omni estuvo dominada por vídeos promocionales. Los modos de fallo reales están ocultos en las reseñas prácticas publicadas al segundo día por PixVerse, Atlas Cloud, digit.in y Seaart. Esta publicación reúne todas las limitaciones documentadas, con citas, para que puedas formular tus prompts de forma que las evites.
1. La representación de texto se degrada
El problema: Todo texto en pantalla, etiquetas, carteles, logotipos de marcas o subtítulos se degrada en las salidas de Omni. Las letras se emborronan, las tipografías se deforman y las palabras se vuelven ilegibles.
Por qué ocurre: Los modelos de vídeo de estilo difusión tratan el texto como una textura visual en vez de como contenido simbólico. Cada fotograma regenera el texto de manera independiente, lo que produce formas de letras incoherentes.
Cómo evitarlo:
- No menciones superposiciones de texto en tu prompt.
- Para tomas de productos, usa “unbranded packaging” o “blurred logo in background”.
- Para carteles y escaparates, usa “stylized signage with abstract symbols” en lugar de palabras concretas.
- Si debes incluir texto, prevé añadirlo en posproducción (no desde Omni).
Verificado por: reseña práctica de PixVerse — observado en textos en inglés, chino y japonés. No existía una solución específica por idioma en el lanzamiento.
2. La articulación de las manos deriva
El problema: Las manos sujetando objetos, escribiendo en teclados, haciendo gestos de lengua de signos o tocando instrumentos presentan fallos de articulación fina. Los dedos se fusionan, los objetos atraviesan las manos y los nudillos se doblan de forma incorrecta.
Por qué ocurre: Las manos tienen más grados de libertad y sufren oclusiones más frecuentes que otras partes del cuerpo. Los datos de entrenamiento están dominados por retratos estáticos y planos abiertos, no por trabajo de manos en primer plano.
Cómo evitarlo:
- Compón el plano para ocultar las manos cuando sea posible. Plano de seguimiento lateral; manos detrás de la espalda; recorte a la altura de la muñeca.
- No pidas primeros planos de trabajo manual. “Close-up of fingers typing” casi siempre falla.
- Para instrumentos musicales: usa “playing the piano” sin especificar la posición de los dedos; deja que Omni interpole con libertad.
- Acepta cierta imperfección. Las manos a más de 1,5 metros de la cámara suelen funcionar; las que ocupan más del 30 % del encuadre suelen fallar.
Verificado por: reseña de PixVerse y prueba de digit.in.
3. La consistencia del personaje en varias tomas se limita a unas 3-4 tomas
El problema: Usa @character_name con una imagen de referencia para mantener la identidad del personaje entre tomas. Funciona en las tomas 1-3. Para la toma 4-5, el rostro del personaje ya ha derivado de forma notable. A partir de la toma 6, es otra persona.
Puntuación documentada por Atlas Cloud: 3 de 5 en consistencia de personajes a lo largo de más de 4 tomas. Está por debajo de lo que suele requerir un trabajo de producción.
Cómo solucionarlo:
- Planifica las producciones en bloques de 3 tomas. Después de 3 tomas, trata el siguiente conjunto como una secuencia nueva con el personaje anclado de nuevo.
- Usa siempre
@character_namecon una imagen de referencia adjunta. No dependas solo de descripciones del personaje en el prompt. - Incluye una instrucción de bloqueo como “keep [character_name]‘s face, hair, and outfit identical” en cada prompt de toma dentro del bloque.
- Acepta regeneraciones de varias tomas. A veces necesitas entre 3 y 5 generaciones del mismo prompt para lograr una coincidencia facial aceptable.
Verificado por: reseña de consistencia multiturno de Atlas Cloud.
4. El movimiento complejo produce artefactos de IA
El problema: Las acciones complejas —baile, gimnasia, movimientos deportivos o tocar instrumentos— muestran artefactos visibles de IA: extremidades adicionales, ángulos articulares imposibles y emborronamiento durante el movimiento rápido.
Hallazgo de digit.in: Las acciones simples (caminar, estar de pie, hablar) funcionan limpiamente. Las acciones complejas (bailar, gimnasia de cuerpo entero) fallan de forma sistemática.
Cómo evitarlo:
- Prefiere acciones sencillas para el sujeto cuando la calidad de producción sea importante.
- Para tomas de «acción compleja», usa lenguaje de cámara lenta (“slow-motion ballet pose mid-spin”), que limita al modelo a menos fotogramas de movimiento intermedio.
- Encuadra para recortar las partes más exigentes —muestra la parte superior del cuerpo de un bailarín, no el cuerpo entero durante un salto.
Verificado por: reseña de digit.in.
5. Los prompts de más de unas 50 palabras diluyen el enfoque
El problema: Los prompts más largos no te dan proporcionalmente más control. Más allá de unas 50 palabras, el modelo reparte la atención entre demasiados detalles y el resultado se vuelve genérico en lugar de más específico.
Hallazgo de Seaart: La calidad de salida alcanza una meseta entre 30 y 50 palabras y se degrada a partir de 60-70.
Cómo evitarlo:
- Apunta a prompts de 30-50 palabras. Más largo significa menos, no más.
- Si necesitas más precisión, usa el patrón de activación para dividir los cambios de estado en un prompt base y un turno posterior.
- Elimina adjetivos sin piedad. “Stunning beautiful epic cinematic” son seis palabras decorativas; sustitúyelas por una referencia de estilo concreta (“35mm film, warm tungsten”).
Verificado por: análisis de Seaart.
6. Las referencias a marcas y propiedad intelectual activan filtros
El problema: Mencionar propiedad intelectual con copyright (“Marvel character”, “Studio Ghibli style”) o figuras públicas reales activa los filtros de contenido de Omni. A veces ocurre de forma silenciosa: la salida simplemente parece genérica en lugar de devolver un error.
Por qué ocurre: La capa de entrenamiento y filtrado de Google evita agresivamente las infracciones de propiedad intelectual. Omni no está ajustado específicamente para ninguna propiedad intelectual, y las salidas que se parecen demasiado se filtran o se suavizan.
Cómo evitarlo:
- Usa descriptores estilísticos en lugar de propiedad intelectual con nombre. “Hand-painted watercolor animation”, no “Ghibli style”. “3D animated character with soft rim lighting”, no “Pixar style”.
- No nombres a personas vivas en los prompts. Incluso las referencias indirectas pueden degradar la calidad de salida.
- Para la función Avatar: usa solo tu propio
@username. Los intentos de clonar otros rostros fallan en el paso de verificación de identidad.
7. Límite estricto de 10 segundos (en realidad no es un fallo, sino una restricción)
Según la cobertura del lanzamiento de TechCrunch, Gemini Omni Flash no puede producir un solo clip de más de 10 segundos. Para producciones más largas, encadena clips en Google Flow en lugar de luchar contra ese límite.
Tabla resumen
| Modo de fallo | Solución alternativa | Gravedad |
|---|---|---|
| Representación de texto | Evita el texto en pantalla; añádelo en posproducción | 🔴 Grave |
| Articulación de manos | Encuadra para ocultar las manos; evita primeros planos | 🟡 Moderada |
| Deriva entre tomas | Planifica en bloques de 3 tomas | 🟡 Moderada |
| Movimiento complejo | Usa lenguaje de cámara lenta; recorta las partes exigentes | 🟡 Moderada |
| Longitud > 50 palabras | Elimina adjetivos; divide mediante el patrón de activación | 🟢 Leve |
| Nombres de marcas/PI | Usa descriptores del medio en su lugar | 🔴 Grave (riesgo de filtro) |
| Límite de 10 segundos | Encadena clips en Google Flow | 🟢 Leve (por diseño) |
Cómo usar esta lista
No trates estas limitaciones como errores que acabarán desapareciendo: son características estables de Gemini Omni Flash en el lanzamiento. Incorpóralas a tu estrategia de prompts desde el principio:
- Usa por defecto sin texto en pantalla, manos ocultas cuando sea posible y prompts de menos de 50 palabras.
- Planifica las producciones en bloques de 3 tomas con
@character_name+ bloqueos explícitos. - Sustituye la propiedad intelectual con nombre por descriptores del medio.
- Para narrativas más largas, une los clips en Flow; no luches contra el límite de 10 segundos.
Relacionado
- Guía completa — cubre todo esto en contexto
- Vocabulario de cámara — los verbos que debes usar dentro de estas restricciones
- Bloqueo «Keep X identical» — disciplina para producciones de varias tomas
- Glosario — entrada formal para cada modo de fallo
Sources