GEMINI OMNI PROMPTS

Blog / 6 min read · 2026-05-24

Modos de fallo de Gemini Omni: texto, manos, deriva multitiro y longitud de los prompts

Dónde falla Gemini Omni: el texto en pantalla se degrada, la articulación de las manos deriva, la identidad se rompe tras 4 tomas y los prompts largos pierden precisión.

failure-modes limitations gemini-omni-debugging

La cobertura del lanzamiento de Gemini Omni estuvo dominada por vídeos promocionales. Los modos de fallo reales están ocultos en las reseñas prácticas publicadas al segundo día por PixVerse, Atlas Cloud, digit.in y Seaart. Esta publicación reúne todas las limitaciones documentadas, con citas, para que puedas formular tus prompts de forma que las evites.

1. La representación de texto se degrada

El problema: Todo texto en pantalla, etiquetas, carteles, logotipos de marcas o subtítulos se degrada en las salidas de Omni. Las letras se emborronan, las tipografías se deforman y las palabras se vuelven ilegibles.

Por qué ocurre: Los modelos de vídeo de estilo difusión tratan el texto como una textura visual en vez de como contenido simbólico. Cada fotograma regenera el texto de manera independiente, lo que produce formas de letras incoherentes.

Cómo evitarlo:

Verificado por: reseña práctica de PixVerse — observado en textos en inglés, chino y japonés. No existía una solución específica por idioma en el lanzamiento.

2. La articulación de las manos deriva

El problema: Las manos sujetando objetos, escribiendo en teclados, haciendo gestos de lengua de signos o tocando instrumentos presentan fallos de articulación fina. Los dedos se fusionan, los objetos atraviesan las manos y los nudillos se doblan de forma incorrecta.

Por qué ocurre: Las manos tienen más grados de libertad y sufren oclusiones más frecuentes que otras partes del cuerpo. Los datos de entrenamiento están dominados por retratos estáticos y planos abiertos, no por trabajo de manos en primer plano.

Cómo evitarlo:

Verificado por: reseña de PixVerse y prueba de digit.in.

3. La consistencia del personaje en varias tomas se limita a unas 3-4 tomas

El problema: Usa @character_name con una imagen de referencia para mantener la identidad del personaje entre tomas. Funciona en las tomas 1-3. Para la toma 4-5, el rostro del personaje ya ha derivado de forma notable. A partir de la toma 6, es otra persona.

Puntuación documentada por Atlas Cloud: 3 de 5 en consistencia de personajes a lo largo de más de 4 tomas. Está por debajo de lo que suele requerir un trabajo de producción.

Cómo solucionarlo:

Verificado por: reseña de consistencia multiturno de Atlas Cloud.

4. El movimiento complejo produce artefactos de IA

El problema: Las acciones complejas —baile, gimnasia, movimientos deportivos o tocar instrumentos— muestran artefactos visibles de IA: extremidades adicionales, ángulos articulares imposibles y emborronamiento durante el movimiento rápido.

Hallazgo de digit.in: Las acciones simples (caminar, estar de pie, hablar) funcionan limpiamente. Las acciones complejas (bailar, gimnasia de cuerpo entero) fallan de forma sistemática.

Cómo evitarlo:

Verificado por: reseña de digit.in.

5. Los prompts de más de unas 50 palabras diluyen el enfoque

El problema: Los prompts más largos no te dan proporcionalmente más control. Más allá de unas 50 palabras, el modelo reparte la atención entre demasiados detalles y el resultado se vuelve genérico en lugar de más específico.

Hallazgo de Seaart: La calidad de salida alcanza una meseta entre 30 y 50 palabras y se degrada a partir de 60-70.

Cómo evitarlo:

Verificado por: análisis de Seaart.

6. Las referencias a marcas y propiedad intelectual activan filtros

El problema: Mencionar propiedad intelectual con copyright (“Marvel character”, “Studio Ghibli style”) o figuras públicas reales activa los filtros de contenido de Omni. A veces ocurre de forma silenciosa: la salida simplemente parece genérica en lugar de devolver un error.

Por qué ocurre: La capa de entrenamiento y filtrado de Google evita agresivamente las infracciones de propiedad intelectual. Omni no está ajustado específicamente para ninguna propiedad intelectual, y las salidas que se parecen demasiado se filtran o se suavizan.

Cómo evitarlo:

7. Límite estricto de 10 segundos (en realidad no es un fallo, sino una restricción)

Según la cobertura del lanzamiento de TechCrunch, Gemini Omni Flash no puede producir un solo clip de más de 10 segundos. Para producciones más largas, encadena clips en Google Flow en lugar de luchar contra ese límite.

Tabla resumen

Modo de falloSolución alternativaGravedad
Representación de textoEvita el texto en pantalla; añádelo en posproducción🔴 Grave
Articulación de manosEncuadra para ocultar las manos; evita primeros planos🟡 Moderada
Deriva entre tomasPlanifica en bloques de 3 tomas🟡 Moderada
Movimiento complejoUsa lenguaje de cámara lenta; recorta las partes exigentes🟡 Moderada
Longitud > 50 palabrasElimina adjetivos; divide mediante el patrón de activación🟢 Leve
Nombres de marcas/PIUsa descriptores del medio en su lugar🔴 Grave (riesgo de filtro)
Límite de 10 segundosEncadena clips en Google Flow🟢 Leve (por diseño)

Cómo usar esta lista

No trates estas limitaciones como errores que acabarán desapareciendo: son características estables de Gemini Omni Flash en el lanzamiento. Incorpóralas a tu estrategia de prompts desde el principio:

  1. Usa por defecto sin texto en pantalla, manos ocultas cuando sea posible y prompts de menos de 50 palabras.
  2. Planifica las producciones en bloques de 3 tomas con @character_name + bloqueos explícitos.
  3. Sustituye la propiedad intelectual con nombre por descriptores del medio.
  4. Para narrativas más largas, une los clips en Flow; no luches contra el límite de 10 segundos.

Relacionado