Saltar al contenido principal
Modelo

Veo

Veo es el modelo de texto a video de Google DeepMind, que produce clips de video de alta calidad en 1080p a partir de descripciones de texto, con calidad cinematográfica y una mejor comprensión de la física.

18 de junio de 2026

Veo - AI image and video glossary preview from kublaro (veo)
Veo - AI image and video glossary preview from kublaro (veo)

Veo es el modelo de IA de texto a video de Google DeepMind, capaz de generar clips de video de alta calidad en 1080p a partir de prompts de texto, con una sólida coherencia cinematográfica y comprensión de la física.

Cómo funciona

Veo utiliza una arquitectura de modelo de difusión latente entrenada con grandes cantidades de datos de video. Interpreta los prompts de texto para generar secuencias de video fotograma a fotograma, prestando atención a la consistencia temporal, la simulación de la física y la composición cinematográfica. La experiencia de Google en IA multimodal —combinando la comprensión del lenguaje con la generación visual— le otorga a Veo una sólida interpretación de prompts y construcción de escenas.

Por qué es importante

Veo representa la entrada de Google en la carrera de la generación de video con IA, junto a Sora de OpenAI y otros modelos. Su énfasis en la comprensión de la física —cómo deberían moverse, interactuar y responder a las fuerzas los objetos— aborda una de las debilidades clave de los primeros modelos de video con IA, en los que una física imposible rompía la inmersión.

Características clave

  • Salida en 1080p — resolución full HD adecuada para web y redes sociales.
  • Estilos cinematográficos — admite diversos estilos de cine, movimientos de cámara y configuraciones de iluminación mediante prompts.
  • Movimiento consciente de la física — mejor comprensión de cómo se mueven e interactúan los objetos físicos.
  • Mayores duraciones — clips más largos que los primeros modelos de video con IA.

En kublaro

kublaro monitorea el panorama del video con IA y selecciona los modelos que mejor se adaptan a cada tarea de generación. Si bien Veo y Sora son modelos destacados, el pipeline de kublaro utiliza modelos disponibles y probados como Kling 3, que entregan excelentes resultados para las duraciones de clips y los estilos que los creadores necesitan hoy.

Términos relacionados

Preguntas frecuentes

¿Qué es Google Veo?+

Veo es el modelo de IA de texto a video de Google DeepMind. Genera clips de video en 1080p a partir de prompts de texto y es reconocido por su calidad cinematográfica, su mejor comprensión de la física y su compatibilidad con diversos estilos visuales y cinematográficos.

¿Cómo se compara Veo con Sora?+

Tanto Veo como Sora son modelos de texto a video de alta calidad. Veo pone énfasis en la comprensión de la física y en la salida en 1080p, mientras que Sora se destaca por la mayor duración de sus clips. kublaro utiliza los modelos que mejor se adaptan para entregar video de calidad, sin importar qué modelo específico lidere en cada momento.

¿Qué resolución genera Veo?+

Veo genera video en resolución 1080p (1920×1080), que es adecuada para la mayoría del contenido web y de redes sociales. Las resoluciones más altas pueden requerir un reescalado.

Hazlo con kublaro

Describe cualquier cosa y genera imágenes increíbles en segundos; después dales movimiento con los mejores modelos de video con IA.

Relacionado

Siguientes pasos útiles