























Para entender la escala de Google en la era de la inteligencia artificial basta una de las cifras con las que Sundar Pichai, presidente de la compañía, ha dado el pistoletazo de salida a Google I/O, la conferencia anual de la empresa para desarrolladores de todo el mundo. Las distintas versiones de Gemini procesan ahora más de 3.200 billones de tokens al mes, siete veces más que hace un año y casi 330 veces más que hace dos. La aplicación Gemini ha superado ya los 900 millones de usuarios mensuales, más del doble que en la edición anterior del evento y la compañía gastará este año alrededor de 190.000 millones de dólares en infraestructura, seis veces lo que invertía en 2022.
La feria, que como otros años transcurre en el auditorio Shoreline, cerca de la sede de la empresa en Mountin View, se centrará este año en explicar la transición de Google de una IA que responde a preguntas a una IA que ejecuta tareas. Pichai lo ha llamado "la era agéntica de Gemini" y arranca con nuevos modelos y herramientas que ponen a Google por delante de la competencia (fundamentalmente Anthropic y OpenAI) en varios frentes.
GEMINI 3.5 FLASH
El anuncio que más interés ha despertado es el de Gemini 3.5 Flash, el nuevo modelo por defecto de la compañía. Google asegura que supera a su anterior buque insignia, Gemini 3.1 Pro, en casi todas las pruebas relevantes de programación y razonamiento, incluyendo Terminal-Bench 2.1, donde alcanza un 76,2%, y MCP Atlas, donde llega al 83,6%.
Lo más interesante, no obstante, es la combinación de potencia y velocidad. Gemini 3.5 Flash genera tokens cuatro veces más rápido que los modelos punteros de la competencia y a menos de la mitad de coste. En modelos de inteligencia artificial, un token equivale más o menos a una palabra. Koray Kavukcuoglu, director de tecnología de Google DeepMind, ha explicado también que Google ha creado una versión aún más optimizada doce veces más rápida y con la misma calidad dentro de Antigravity, la plataforma de desarrollo agéntico de Google, equivalente a Claude Code o Codex.
En términos prácticos Pichai sostiene que las grandes empresas que actualmente procesan en torno a un billón de tokens al día podrían ahorrar más de 1.000 millones de dólares anuales si trasladaran el 80% de sus cargas de trabajo a Flash. Es un argumento dirigido directamente a quienes están viendo cómo sus facturas de inferencia se disparan con OpenAI o Anthropic. Aunque Flash no es tan potente como los modelos más avanzados de estas empresas, no esta muy lejos ya. Gemini 3.5 Pro, la versión de gama alta orientada a tareas que requieren razonamiento profundo, llegará el mes que viene.
SPARK, EL AGENTE PERSONAL
La otra estrella de la presentación ha sido Gemini Spark, un agente de IA personal. Funciona en máquinas virtuales dedicadas dentro de Google Cloud, está siempre activo (no requiere tener el portátil o el teléfono encendido) y puede ejecutar tareas complejas de varios pasos en segundo plano.
El agente puede analizar extractos mensuales de tarjetas de crédito para detectar suscripciones ocultas, revisar el correo electrónico del colegio de los hijos y enviar un resumen diario con las fechas clave, o sintetizar notas de reuniones repartidas entre correos y chats para generar un documento pulido en Google Docs.
Spark se integrará inicialmente con servicios propios de Google como Gmail, Docs, Sheets, Workspace y a lo largo del verano se conectará con herramientas de terceros mediante el protocolo MCP, el estándar de la industria. En verano también empezará a funcionar dentro de Chrome como un navegador agéntico, capaz de actuar sobre cualquier sitio web.
Google ha sido especialmente cuidadosa con el apartado de seguridad. Spark requiere aprobación explícita del usuario antes de cualquier acción de alto riesgo, y la compañía ha anunciado Agent Payments Protocol, un sistema que permite definir límites estrictos (marcas aprobadas, topes de gasto o comercios preferidos) antes de que un agente pueda gastar dinero en nombre del usuario. La beta llegará la próxima semana a suscriptores de Google AI Ultra en Estados Unidos.
OMNI Y EL VIDEO
Junto a Flash y Spark, Google ha presentado también Gemini Omni, un nuevo modelo multimodal que combina la inteligencia de Gemini con capacidades generativas. El primer formato de salida es el vídeo, pero la compañía promete que con el tiempo se extenderá también a imágenes y texto generados desde cualquier tipo de entrada. La versión disponible desde hoy se llama Gemini Omni Flash y se puede probar en la aplicación Gemini, en Google Flow y en YouTube Shorts.
Los modelos Nano Banana, presentados hace meses, han generado ya más de 50.000 millones de imágenes desde su lanzamiento, lo que da una idea del apetito por este tipo de herramientas. Omni es en cierta forma lo mismo, pero para video. Google estrenará además Google Pics, una herramienta de creación y edición de imágenes que trata cada elemento como un objeto editable individual.
LA BÚSQUEDA, REINVENTADA
El producto más importante, el motor de búsqueda de Google, también se reinventa en esta era. El Modo IA en el buscador, que hace un año aún no existía, ha alcanzado ya los mil millones de usuarios mensuales activos.
Este verano el buscador incorporará agentes de información que funcionarán en segundo plano para encontrar datos en el momento preciso, y paneles personalizados que actuarán como miniaplicaciones desarrolladas a medida para tareas concretas. Llegarán primero a suscriptores de Google AI Pro y Ultra en EE.UU. pero la idea es expandirlo rápidamente a todo el mundo.
Funciones similares también llegarán a otros productos. Pregunta a YouTube, por ejemplo, localiza el fragmento exacto de un vídeo que responde a una pregunta concreta y se lanzará públicamente este verano. Pregunta a Maps, parte de la mayor actualización del servicio en una década, permite consultas complejas y conversacionales sobre lugares. Y Docs Live convierte el dictado por voz en documentos completos editables, y también estará disponible para suscriptores de Gemini en los próximos meses.
INFRAESTRUCTURA
Toda esta cascada de productos dependerá de una inversión sin precedentes. Google planea gastar 190.000 millones de dólares en 2026, seis veces más de lo que gastó en 2022. Una parte sustancial se destinará a chips propios. Google acaba de presentar la octava generación de sus TPU, divididas por primera vez en dos arquitecturas distintas. La TPU 8t está optimizada para entrenamiento y triplica la capacidad de cálculo bruto de la generación anterior; la TPU 8i está pensada para inferencia (la ejecución de los modelos de IA), donde la latencia es crítica. Ambas duplican el rendimiento por vatio respecto a sus predecesores.
En la conferencia inaugural también hubo espacio para futuros productos, aunque algunas de las novedades, como los nuevos ordenadores Googlebook, se anunciaron días antes. Las gafas inteligentes con Android XR tuvieron unos minutos sobre el escenario. Creadas en colaboración con Warby Parker, Gentle Monster y Samsung, llegarán al mercado en otoño, primero en una versión solo con audio y posteriormente con pantalla.
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。