Volver al Blog
Hardware 24 de abril de 2026 5 min read

Google Presenta los TPU 8t y 8i en Cloud Next — Diseñados para la Era de los Agentes de IA

En Google Cloud Next 2026, Google anunció dos TPU de octava generación con arquitecturas diferenciadas: TPU 8t para entrenamiento a escala de superpod de 9.600 chips, y TPU 8i para inferencia de agentes con baja latencia. Ambos chips fueron codiseñados con Google DeepMind.

Google Presenta los TPU 8t y 8i en Cloud Next — Diseñados para la Era de los Agentes de IA

Google dividió su línea de TPU en dos. En Google Cloud Next 2026 en Las Vegas, la compañía anunció la octava generación de sus Tensor Processing Units como dos chips distintos diseñados para cargas de trabajo divergentes: TPU 8t para entrenamiento y TPU 8i para inferencia. Ambos fueron codiseñados con Google DeepMind y están pensados específicamente para la era de los agentes de IA.

Esa división es el titular. Cada generación anterior de TPU era una única arquitectura de chip que debía hacer ambas cosas. La octava generación reconoce que el entrenamiento y la inferencia tienen requisitos fundamentalmente distintos, y que un chip óptimo para uno es un compromiso en el otro.

TPU 8t — entrenamiento a escala de superpod

El TPU 8t escala hasta 9.600 chips en un único superpod, compartiendo 2 petabytes de memoria de alto ancho de banda en todo el pod. Google afirma un rendimiento de cómputo casi 3 veces superior al de Ironwood (la generación anterior) y el doble de rendimiento por vatio. El impacto declarado: los ciclos de desarrollo de modelos de frontera se reducen de meses a semanas. Ese es el número que importa para la velocidad de investigación de IA de Google y para los clientes cloud que entrenan grandes modelos.

TPU 8i — inferencia para agentes concurrentes

El TPU 8i está construido para throughput y latencia, no para cómputo de entrenamiento bruto. Un único pod conecta 1.152 chips con 3 veces más SRAM en chip que Ironwood. La densidad de SRAM importa para los tamaños de caché KV: cuanto mayor es la caché, más larga es la ventana de contexto que se puede servir sin presión de memoria. Google apunta explícitamente a cargas de trabajo que necesitan ejecutar millones de agentes concurrentes. Con la capa de agentes de los productos de IA en plena explosión en 2026, esa es la apuesta correcta.

La división arquitectónica señala algo importante sobre hacia dónde cree Google que va la infraestructura de IA. El entrenamiento se está convirtiendo en una carga de trabajo más concentrada y programada: menos ejecuciones masivas, más pipelines orquestados. La inferencia, por el contrario, es cada vez más variable, más sensible a la latencia y crecientemente multimodal. Un solo chip no puede servir a ambos de forma óptima.

En cuanto al posicionamiento competitivo: el Blackwell Ultra de NVIDIA gestiona tanto entrenamiento como inferencia con el mismo die, apoyándose en la escala y la interconexión para ganar flexibilidad. El enfoque de dos chips de Google es una diferenciación deliberada: la especialización supera al generalismo en la frontera.

Los otros anuncios de Cloud Next —Workspace Intelligence, integraciones expandidas de Gemini 2.5 y optimización de inferencia de IA en GKE— fueron significativos, pero la división TPU 8t/8i es el movimiento estratégico. Google está construyendo su propio foso de silicio contra un futuro en el que el poder de fijación de precios de NVIDIA sea la mayor partida de gastos en el P&L de cada empresa de IA.

La disponibilidad no se anunció en el keynote. Se espera que comience un programa de acceso anticipado para los clientes de Google Cloud que ya ejecutan cargas de trabajo de IA a gran escala.

Google TPU chips IA nube hardware