AMD compra Taalas, la startup que graba modelos de IA directamente en el silicio
AMD firmó un acuerdo definitivo para adquirir Taalas, con sede en Toronto, que cablea los pesos del modelo en silicio de 6 nm en lugar de leerlos desde HBM. Taalas asegura superar en tokens por segundo y por usuario a las H200 y B200 de Nvidia.
AMD adquiere Taalas, una startup de Toronto que fabrica chips de inferencia con los pesos del modelo grabados físicamente en el silicio. No se revelaron los términos económicos. La operación debería cerrarse en el cuarto trimestre de 2026, sujeta a aprobación regulatoria.
Taalas se fundó en 2023 y ha levantado 219 millones de dólares. Su propuesta invierte el diseño clásico de un acelerador. Una GPU es de propósito general: los pesos viven en HBM, se transmiten a las unidades de cómputo y el ancho de banda de memoria entre ambos es el muro contra el que lleva chocando la inferencia desde hace tres años. Taalas esquiva el muro eliminando la transferencia. El modelo es el chip. Los pesos se hornean en el tejido de silicio durante la fabricación, así que no hay lectura de pesos y el dataflow queda fijado a una única arquitectura.
El primer chip de Taalas ejecutaba una versión de Llama 3.1. Se fabrica en el nodo de 6 nm de TSMC —deliberadamente no puntero, porque al eliminar la jerarquía de memoria dejas de necesitar el nodo más denso disponible para alcanzar tu objetivo de latencia. Taalas afirma que sus chips generan más tokens por segundo y por usuario que las H200 y B200 de Nvidia.
Ese matiz de “por usuario” es la parte honesta de la afirmación y conviene leerla con cuidado. El silicio cableado gana en latencia de flujo único y en tokens por julio para el modelo concreto que lo inspiró. Pierde en todo lo demás: no puedes hacerle fine-tuning, no puedes cambiar el checkpoint, y un ciclo de tapeout se mide en meses mientras los lanzamientos de modelos frontera se miden en semanas. La economía solo cuadra con un modelo que tenga tráfico sostenido y masivo suficiente para amortizar un juego de máscaras. En 2026, esa lista crece.
AMD dice que integrará la tecnología de Taalas en su hoja de ruta de aceleradores y construirá productos a nivel de sistema junto a las GPU Instinct, los procesadores EPYC, la plataforma rack-scale Helios y ROCm. La forma plausible: racks Helios que combinen silicio MI de propósito general para entrenamiento y servicio flexible con bloques cableados que atiendan los modelos de producción de mayor volumen a una fracción del consumo.
Estratégicamente, AMD admite que no va a ganarle a Nvidia en GPU y decide cambiar el eje. El foso de Nvidia es CUDA más una década de flexibilidad generalista. Un chip de función fija no compite contra ese foso: lo rodea, justo en la carga de trabajo donde la flexibilidad vale menos y el coste por token vale más.
Llega además tres días después de que AMD reportara que sus ingresos de centro de datos más que se duplicaron, hasta 6.700 millones. AMD gasta su impulso en silicio específico de inferencia en lugar de en alcanzar a Nvidia en entrenamiento. Es una lectura de hacia dónde va el dinero, y probablemente acierta.
El riesgo es simple: apostar el juego de máscaras al modelo equivocado y haber fabricado un pisapapeles extremadamente eficiente.
Fuentes
Lecturas relacionadas
- Hardware Nvidia prepara una tercera subida de precios de GPU en 2026 de hasta el 30% por la escasez de memoria para IA
- Hardware AMD ficha a Microsoft como cliente estrella de su sistema de IA a escala de rack Helios
- Hardware Tesla y SpaceX invierten 16.800 M$ en Terafab, una planta de chips de 100 millones de pies cuadrados en Texas