Volver al Blog
Hardware 20 de agosto de 2026 5 min read

Cerebras presenta el CS-4: tres chips a escala de oblea, 750 petaflops y una ventaja declarada de 30x sobre las GPU

El CS-4 integra tres obleas WSE-3 Turbo — 4 billones de transistores y 900.000 núcleos cada una — en un sistema con 129,6 PB/s de ancho de banda de memoria. Cerebras afirma una inferencia hasta 30 veces más rápida que los sistemas GPU con la mitad de consumo por rack.

Cerebras presenta el CS-4: tres chips a escala de oblea, 750 petaflops y una ventaja declarada de 30x sobre las GPU

Cerebras ha anunciado el CS-4, su primer sistema multi-oblea: tres procesadores Wafer Scale Engine 3 Turbo (WSE-3T) funcionando como una sola máquina, con 750 petaflops combinados de cómputo FP16 disperso y una velocidad de inferencia que la compañía cifra en “hasta 30 veces más rápida que los sistemas basados en GPU” con modelos frontera.

Las cifras por oblea siguen siendo absurdas para los estándares convencionales. Cada WSE-3T integra 4 billones de transistores y 900.000 núcleos optimizados para IA con 44GB de SRAM en el propio chip, fabricado en el proceso de 5nm de TSMC. Unidas, las tres obleas ofrecen 129,6 petabytes por segundo de ancho de banda de memoria, y la latencia entre obleas baja de cinco microsegundos a dos. Cerebras asegura que el sistema soporta modelos de más de 50 billones de parámetros. En su benchmark, el CS-4 llevó a gpt-oss-120b por encima de los 4.400 tokens por segundo por usuario — la clase de velocidad de decodificación que convierte un bucle agéntico de minutos en segundos.

El consumo es el titular silencioso. Cerebras estima entre 120 y 140 kilovatios por rack, aproximadamente la mitad que los sistemas comparables de Nvidia y AMD, lo que sustenta su afirmación de una ventaja de diez veces en rendimiento por vatio. En un mercado donde los centros de datos están cada vez más limitados por la electricidad y no por el silicio, el rendimiento por vatio se está convirtiendo en la métrica que cierra contratos.

El CEO Andrew Feldman resumió el argumento en torno a la latencia: “En IA, la velocidad es productividad”. El CTO Sean Lie fue más concreto: el salto de velocidad “da un orden de magnitud más de razonamiento, verificación o uso de herramientas”. Es el argumento de la IA agéntica en una frase: cuando un agente de código encadena cientos de llamadas secuenciales al modelo, la latencia por token se acumula hasta marcar la diferencia entre una herramienta interactiva y un trabajo por lotes.

La advertencia honesta: el WSE-3T no es silicio nuevo. Es el WSE-3 existente con el reloj casi duplicado, de unos 1,4GHz a 2,8GHz — un ejercicio agresivo de binning y refrigeración más que un chip rediseñado, como señalaron enseguida los críticos. La generación genuinamente nueva llegará en 2027. Y Cerebras no reveló precios ni compromisos de clientes en el lanzamiento, aunque los envíos comenzaron en el tercer trimestre de 2026.

Aun así, el momento es significativo. El dominio de Nvidia es más fuerte en entrenamiento; la inferencia — donde las cargas se disparan con los agentes en producción — es donde la arquitectura a escala de oblea siempre ha tenido el relato más limpio. Queda por ver si ese 30x sobrevive a los benchmarks independientes.

Fuentes

cerebras ai-chips inference hardware