Volver al Blog
Modelos de IA 25 de marzo de 2026 5 min read

TurboQuant de Google comprime la caché KV de los LLMs a 3 bits sin perder precisión

Google Research publicó TurboQuant, un algoritmo de cuantización que reduce la caché clave-valor de los modelos de lenguaje en 6x y multiplica por 8 la velocidad de atención en GPU H100, sin necesidad de reentrenamiento.

TurboQuant de Google comprime la caché KV de los LLMs a 3 bits sin perder precisión

Google Research ha publicado TurboQuant, un algoritmo de cuantización que comprime la caché clave-valor (KV) de los modelos de lenguaje de gran escala hasta 3 bits por valor — sin reentrenamiento, sin ajuste fino y sin pérdida medible de precisión. El trabajo se presentará en ICLR 2026.

La caché KV es la memoria que un modelo transformer mantiene de los tokens anteriores durante la inferencia. A longitudes de contexto largas, domina el uso de memoria. La propuesta de TurboQuant es ambiciosa: una reducción de 6x en la huella de memoria KV, más un aumento de velocidad de 8x en el cálculo de los logits de atención en GPU H100 con compresión de 4 bits frente a claves no cuantizadas de 32 bits.

TurboQuant se basa en dos algoritmos componentes, publicados junto a él:

QJL (Quantized Johnson-Lindenstrauss) mapea vectores de alta dimensión a bits de signo (+1 o -1) usando la transformada de Johnson-Lindenstrauss. La representación resultante no requiere memoria adicional. Un estimador de precisión balanceada reconstruye después las puntuaciones de atención precisas a partir de la forma comprimida.

PolarQuant aborda el problema desde otro ángulo — literalmente. Convierte los vectores de coordenadas cartesianas a coordenadas polares: en lugar de distancias (X, Y, Z), trabaja con radio y ángulo. Dado que la distribución angular es predecible y concentrada, el paso de normalización deja de ser necesario, eliminando la sobrecarga de memoria que arrastran los métodos de cuantización convencionales.

TurboQuant combina ambos: QJL gestiona la compresión principal, PolarQuant se encarga de la estructura residual.

Google evaluó los tres algoritmos sobre Gemma y Mistral en benchmarks estándar de contexto largo: LongBench, Needle In A Haystack, ZeroSCROLLS, RULER y L-Eval. En el benchmark de aguja en un pajar — que mide si un modelo puede recuperar un dato concreto en un contexto muy largo — TurboQuant obtiene resultados perfectos manteniendo la reducción de 6x en memoria KV. PolarQuant se describe como “prácticamente sin pérdidas” en la misma tarea.

En búsqueda vectorial — una aplicación distinta de la caché KV — TurboQuant supera a los métodos de referencia PQ y RabbiQ en la ratio de recuperación 1@k, a pesar de que esas referencias usan codebooks más grandes y ajuste específico por dataset.

Por qué importa: la memoria es el cuello de botella principal para ejecutar modelos de contexto largo de forma eficiente. Servir un modelo con un contexto de 128.000 tokens requiere una enorme caché KV, lo que limita el throughput y encarece la inferencia. Una compresión de 6x sin penalización de precisión se traduce directamente en más usuarios concurrentes al mismo coste, o la misma carga con hardware más barato.

La propiedad “data-oblivious” es igualmente relevante: TurboQuant no necesita ver datos de entrenamiento para calibrarse — se aplica en tiempo de inferencia. Eso significa que se puede integrar en despliegues de modelos existentes sin modificación.

No se ha anunciado fecha de lanzamiento en producción. El artículo está disponible en Google Research; la presentación en ICLR 2026 se producirá en abril.

Google LLM quantization AI infrastructure