ByteDance entrena un modelo de 10 billones de parámetros: nada en China se le acerca
El Financial Times informa de que ByteDance entrena un modelo de hasta 10 billones de parámetros, más del triple que el Kimi K3 de Moonshot. Colocaría a un laboratorio chino en la misma liga de escala que Mythos 5 de Anthropic.
ByteDance está en fase de pre-entrenamiento de un modelo de IA con hasta 10 billones de parámetros (10 trillion, escala anglosajona), según informó el viernes el Financial Times citando a personas conocedoras del proyecto. Si llega a lanzarse a esa escala, será con diferencia el modelo más grande que haya intentado un laboratorio chino.
Las comparaciones son las que dan peso a la cifra. Kimi K3, de Moonshot AI y actual líder chino en tamaño, tiene 2,8 billones de parámetros. V4-Pro de DeepSeek y LongCat-2.0 de Meituan se quedan en 1,6 billones. ByteDance supera en más de 3x el techo de su propio mercado de un solo salto, y multiplica por seis los modelos que definían la frontera china hace seis meses.
Frente a los laboratorios occidentales, las estimaciones del sector sitúan Mythos 5 de Anthropic cerca de los 8 billones de parámetros, y su hermano con guardarraíles, Fable 5, en torno a 5 billones. Un modelo de 10 billones de ByteDance no solo cerraría la brecha de parámetros: la superaría en bruto.
Dos advertencias antes de reescribir la clasificación. Reuters no pudo verificar de forma independiente la información del FT, y ByteDance declinó comentar. Y el recuento de parámetros dejó hace tiempo de ser un proxy limpio de capacidad: la dispersión, la proporción de parámetros activos en arquitecturas MoE, la calidad de los datos y el post-entrenamiento deciden hoy dónde cae un modelo en los benchmarks. Un mixture-of-experts disperso de 10 billones con 400.000 millones de parámetros activos es una máquina muy distinta a un modelo denso de 10 billones, y fuera de ByteDance nadie sabe cuál de las dos es.
El calendario es el dato concreto. El modelo está en pre-entrenamiento, una fase que suele durar entre tres y seis meses antes del ajuste fino y el lanzamiento. Eso sitúa una ventana plausible entre finales de 2026 y principios de 2027, siempre que el entrenamiento no diverja, algo que a esta escala no es una suposición menor.
La lectura estratégica resulta más interesante que la cifra. ByteDance tiene las dos cosas que esto exige y que la mayoría de laboratorios chinos no tienen: infraestructura a escala de recomendación ya construida y amortizada, e ingresos de TikTok y Douyin que no dependen de que el modelo funcione. DeepSeek se hizo un nombre con eficiencia bajo restricciones de control de exportaciones: hacer más con menos porque menos era lo que había. ByteDance juega la partida contraria. Gasta a escala frontera apostando a que la capacidad bruta todavía compra capacidad real.
Ambos enfoques responden al mismo techo de cómputo. Uno lo optimiza. El otro intenta comprar suficiente de lo disponible como para volverlo irrelevante.
La cifra a vigilar no es 10 billones. Es el número de parámetros activos y la batería de benchmarks que ByteDance publique cuando el modelo aterrice, y si el entrenamiento llega a terminar.
Fuentes
Lecturas relacionadas
- Hardware ByteDance planea adquirir 50.000 chips de IA de la startup shanghainesa Iluvatar CoreX
- Modelos de IA El Qwen3.8-Max de Alibaba supera a GPT-5.6 Sol y Claude Fable 5 en benchmarks clave
- Modelos de IA Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y un modelo de ciberseguridad — sigue sin haber 3.5 Pro