¿Qué importa más en una herramienta de inteligencia artificial: que pueda entrar en tu teléfono sin agotarlo o que tenga la potencia de una ciudad entera? China quiere las dos cosas. Y esa doble apuesta está cambiando el mapa de una carrera que ya no se mide solo por velocidad.

El hallazgo está en la estrategia de empresas como Alibaba, DeepSeek y Moonshot AI. Mientras las familias Qwen y MiniCPM desarrollan modelos compactos, pensados para funcionar con menos memoria y capacidad de cálculo, sus creadores también avanzan hacia sistemas de tamaño colosal.

DeepSeek-V3 se lanzó con 671.000 millones de parámetros. Moonshot AI llevó Kimi K2 al billón y, en 2026, Kimi K3 alcanzó los 2,8 billones. Alibaba, por su parte, situó Qwen3.8-Max en 2,4 billones de parámetros totales.

Empresas como Alibaba, DeepSeek y Moonshot AI

La cifra impresiona, pero no cuenta toda la historia.

También te puede interesar:Redes Chinas como WeChat, Douyin y Weibo Castigan a Quienes no Marcan sus Creaciones de IA

Un parámetro es, en términos simples, una pieza de información ajustable que ayuda a la IA a reconocer patrones y producir respuestas. Sin embargo, sumar piezas no garantiza una máquina más inteligente, del mismo modo que una cocina con más cajones no prepara por sí sola una mejor comida.

El mecanismo detrás de los modelos gigantes

La pieza clave es la arquitectura Mixture of Experts o MoE (mezcla de especialistas). Su mecanismo se parece al tablero eléctrico de una casa: hay muchos circuitos instalados, pero no todos se encienden al mismo tiempo cuando alguien prende una lámpara.

Un modelo MoE guarda una enorme red de “especialistas”, pero activa solo los que necesita para cada tarea. Así puede conservar una capacidad amplia sin exigir toda su potencia en cada respuesta. Es un engranaje que intenta combinar tamaño y ahorro.

Un modelo MoE guarda una enorme red de “especialistas”, pero activa solo los que necesita para cada tarea

Qwen3.8-Max ilustra esa lógica. Aunque reúne 2,4 billones de parámetros, utiliza alrededor de 95.000 millones en cada paso de procesamiento. En lugar de abrir todas las puertas de un gran edificio para encontrar un documento, el sistema manda la consulta directamente a las oficinas relevantes.

También te puede interesar:Redes Chinas como WeChat, Douyin y Weibo Castigan a Quienes no Marcan sus Creaciones de IA
También te puede interesar:Sin chips de NVIDIA, las empresas chinas de IA se alimentan de electricidad casi gratis

Además, esta fórmula permite entender por qué China no abandonó los modelos pequeños. Los sistemas compactos son una oportunidad para ejecutar IA en equipos personales, reducir costes y limitar el uso de memoria. Resultan útiles cuando la respuesta debe llegar cerca del usuario, sin depender siempre de grandes centros de datos.

Los modelos gigantes, en cambio, apuntan a tareas más variadas y exigentes. Requieren mucha infraestructura, energía y capacidad de cálculo, pero buscan resolver problemas con más capas, desde análisis extensos hasta herramientas capaces de combinar texto, imágenes y razonamiento.

Más tamaño no siempre significa mejores respuestas

La experiencia de DeepMind aporta una advertencia central. En 2022, su modelo Chinchilla, con 70.000 millones de parámetros, superó a Gopher, que tenía 280.000 millones, en casi todas las tareas evaluadas bajo el mismo presupuesto de computación.

La diferencia estuvo en el entrenamiento: Chinchilla recibió cerca de cuatro veces más datos. El estudio revela que el rendimiento depende también de la arquitectura, de la cantidad y calidad del material usado para entrenar y de los recursos informáticos disponibles.

Más tamaño no siempre significa mejores respuestas

Alibaba confirmó el 22 de septiembre que Qwen 4 está en entrenamiento. Su hoja de ruta para Qwen 4.5 y Qwen 5 contempla modelos de entre 5 y 10 billones de parámetros. ByteDance perseguiría una escala similar, según reportes de prensa, aunque la compañía no lo confirmó públicamente.

La comparación con Estados Unidos sigue incompleta. OpenAI y Anthropic no divulgaron la cantidad de parámetros de GPT-5.6 Sol ni de Claude Fable 5.1, por lo que el tamaño no permite establecer una tabla directa entre los sistemas más recientes.

Para el usuario, la clave será menos visible pero más concreta: una IA pequeña podrá acompañarlo en dispositivos cotidianos, mientras otra gigantesca resolverá tareas desde la infraestructura remota. La carrera no consiste solo en construir una casa más grande, sino en lograr que cada interruptor encienda la luz correcta.

0 0 votos
Valoración del artículo
Suscribirte
Notificar sobre
guest
0 Comentarios
Más Antiguos
Más Nuevos Más Votados