“El desarrollador de IA chino MiniMax está trabajando en un nuevo modelo de lenguaje grande con 2,7 billones de parámetros.”

Esa es una cifra tan grande que deja de ser una especificación técnica para convertirse en un proyecto de vanidad. Hemos pasado el último año aprendiendo que un modelo de 7B bien curado puede golpear muy por encima de su categoría, y sin embargo, aquí estamos, volviendo a la filosofía del “más es más”. Es como comprar un jet comercial solo para ir al supermercado: técnicamente impresionante, pero funcionalmente absurdo. (He visto esta obsesión con los recuentos de parámetros antes, y rara vez termina con un mejor producto).

La industria está actualmente obsesionada con la destilación, la cuantización y la creación de modelos que realmente quepan en una GPU de consumo sin provocar un evento térmico. Dar un giro hacia una bestia de múltiples billones de parámetros se siente como un retroceso. Es una forma ruidosa y costosa de decir “tenemos mucho poder de cómputo”, pero dice muy poco sobre la utilidad real del modelo para cualquiera que no esté ejecutando un centro de datos de grado soberano.

La afirmación de que van a abrir el código de un modelo de 2,7 billones de parámetros más tarde este año suena genial en una presentación, pero hablemos de la física real del asunto. ¿Quién tiene realmente el cluster de H100 para cargar esto en VRAM? Incluso con cuantización pesada, te enfrentas a un requisito de hardware que excluye al 99% de la comunidad de “código abierto”. Es una ostentación, no una contribución.

Si esta es una arquitectura de Mixture-of-Experts (MoE), el recuento de parámetros activos por token será menor, pero la huella de memoria sigue siendo una pesadilla. Todavía tienes que alojar a la bestia completa. Es esencialmente como construir un rascacielos sin ascensores; la arquitectura está ahí, la escala es masiva, pero la experiencia real de moverse por ella es una tortura.

Hay una enorme diferencia entre “pesos abiertos” y “software utilizable”. Si la barrera de entrada es un rack de servidores de un millón de dólares, la parte de “abierto” de la ecuación es una formalidad. Hemos visto este truco antes, donde los laboratorios lanzan un modelo que es técnicamente público pero prácticamente inaccesible, forzando efectivamente a los desarrolladores a usar su API propietaria. O quizás no; tal vez realmente crean que la comunidad tiene el hardware para manejar esto. (Lo dudo mucho).

Es una métrica de vanidad.

Tenemos que preguntarnos por qué MiniMax está eligiendo este camino ahora. La mayor parte del dinero inteligente está apostando por modelos pequeños especializados de alto razonamiento que pueden manejar lógica compleja sin necesitar una subestación eléctrica dedicada. Pero el prestigio de ser el “más grande” aún tiene peso en ciertos círculos. Es un movimiento clásico: lanzar una bestia para demostrar capacidad técnica y luego vender la API de una versión destilada que realmente funcione en un tiempo razonable.

Hemos estado debatiendo sobre la optimalidad de Chinchilla durante años, y esto simplemente ignora por completo las matemáticas. La relación entre datos de entrenamiento y parámetros sugiere que un modelo de este tamaño requeriría una cantidad astronómica de tokens de alta calidad para evitar ser un loro muy grande y muy costoso. A menos que MiniMax haya encontrado un escondite secreto de datos prístinos que el resto del mundo haya pasado por alto, la utilidad marginal de esos billones de parámetros adicionales será insignificante.

Para el Q4, veremos que el modelo de 2.7T es en gran medida ignorado por los desarrolladores en favor de las versiones destiladas de 70B de la misma arquitectura.

La fricción es simplemente demasiado alta. Entre la latencia de un modelo de ese tamaño y el costo absoluto del cómputo necesario para mantenerlo en funcionamiento, la utilidad es un error de redondeo. Vimos un patrón similar durante los primeros días de la “carrera de los billones de parámetros” donde los modelos más grandes eran a menudo los más frágiles y propensos al olvido catastrófico. Si MiniMax quiere influir realmente en el campo, deberían hablar sobre la calidad de los datos y la eficiencia de los tokens, no solo el tamaño del archivo de pesos. ¿Quién va a descargar realmente un archivo de varios terabytes solo para descubrir que alucina tanto como un Llama-3-8B? Probablemente nadie.