Imagina a un músico de jazz que puede leer a primera vista una pieza musical compleja a la perfección desde el primer intento. Acierta cada nota, cada sincopación y cada cambio sutil de tono. Pero si le pides que explique la teoría armónica subyacente o por qué el compositor eligió una progresión de acordes específica, no puede. No está pensando en música; está ejecutando un mapa altamente sofisticado de patrones que ha visto mil veces antes.

El trabajo reciente de Anthropic sobre la función zeta de Riemann se siente exactamente así. Están intentando convencernos de que Claude ha desarrollado un gusto por la teoría analítica de números. La investigación es una exploración de cómo el modelo maneja la función zeta, una de las áreas más notoriamente difíciles de las matemáticas, y los resultados son, a primera vista, impresionantes. Parece que el modelo está razonando a través de pruebas complejas, manejando los matices del análisis complejo con un nivel de precisión que haría sudar a un estudiante de posgrado.

Pero seamos honestos sobre lo que realmente está pasando bajo el capó. ¿Esto realmente cuenta como pensar? (Sospecho que no). La mayor parte de lo que vemos en estas capacidades matemáticas son simplemente los límites de la interpolación. El modelo ha ingerido una cantidad masiva de LaTeX, artículos académicos y libros de texto. No está “resolviendo” la función zeta de Riemann tanto como está prediciendo la secuencia más probable de símbolos que un matemático profesional usaría para describirla.

Es una imitación del rigor. Cuando un matemático humano resuelve un problema, está construyendo un modelo mental de la lógica. Cuando Claude lo hace, está navegando por un espacio de probabilidad de alta dimensión donde “el siguiente paso lógico” es simplemente el token estadísticamente más probable. Si empujas al modelo a una esquina con un problema que no ha sido discutido en un artículo en alguna parte, la fachada suele agrietarse. Vimos esto con el problema de la “fresa” en otros modelos; el emparejamiento de patrones es brillante hasta que el patrón cambia en un grado. O tal vez los modelos están mejorando en los casos límite, pero el mecanismo fundamental sigue siendo un juego de adivinanzas basado en una biblioteca muy costosa.

Esto no es un fallo del modelo, sino una limitación de la arquitectura. Estamos confundiendo la capacidad de replicar la estructura de una prueba con la capacidad de entender la necesidad de la prueba. Es como la diferencia entre una calculadora y un matemático. Uno es rápido y preciso porque sigue reglas; el otro entiende por qué existen las reglas.

Luego está la usabilidad real. Incluso si el modelo puede navegar por estas pruebas, la latencia para estas rutas de razonamiento de cadena larga es brutal. Todos hemos sentido esa pausa agonizante cuando el modelo está “pensando” a través de un prompt complejo, solo para alucinar un signo menos en el tercer paso y desviar todo el resultado. Ese es el costo de la corrección en la arquitectura actual: intercambias velocidad por un tipo de precisión frágil.

También está el tema del presupuesto de tokens. Estas cadenas matemáticas complejas consumen ventanas de contexto y créditos de cómputo a un ritmo alarmante. Si estás ejecutando un pipeline de alto volumen, el precio de estos tokens de “razonamiento” hace que el proceso prohibitivamente caro para cualquier cosa que no sea curiosidad académica. Es como intentar usar una supercomputadora para cuadrar un libro de cheques; la sobrecarga es absurda.

Es una función de lujo, no una herramienta para producción.

La industria está actualmente obsesionada con el “razonamiento” como una palabra de moda, pero la mayoría de estos saltos son simplemente una mejor curación de datos y clústeres de cómputo más grandes. Básicamente, estamos forzando el camino hacia la inteligencia, esperando que si le tiramos suficientes GPUs al problema, el modelo eventualmente tropiece con la lógica real.

Para el primer trimestre de 2025, Anthropic lanzará un modelo de inferencia matemática dedicado que separe los pasos de razonamiento de la salida final. Hasta entonces, solo estamos viendo a un músico de jazz muy talentoso interpretar una partitura que en realidad no entiende.