0,01 %. Esa es aproximadamente la fracción de la web abierta que consiste en demostraciones matemáticas verificadas formalmente. Mientras internet se ahoga en “matemáticas”—publicaciones de blogs, libros de texto e hilos de StackExchange—casi todo es lenguaje natural. Es descriptivo, impreciso y frecuentemente incorrecto. Mistral está apostando a que la única forma de superar la era de las “vibes” del razonamiento de los LLM es dejar de entrenar en lo que los humanos dicen sobre matemáticas y empezar a entrenar en lo que realmente se puede demostrar.

Mistral está admitiendo algo que la mayoría de los laboratorios intentan ocultar: la web es un páramo para la lógica de alta calidad. Si quieres un modelo que no alucine un lema falso a mitad de una demostración, no puedes simplemente alimentarlo con más Common Crawl. Tienes que construir una fábrica. Al centrarse en la generación sintética de demostraciones, Mistral está esencialmente creando un sistema de bucle cerrado donde el modelo propone una demostración y el compilador de Lean actúa como el juez definitivo. Si el compilador dice que no, los datos se descartan. Es un proceso de filtrado brutal que garantiza que el conjunto de entrenamiento sea lógicamente perfecto. Esta es la filosofía central detrás de Leanstral 1.5, y representa un cambio desde predecir el siguiente token hasta predecir el siguiente paso lógico válido.

Este enfoque trata el razonamiento matemático como un problema de compilación en lugar de un problema de traducción. La mayoría de los LLM tratan las matemáticas como una secuencia de tokens que parecen una solución; Leanstral lo trata como un programa que debe ejecutarse sin errores. Es como la diferencia entre un chef describiendo cómo hornear un pastel y un químico proporcionando la fórmula molecular exacta de los ingredientes. Una es una aproximación; la otra es una especificación. ¿Quién va a usar esto realmente? (Probablemente las mismas personas que disfrutan pasar sus fines de semana en un depurador). Pero para esas personas, la capacidad de automatizar el trabajo pesado de la verificación formal es un triunfo masivo. Elimina la carga cognitiva del código repetitivo y permite que el humano se centre en la estrategia de alto nivel de la demostración.

La jugada estratégica aquí es un giro claro lejos de la mentalidad de la “aplicación para todo” de OpenAI. Mientras los gigantes de la industria luchan por ver quién puede construir el mejor asistente de propósito general para escribir correos, Mistral se está abriendo un espacio como el laboratorio para las personas que realmente se preocupan por la lógica subyacente. Están construyendo herramientas para ingenieros y matemáticos que encuentran los modelos actuales de “razonamiento” poco concretos. Sin embargo, hay un pero: la fricción aquí no es el modelo, sino la herramienta. Lean 4 tiene una curva de aprendizaje que parece un acantilado vertical (y lo es), lo que limita la utilidad inmediata del modelo a un círculo muy pequeño de especialistas. O quizás no; tal vez esta es exactamente la forma en que construyes un foso defensivo.

Aun así, el enfoque de datos sintéticos es la verdadera historia. Si pueden generar exitosamente una “abundancia” a partir de una pequeña semilla de lógica formal, habrán encontrado una forma de escalar la inteligencia sin necesitar más texto escrito por humanos. Hemos alcanzado el límite de lo que la web pública puede ofrecer. El futuro del razonamiento es sintético, y debe ser verificado por una fuente externa de verdad, ya sea un compilador, un motor de física o una partida de ajedrez. Sospecho que veremos un modelo competitivo “formal-first” de otro laboratorio importante para Q4. La carrera ya no se trata de quién tiene el conjunto de datos más grande, sino de quién puede construir el mejor filtro para crear uno limpio.

Una herramienta de nicho para un público de nicho, pero vital.