“WANDR está diseñado para probar si los agentes de investigación pueden descubrir muchas entidades que cumplan los criterios y respaldar cada una con evidencia citada y re-verificable.”
Ya era hora de dejar de fingir que “buscar” es solo un envoltorio elegante para una única consulta de Google. Durante demasiado tiempo, la industria ha aceptado agentes que encuentran los primeros tres enlaces relevantes y luego se detienen, actuando como si hubieran agotado internet. Perplexity finalmente está poniéndole un número a esta pereza.
El nuevo benchmark, WANDR, consta de 500 tareas con alto requerimiento de evidencia. El objetivo no es solo encontrar una respuesta, sino encontrar todas las entidades que cumplan un conjunto específico y complejo de criterios. Es la diferencia entre pedirle a un agente que encuentre “a good laptop for coding” y pedirle que encuentre “every laptop released in 2024 with a 120Hz OLED screen and a 100Wh battery.” Una es una sugerencia; la otra es un proyecto de investigación.
Sin sorpresas, el propio “Search as Code” de Perplexity está actualmente liderando el grupo. Han reportado un puntaje soft F1 de 0.363 y un puntaje hard F1 de 0.133. (Lo cual es básicamente una forma elegante de decir que apenas funciona).
¿Quién cree realmente que un benchmark creado por el líder actual es imparcial? Probablemente nadie. Es un movimiento clásico: definir la métrica de una manera que favorezca tu arquitectura interna actual y luego lanzarla como un “estándar abierto” para forzar al resto de la industria a ponerse al día en tu terreno.
La verdadera historia no es que Perplexity esté ganando; es lo mal que lo está haciendo todo el mundo.
Miren ese puntaje hard F1: 0.133. Para quienes no pasan sus fines de semana leyendo papers de evaluación, la métrica “hard” requiere que el agente no solo encuentre la entidad, sino que proporcione una cita que verifique explícitamente la afirmación. La métrica “soft” es más indulgente. La enorme brecha entre ambas es un reconocimiento a gritos de que los agentes actuales mayormente están adivinando o alucinando el tejido conectivo entre un resultado de búsqueda y una respuesta final.
Es como un asistente legal que encuentra tres casos relevantes pero se pierde los diez que realmente ganan el juicio. Han hecho la parte de “búsqueda”, pero fallaron en la parte de “investigación”.
La brecha entre el soft F1 y el hard F1 es vergonzosa.
Esto nos dice que el flujo de trabajo “agentic” del que hemos estado tan entusiasmados el último año sigue siendo increíblemente superficial. Hemos construido sistemas que pueden iterar a través de unas pocas llamadas a API, pero no hemos construido sistemas que puedan verificar evidencia con algún grado de rigor. La fricción aquí no es solo sobre las capacidades de razonamiento del LLM; se trata de la latencia y el costo de realizar la búsqueda “wide and deep” requerida para alcanzar un alto puntaje hard F1. Si realmente quieres verificar 20 entidades diferentes a través de 50 fuentes, tu gasto de tokens y tu tiempo de espera se disparan. La mayoría de los desarrolladores han estado optimizando para velocidad, no para verdad.
Al priorizar “Search as Code,” Perplexity está apostando a que el camino hacia la confiabilidad pasa por la ejecución programática en lugar de simplemente pedirle a un modelo que “sea más minucioso.” Quieren que el agente escriba un script que haga scraping, filtre y valide, en lugar de esperar que el mecanismo de atención interno del modelo no se desvíe después de la tercera página web.
Sospecho que esto es un golpe preventivo. Al establecer WANDR como el estándar de oro para “Deep Research,” están intentando cambiar las reglas del juego lejos de los benchmarks de chat simples. Esperen un benchmark competitivo de “Deep Research” de OpenAI o Google para el Q4 para recuperar la narrativa. Hasta entonces, estamos atrapados con agentes que son excelentes para resumir la primera página de Google pero terribles para hacer realmente el trabajo de un investigador.