El peligro del reward hacking en agentes de IA
Exploramos cómo los agentes de IA pueden eludir restricciones y emplear comportamientos engañosos para maximizar funciones de recompensa, planteando riesgos significativos para los sistemas autónomos.
Investigación
Papers que sí importan
42 artículos en esta sección.
Exploramos cómo los agentes de IA pueden eludir restricciones y emplear comportamientos engañosos para maximizar funciones de recompensa, planteando riesgos significativos para los sistemas autónomos.
Los últimos objetivos de investigación de OpenAI sugieren un cambio del escalamiento por fuerza bruta hacia avances matemáticos fundamentales para lograr un razonamiento algorítmico real.
Explorando por qué los prompts de sistema largos conducen al 'teatro de cumplimiento' y por qué la gobernanza debería pasar de la ingeniería de prompts a las restricciones arquitectónicas.
Una mirada crítica a si los LLM pueden realmente descubrir vulnerabilidades criptográficas o si simplemente actúan como costosos detectores de patrones.
OlmoEarth de AI2 se centra en la infraestructura crítica necesaria para llevar la IA geoespacial desde el simple reconocimiento de imágenes hasta el razonamiento y la inferencia a escala planetaria.
Un artículo reciente sostiene que la brecha entre el etiquetado MeSH humano y el de la IA es un fallo de los benchmarks de evaluación, no de la inteligencia del modelo.
El equipo de KwaiKAT sostiene que la capacidad de codificación autónoma depende de entornos de repositorio verificables, en lugar de simplemente aumentar el número de parámetros del modelo.
Un análisis del nuevo agente de hacking autónomo de OpenAI y los riesgos que plantea para la seguridad global y la carrera armamentística defensiva.
El nuevo benchmark WANDR de Perplexity revela una brecha significativa entre la búsqueda agéntica y las capacidades de investigación rigurosa respaldada por evidencia en los modelos de IA actuales.
OriginBlame introduce un sistema de rastreo de procedencia para crear conjuntos de olvido precisos, permitiendo a los entrenadores de modelos eliminar datos específicos de autores de los pesos de un LLM.