Los Modelos de Lenguaje de Gran Escala (LLMs) están siendo cada vez más utilizados en tareas que requieren un razonamiento estratégico sofisticado. Realizamos una revisión sistemática de los benchmarks recientes desarrollados para evaluar las capacidades estratégicas de los LLMs en contextos cooperativos, adversariales y orientados a políticas.
Siguiendo una estrategia de búsqueda reproducible, identificamos 7 benchmarks principales a partir de un total de 573 artículos. Estos benchmarks miden diversas dimensiones, como la planificación en múltiples pasos, la inferencia de información oculta, el comportamiento cooperativo y las tácticas de engaño. Sus metodologías incluyen competencias multiagente, juegos de tablero, entornos de negociación y escenarios de bienes públicos, cada uno con métricas específicas—desde calificaciones Elo hasta modelos Bradley-Terry—que ofrecen información crucial sobre el desempeño de los LLMs. Destacamos las limitaciones actuales, incluyendo la falta de métricas estandarizadas y la aplicabilidad limitada al mundo real, y proponemos líneas de investigación futura, como evaluaciones con humanos en el bucle y simulaciones a nivel de políticas. Nuestro estudio busca informar a investigadores y profesionales interesados en marcos sólidos para evaluar las competencias de razonamiento estratégico de los LLMs.
Modelos lingüísticos de gran escala, Razonamiento estratégico, Parámetros de referencia, Sistemas multiagente.
Large Language Models (LLMs) are increasingly deployed in tasks requiring sophisticated strategic reasoning. We systematically surveyed recent benchmarks developed to evaluate LLM-based strategic capabilities across cooperative, adversarial, and policy-oriented contexts. Following a reproducible search strategy, we identified 7 primary benchmarks from a pool of 573 papers. These benchmarks measure diverse dimensions such as multi-step planning, hidden-information inference, cooperative behavior, and deceptive tactics. Their methodologies include multi-agent competitions, board games, negotiation settings, and public goods scenarios, each with distinct metrics—ranging from Elo ratings to Bradley-Terry models—yielding crucial insights into LLM performance. We highlight current limitations, including the lack of standardized metrics and limited real-world applicability, and propose directions for future research, such as human-in-the-loop evaluations and policy-level
© 2001-2026 Fundación Dialnet · Todos los derechos reservados