棋盘游戏竞技场:通过战略游戏评估大型语言模型的框架和基准.pdfVIP

  • 6
  • 0
  • 约1.22万字
  • 约 12页
  • 2026-03-09 发布于北京
  • 举报

棋盘游戏竞技场:通过战略游戏评估大型语言模型的框架和基准.pdf

棋盘游戏竞技场:通过战略游戏评估大型语言模

型的框架和基准

1,21,21,2

LuciaCipolina‑Kun,MariannaNezhurina,andJeniaJitsev

1LAION

2JuelichSupercomputingCenter(JSC),ResearchCenterJuelich(FZJ)

本2025年8月7日

中桌面游戏竞技场库提供了一个框架,通过Google的OpenSpiel库中实现的战略棋

1盘游戏来评估大型语言模型(LLMs)的决策能力。该框架通过封装多个棋盘和矩阵游

v

8戏并支持不同类型的代理,实现了在各种游戏场景下系统地比较基于LLM的代理与其

6

3他代理(随机、人类、强化学习代理等)的能力。它集成了通过LiteLLM访问模型的

文档评论(0)

1亿VIP精品文档

相关文档