- 6
- 0
- 约1.22万字
- 约 12页
- 2026-03-09 发布于北京
- 举报
棋盘游戏竞技场:通过战略游戏评估大型语言模
型的框架和基准
1,21,21,2
LuciaCipolina‑Kun,MariannaNezhurina,andJeniaJitsev
1LAION
2JuelichSupercomputingCenter(JSC),ResearchCenterJuelich(FZJ)
本2025年8月7日
译
中桌面游戏竞技场库提供了一个框架,通过Google的OpenSpiel库中实现的战略棋
1盘游戏来评估大型语言模型(LLMs)的决策能力。该框架通过封装多个棋盘和矩阵游
v
8戏并支持不同类型的代理,实现了在各种游戏场景下系统地比较基于LLM的代理与其
6
3他代理(随机、人类、强化学习代理等)的能力。它集成了通过LiteLLM访问模型的
您可能关注的文档
- OpenLifelogQA:一个开放式的多模态生活日志问答数据集.pdf
- 通过 KILO 解决 LLM 中的分布变化:知识指导的持续适应学习.pdf
- SAM2-UNeXT: 一种改进的高分辨率基线,用于将基础模型适应下游分割任务.pdf
- 超越梗图模板:视觉相似性测量在梗匹配中的局限性.pdf
- PyLate: 晚期交互模型的灵活训练和检索.pdf
- 基于视觉的感知系统用于自动递送机器人与行人互动.pdf
- 视网膜 – 脂质组学关联作为心血管健康候选生物标志物.pdf
- EmbedGrad:大型语言模型中基于梯度的嵌入空间提示优化.pdf
- 马里托:构建和建立南非自然语言处理的开放多语种术语框架.pdf
- 使用视觉基础模型对组织病理学图像片段进行语义拼贴.pdf
原创力文档

文档评论(0)