强化学习(多)智能体 和 大语言模型(多)智能体.pdfVIP

  • 0
  • 0
  • 约6.44万字
  • 约 71页
  • 2026-03-02 发布于广东
  • 举报

强化学习(多)智能体 和 大语言模型(多)智能体.pdf

毛航宇

快手科技快意大模型知识增强研发负责人

现就职于快手科技,快意大模型知识增强研发负责人,同时兼任智能交互团队负责人。主要

关注Agent,RAG,Alignment,RL,LLM等技术,在ICLR及NeurIPS,ICML等CCF-A/B类

会议和期刊上发表论文30余篇,申请国际、国内专利十余项,相关研究在企业场景落地并

产生较大效益。曾担任上述国际会议的PC,SeniorPC,AreaChair,中国数据挖掘会议

(CCDM)的论坛主席,以及CCF多智能体学组的执行委员。本人和所带领的团队曾获全球

数字经济大会“人工智能大模型场景应用典型案例”、国际人工智能会议NeurIPS强化学习

竞赛冠军、中国计算机学会“多智能体研究优秀博士论文奖”、北京市“优秀(博士)毕业

生”、华为“创新先锋总裁奖”。

演讲主题:

从强化学习(多)智能体到大语言模型(多)智能体

目录

1.强化学习(多)智能体到大语言模型(多)智能体十年研究脉络梳理

2.强化学习(多)智能体到大语言模型(多)智能体代表工作选讲

DeepRLAgent(DRL)

Transformer-basedRLAgent(TRL)

LLM-basedAIAgent

3.企业实践中的心得体会

2

BackgroundRLAgents

BackgroundAIAgents

https://lilianweng.github.io/posts/2023-06-23-agent/

强化学习(多)智能体和大语言模型(多)智能体十年研究脉络

DeepRLDeepMARLNLPLLM–AIAgentLLM–AIAgents

15DRLFoundation--------

15-2:DQN

1615-2:TRPO------

15-6:GAECommunication

15-9:DDPGCommNet/BiCNet/ACCNet

1716-1:AlphaGoATOC/IC3Net/Gated-ACMLTransformer----

17-7:PPO

18NovelPerspectiveCTDEBERT----

文档评论(0)

1亿VIP精品文档

相关文档