强化学习(多)智能体和大语言模型(多)智能体.pdfVIP

下载本文档

0
0
约6.44万字
约 71页
2026-03-02 发布于广东
举报

强化学习(多)智能体和大语言模型(多)智能体.pdf

毛航宇

快手科技快意大模型知识增强研发负责人

现就职于快手科技，快意大模型知识增强研发负责人，同时兼任智能交互团队负责人。主要

关注Agent,RAG,Alignment,RL,LLM等技术，在ICLR及NeurIPS,ICML等CCF-A/B类

会议和期刊上发表论文30余篇，申请国际、国内专利十余项，相关研究在企业场景落地并

产生较大效益。曾担任上述国际会议的PC,SeniorPC,AreaChair，中国数据挖掘会议

（CCDM）的论坛主席，以及CCF多智能体学组的执行委员。本人和所带领的团队曾获全球

数字经济大会“人工智能大模型场景应用典型案例”、国际人工智能会议NeurIPS强化学习

竞赛冠军、中国计算机学会“多智能体研究优秀博士论文奖”、北京市“优秀(博士)毕业

生”、华为“创新先锋总裁奖”。

演讲主题：

从强化学习(多)智能体到大语言模型(多)智能体

1.强化学习(多)智能体到大语言模型(多)智能体十年研究脉络梳理

2.强化学习(多)智能体到大语言模型(多)智能体代表工作选讲

DeepRLAgent(DRL)

Transformer-basedRLAgent(TRL)

LLM-basedAIAgent

3.企业实践中的心得体会

BackgroundRLAgents

BackgroundAIAgents

https://lilianweng.github.io/posts/2023-06-23-agent/

强化学习(多)智能体和大语言模型(多)智能体十年研究脉络

DeepRLDeepMARLNLPLLM–AIAgentLLM–AIAgents

15DRLFoundation--------

15-2:DQN

1615-2:TRPO------

15-6:GAECommunication

15-9:DDPGCommNet/BiCNet/ACCNet

1716-1:AlphaGoATOC/IC3Net/Gated-ACMLTransformer----

17-7:PPO

18NovelPerspectiveCTDEBERT----

您可能关注的文档

文档评论（0）

1亿VIP精品文档

更多 >

强化学习(多)智能体和大语言模型(多)智能体.pdfVIP