- 0
- 0
- 约6.44万字
- 约 71页
- 2026-03-02 发布于广东
- 举报
毛航宇
快手科技快意大模型知识增强研发负责人
现就职于快手科技,快意大模型知识增强研发负责人,同时兼任智能交互团队负责人。主要
关注Agent,RAG,Alignment,RL,LLM等技术,在ICLR及NeurIPS,ICML等CCF-A/B类
会议和期刊上发表论文30余篇,申请国际、国内专利十余项,相关研究在企业场景落地并
产生较大效益。曾担任上述国际会议的PC,SeniorPC,AreaChair,中国数据挖掘会议
(CCDM)的论坛主席,以及CCF多智能体学组的执行委员。本人和所带领的团队曾获全球
数字经济大会“人工智能大模型场景应用典型案例”、国际人工智能会议NeurIPS强化学习
竞赛冠军、中国计算机学会“多智能体研究优秀博士论文奖”、北京市“优秀(博士)毕业
生”、华为“创新先锋总裁奖”。
演讲主题:
从强化学习(多)智能体到大语言模型(多)智能体
目录
1.强化学习(多)智能体到大语言模型(多)智能体十年研究脉络梳理
2.强化学习(多)智能体到大语言模型(多)智能体代表工作选讲
DeepRLAgent(DRL)
Transformer-basedRLAgent(TRL)
LLM-basedAIAgent
3.企业实践中的心得体会
2
BackgroundRLAgents
BackgroundAIAgents
https://lilianweng.github.io/posts/2023-06-23-agent/
强化学习(多)智能体和大语言模型(多)智能体十年研究脉络
DeepRLDeepMARLNLPLLM–AIAgentLLM–AIAgents
15DRLFoundation--------
15-2:DQN
1615-2:TRPO------
15-6:GAECommunication
15-9:DDPGCommNet/BiCNet/ACCNet
1716-1:AlphaGoATOC/IC3Net/Gated-ACMLTransformer----
17-7:PPO
18NovelPerspectiveCTDEBERT----
原创力文档

文档评论(0)