郝建业,天津大学副教授,华为诺亚方舟决策与推理实验室主任,研究领域集中在强化学习和多智能体系统,在国内外顶级学术会议和期刊上发表论文100余篇,并获得ASE2019、DAI2019、CoRL2020等多项优秀论文奖。其团队的研究已成功应用于游戏AI、电子商务推荐、网络优化、供应链优化等多个领域。 报告题目:自监督强化学习 近年来,强化学习的研究取得了很大进展,但仍存在采样效率和可扩展性等问题,这极大地限制了其在实际应用场景中的广泛应用。强化学习的主要瓶颈在于对环境和策略的表征能力有限。在本次演讲中,我将介绍如何利用自我监督技术,从状态、策略、动作等不同方面提高强化学习的表述能力入手,最终提高学习效率和跨不同场景任务的可扩展性。 
|