改进判别式深度Dyna-Q的任务对话策略学习方法
万方数据知识服务平台
应用市场
我的应用
会员HOT
万方期刊
×

点击收藏,不怕下次找不到~

@万方数据
会员HOT

期刊专题

10.12052/gdutxb.220122

改进判别式深度Dyna-Q的任务对话策略学习方法

引用
作为任务型对话系统中的关键一环,对话策略可以通过判别式深度Dyna-Q框架训练得到.然而,该框架在直接强化学习阶段采用原始的深度Q网络方法学习对话策略,在世界模型方面采用多层感知机作为模型的基本结构,导致对话策略的训练效率、性能和稳定性降低.本文提出了一种改进判别式深度Dyna-Q的任务对话策略学习方法.在改进后的直接强化学习阶段,利用噪声网络改进了智能体的探索方式,同时将竞争网络的双流架构、双Q网络与n步自举法三者相结合,优化了Q值的计算过程.在世界模型方面,设计了一种基于软注意力的模型替代多层感知机结构.实验结果表明,本文提出的方法在对话成功率、平均对话轮数以及平均奖励3个指标上均优于现有的最佳结果,最后本文通过消融分析和鲁棒性分析,进一步验证了方法的有效性.

任务型对话系统、对话策略学习、强化学习、用户模拟器

40

TP391(计算技术、计算机技术)

国家自然科学基金;广东省自然科学基金资助项目;顺德区核心技术攻关项目

2023-08-08(万方平台首次上网日期,不代表论文的发表时间)

共10页

9-17,23

相关文献
评论
暂无封面信息
查看本期封面目录

广东工业大学学报

1007-7162

44-1428/T

40

2023,40(4)

相关作者
相关机构

专业内容知识聚合服务平台

国家重点研发计划“现代服务业共性关键技术研发及应用示范”重点专项“4.8专业内容知识聚合服务技术研发与创新服务示范”

国家重点研发计划资助 课题编号:2019YFB1406304
National Key R&D Program of China Grant No. 2019YFB1406304

©天津万方数据有限公司 津ICP备20003920号-1

信息网络传播视听节目许可证 许可证号:0108284

网络出版服务许可证:(总)网出证(京)字096号

违法和不良信息举报电话:4000115888    举报邮箱:problem@wanfangdata.com.cn

举报专区:https://www.12377.cn/

客服邮箱:op@wanfangdata.com.cn