一种自适应概率规划规则抽取算法

来源 :南京大学学报：自然科学版 | 被引量 : 0次 | 上传用户：lpy2009

【摘要】

：

在已知状态迁移条件下,利用传统概率规划技术能够获得确定的规划规则.而强化学习技术能够在未知环境条件下,利用试错和奖赏函数在线学习动态环境的策略知识.因此一种自适应的

【作者】

：

高阳陆鑫李宁陈世福

【机构】

：

南京大学计算机软件新技术国家重点实验室

【出处】

：

南京大学学报：自然科学版

【发表日期】

：

2003年2期

【关键词】

：

自适应概率规划规则抽取算法强化学习 Beamsearch算法值函数规划模型 probabilistic planning reinforcement

【基金项目】

：

国家自然科学基金

下载到本地 , 更方便阅读

下载此文赞助VIP

声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架

论文部分内容阅读

在已知状态迁移条件下,利用传统概率规划技术能够获得确定的规划规则.而强化学习技术能够在未知环境条件下,利用试错和奖赏函数在线学习动态环境的策略知识.因此一种自适应的概率规划规则抽取算法被提出.该算法首先在强化学习获得的最优状态-动作对值函数基础上,通过迭代得到有折扣无奖赏的值函数和无折扣无奖赏的值函数.然后通过子规划剪枝将大于指定规划步数的子规划去除,并得到子规划剪枝后的状态-动作对值函数.最后通过Beam search算法从值函数中抽取满足概率规划条件的规划知识,从而在规划模型变化的条件下.也可以获得确

其他文献

长岭中学简介

长岭中学创建于1957年。原为长岭集团公司所属的一所在省市享有盛誉的名牌学校,1999年5月被陕西省教育厅命名为省级重点中学,2006年9月启用省级标准化高中称号。学校地处人杰

期刊

中学长岭集团公司文化底蕴陕西省标准化宝鸡市学校

布依族生物多样性相关传统知识的多样性分析及保护对策

原住民或少数民族积累的大量关于生物资源保护和利用的经验、技术和实践知识,通常被称为传统知识,这些传统知识在人类生产生活中体现出许多现代知识所不能替代的价值。本研究

期刊

布依族传统知识生物资源保护与传承Buyi nationalitytraditional knowledgebiological resourcespro

模糊神经网络分析方法用于心肌缺血诊断的研究

介绍一种神经网络-模糊推理协作系统.神经网络有很好的学习能力和准确拟合任意非线性函数的能力.模糊模型将专家知识转换到神经网络中,然后把它应用于诊断系统,从而使得心血

期刊

模糊神经网络心肌缺血心电图诊断模糊模型fuzzy neural network myocardial ischemia electrocardio

如何抓好农村校园的班级文化建设

校园的整体文化特色离不开各级各班的文化创新，而各具亮点的班级文化又为校园文化的多姿多彩增添了亮丽，从目前农村基础教育条件来看，部分地区由于受硬件设施落后，地方观念保守等

期刊

校园文化建设班级文化建设农村学校地方教育事业班级文化氛围教育条件综合素质文化创新

智慧理答，有效课堂

课堂是教师耕耘的土地，相信上一堂好课是我们共同的追求。那么，在课堂中，面对一个个鲜活的个体，教师常常会措手不及。如何更好地应对这种课堂上的意外，我们除了精心准备预设外，更要

期刊

理答智慧课堂效率

一种自适应概率规划规则抽取算法

与本文相关的学术论文