主要技术内容
1主要要求1.1 环境要求对不同的应用场景进行梳理,提供具有通用接口设计的仿真环境,允许比较不同的强化学习算法。并通过仿真环境测试实际系统。具体包括:环境的使用方式,环境对外统一的自定义接口规范等。1.2 观察强化学习是典型的“智能体-环境”循环实现,交互时智能体选择一个行动,环境返回一个观察和奖励值。1.3 空间用来描述有效的动作和观察,是环境的属性,智能体与环境交互时可以直接根据环境提供给系统的接口进行交互。1.4 策略策略的输入为状态和动作,并返回在输入状态的情况下采取输入动作的概率。2 运行设计2.1 环境配置环境配置主要是对初始状态的基本环境信息进行配置,有加区分对不同状态进行学习和挖掘,提升强化学习算法实验的结果。2.2 可视化展示实时可视化展示当前场景的相关环境信息,便于开发人员观察效果,并对算法进行相应的调优工作。2.3 交互规范智能体与环境进行交互可分为两类:人机交互和自动交互。a) 人机交互, 人根据系统设计相应的交互方式和系统进行交互,而机器则直接依据智能算法生成相应的策略进行输出,并在界面上动态显示