着屏幕上的流程图,手指从最上面的感知输入一直划到底部的规划输出,
“规则逻辑处理常规工况,强化学习模型覆盖边界场景,两者协同工作。
今天的任务是规划算法的框架跑通。”
何晋看着屏幕上的流程图,手指在键盘上敲了几下调出了规则逻辑的细节。
“规则树现在覆盖了一百六十多个场景分支,剩下的那些边界情况交给强化学习模型去泛化。
但是奖励函数的设计怎么定?如果奖励函数偏重通行效率,模型可能倾向于激进的变道策略;
如果偏重舒适性,又可能在需要快速响应的时候动作太慢。”
陈峰调出奖励函数的设计文档,翻到中间那一页。
“奖励函数分了三个维度——安全性权重最高,占零点六;通行效率零点三;舒适性零点一。
安全性维度以碰撞时间的倒数为惩罚项,通行效率以平均速度为奖励项,舒适性以加加速度的绝对值作为惩罚项。
三个维度加权求和,权重比暂时不动,后面仿真跑起来之后再根据结果调。”
他说完在流程图旁边补充了几行注释,把奖励函数的计算公式写清楚,然后交给何晋去搭建模型框架。