第622章 行人识别的准确率达到了设计目标 首页

字体:      护眼 关灯

上一页 目录 下一章

第622章 行人识别的准确率达到了设计目标(3/3)

着屏幕上的流程图,手指从最上面的感知输入一直划到底部的规划输出,

“规则逻辑处理常规工况,强化学习模型覆盖边界场景,两者协同工作。

今天的任务是规划算法的框架跑通。”

何晋看着屏幕上的流程图,手指在键盘上敲了几下调出了规则逻辑的细节。

“规则树现在覆盖了一百六十多个场景分支,剩下的那些边界情况交给强化学习模型去泛化。

但是奖励函数的设计怎么定?如果奖励函数偏重通行效率,模型可能倾向于激进的变道策略;

如果偏重舒适性,又可能在需要快速响应的时候动作太慢。”

陈峰调出奖励函数的设计文档,翻到中间那一页。

“奖励函数分了三个维度——安全性权重最高,占零点六;通行效率零点三;舒适性零点一。

安全性维度以碰撞时间的倒数为惩罚项,通行效率以平均速度为奖励项,舒适性以加加速度的绝对值作为惩罚项。

三个维度加权求和,权重比暂时不动,后面仿真跑起来之后再根据结果调。”

他说完在流程图旁边补充了几行注释,把奖励函数的计算公式写清楚,然后交给何晋去搭建模型框架。


本文链接:https://m.wenjingbook.com/a/831_831691/971650_3.html

上一页 目录 下一章