Closed-loop RL · 自研仿真

策略学会绕行,不是硬编码

下面这条轨迹,是强化学习策略在自研仿真里一步一步跑出来的:前方约 52 米处有静止障碍,策略自行决定「变道绕行 → 变道回原车道」。零碰撞、零人为干预。

决策:起步
0s / 0s
—
任务完成
0
碰撞次数
—
决策序列
强化学习
策略类型

数据来源:江御自研轻量仿真 · 闭环强化学习策略 · 20Hz 物理 / 5Hz 决策。轨迹为实测,未做任何美化。