下面这条轨迹,是强化学习策略在自研仿真里一步一步跑出来的:前方约 52 米处有静止障碍,策略自行决定「变道绕行 → 变道回原车道」。零碰撞、零人为干预。
数据来源:江御自研轻量仿真 · 闭环强化学习策略 · 20Hz 物理 / 5Hz 决策。轨迹为实测,未做任何美化。