WORM-LIKE × R-STDP

7×7 Snake 神经系统实验

固定一次训练结果 · 8 个未见测试种子 · 每次 10,000 动作

跨测试种子表现

食物 − 碰撞;越高越好。圆点表示每个测试种子。

三种模型的跨测试种子表现 每行显示一个模型的均值、标准差和八个测试结果。

完整指标

均值 ± 样本标准差;前三项单位为每 10,000 动作。

R-STDP: 14,112 可塑突触;Full-BP: 14,685 参数;DQN: 14,111 参数
模型进食碰撞 ↓净收益平均蛇长最大蛇长

训练后运行回放

三个 checkpoint 从同一测试环境开始;各模型随后独立运行。

测试环境 seed 2000003 · 360 动作