奖励如何改变动作
绿线:训练集动作准确率 · 蓝线:实际采样奖励。先固定训练轮数,再做一次留出评估。
这个实验说明什么
这是一个简单的两选一反射任务。学到的是外部读出,不是果蝇突触可塑性。关卡之间重置神经状态;留出集改变刺激强度与干扰,尚未证明复杂游戏中的泛化能力。
画面是保存下来的真实实验动作的示意回放。80ms 的神经反应被放慢展示,页面不会连接或租用 GPU,也不在浏览器里重新训练。
可选 CUDA 后端已在 A16-2Q 上通过 12 项硬件测试。小回路 CPU 约 0.108 秒、CUDA 约 2.640 秒 / 模拟秒;当前 GPU 实现验证了兼容性,并未加速。0.5 alpha 包含可选 CUDA 支持,默认 CPU 安装无需 NVIDIA 设备。