← 全部演示 迷宫 多领域 GitHub 模型 English

贪吃蛇智能体 · 决策回放

这个回放由在合成贪吃蛇决策上从零训练的紧凑模型驱动。每一步,模型都在一次前向传播里 回答六道题:一道四选一的走法题、四个并行的安全布尔值、一道距离评分题。代码把移动概率 乘以安全概率,剔除会撞到自己和反向的走法,再取剩下的最大值——全程不解码任何输出 token。