← 全部演示 决策控制台 多领域体验 GitHub 模型 English

迷宫智能体 · 决策回放

这个回放由在合成迷宫决策上从零训练的 547k 紧凑模型驱动——旗舰 Qwen3-1.7B 头训练的结果在 基准对比页。每一步,模型都在一次前向传播里回答九道题: 一道四选一的走法题、四道并行的安全判断题、一道距离打分题。代码把走法概率乘以安全概率、 剔除会撞墙的走法,再取剩下的最大值。