自动决策 vs 升级人工
0.90
可靠性图
各置信度区间的实际准确率
完美校准线
区间样本量
风险–覆盖率曲线
自动决策的准确率
覆盖率
分来源
| 来源 | 问题数 | 准确率 | 平均置信度 |
|---|
← 全部演示 基准对比 多领域体验 GitHub English
决策模型只有"置信度有意义"才有价值。这个页面使用 Qwen3-1.7B 头训练模型提交在仓库里的校准预测: 拖动阈值,就能看到模型能独自处理多少决策,以及这些决策的准确率。
| 来源 | 问题数 | 准确率 | 平均置信度 |
|---|