← 全部演示 基准对比 多领域体验 GitHub English

可以拿来用的置信度

决策模型只有"置信度有意义"才有价值。这个页面使用 Qwen3-1.7B 头训练模型提交在仓库里的校准预测: 拖动阈值,就能看到模型能独自处理多少决策,以及这些决策的准确率。

自动决策 vs 升级人工

0.90

可靠性图

各置信度区间的实际准确率 完美校准线 区间样本量

风险–覆盖率曲线

自动决策的准确率 覆盖率

分来源

来源问题数准确率平均置信度