多数系统太早把概率压扁成标签。0.51 与 0.99 的结果可能都变成「是」,尽管它们不该拥有同等的权威。分布应当改变执行框架接下来做什么。
有用的策略有三个运行区间:高置信度加低后果,可以自动执行声明的分支;中置信度应当去改进状态——收集证据、运行确定性检查、收窄选项,或咨询更强的模型;低置信度或高后果,应当升级。
| 后果 | 置信度 | 路由 |
|---|---|---|
| 低 | ≥ 0.90 | 自动执行声明分支 |
| 低或中 | 0.70 – 0.89 | 收集证据或运行检查 |
| 任意 | < 0.70 | 人工审查 |
| 不可逆 | 任意 | 人工审查 |
同一个置信度不应同时控制内部队列与公开声明。阈值属于后果等级,而不仅仅属于输出类型。不可逆动作可以在任何置信度下都保持审查门禁。
中置信度路由应当说明状态将如何改进:再取一个来源、核实一个文件、运行一次权限检查、向用户提出一个精确的问题,或收窄选项集。不改变下一步动作的置信度只是装饰。
在证据不变的情况下反复评估,会制造虚假安心——几个相似的输出看起来像共识。重试预算应当用来购买信息,而不是对同一份不确定性再采样一次。
阈值是生产配置。记录它的负责人、依据、评估窗口、后果等级与回滚条件。一个从小演示集里选出来的阈值,绝不应悄悄变成永久策略。
监控每个阈值附近落了多少流量。大量流量紧贴自动化边界上方,会让系统对微小的校准漂移极其敏感。这种情况下,应先改进契约或放宽审查区间,再谈提高自主性。
校准问的是:被预测为某个概率的事件,在目标工作负载上是否大致以该频率发生。可靠性图(reliability diagram)把决策按置信度分箱,比较预测置信度与实测正确率。完美校准落在对角线上;曲线在对角线下方表示过度自信,上方表示自信不足。自动化能否成立,取决于更高的置信度是否真的识别出更安全的样本。
对二元 Noul 决策,Brier 分数度量概率与结果之间的平方误差。对 Choice,top-label 或按类别(classwise)的校准可以暴露那些系统性过度或不足自信的罕见选项。按契约版本、后果等级、语言与罕见选项切分指标——全局平均值可能恰好藏住最重要的那条分支。
即使校准良好的分布也仍然只是预测。策略、预算、允许清单、用户审批与确定性检查依然在下游。校准让自动化变得可度量;它不会把权限转移给模型。
校准应当先在影子模式中估计,自动化之后再复查,并在契约或状态 schema 发生重大变更后重新计算。置信度以工作负载为条件——把同一个契约迁移到新语言、新产品域或新用户群,可能让之前的曲线作废。
有选择但一致地使用人工标注:对罕见、高后果与贴近阈值的样本过采样。只用随机样本,可能得到一个令人安心的总体指标,却让自动化边界处于测量不足的状态。