2026 Jev 工程实践工作手册 · 第五章 第 6 页 / 共 12 页 · 返回目录
SECTION Ⅴ

置信度、后果与校准

Confidence, Consequence, and Calibration
Confidence and Calibration · 置信与校准
原版式注:双栏页,阅读顺序为左栏 → 右栏;章节字母按栏编号,本页出现两个 C 节,保留原编号。图 2 已按原 PDF 矢量图重绘为 SVG。

A.置信度是路由信号Confidence Is a Routing Signal

多数系统太早把概率压扁成标签。0.51 与 0.99 的结果可能都变成「是」,尽管它们不该拥有同等的权威。分布应当改变执行框架接下来做什么。

有用的策略有三个运行区间:高置信度加低后果,可以自动执行声明的分支;中置信度应当去改进状态——收集证据、运行确定性检查、收窄选项,或咨询更强的模型;低置信度或高后果,应当升级。

后果置信度路由
≥ 0.90自动执行声明分支
低或中0.70 – 0.89收集证据或运行检查
任意< 0.70人工审查
不可逆任意人工审查
表 Ⅴ 阈值仅为示例,必须按动作类别分别校准。
Table V. Thresholds are illustrative and must be calibrated per action class.

同一个置信度不应同时控制内部队列与公开声明。阈值属于后果等级,而不仅仅属于输出类型。不可逆动作可以在任何置信度下都保持审查门禁。

B.改进状态Improving the State

中置信度路由应当说明状态将如何改进:再取一个来源、核实一个文件、运行一次权限检查、向用户提出一个精确的问题,或收窄选项集。不改变下一步动作的置信度只是装饰。

在证据不变的情况下反复评估,会制造虚假安心——几个相似的输出看起来像共识。重试预算应当用来购买信息,而不是对同一份不确定性再采样一次。

C.阈值治理Threshold Governance

阈值是生产配置。记录它的负责人、依据、评估窗口、后果等级与回滚条件。一个从小演示集里选出来的阈值,绝不应悄悄变成永久策略。

监控每个阈值附近落了多少流量。大量流量紧贴自动化边界上方,会让系统对微小的校准漂移极其敏感。这种情况下,应先改进契约或放宽审查区间,再谈提高自主性。

C.校准Calibration

校准问的是:被预测为某个概率的事件,在目标工作负载上是否大致以该频率发生。可靠性图(reliability diagram)把决策按置信度分箱,比较预测置信度与实测正确率。完美校准落在对角线上;曲线在对角线下方表示过度自信,上方表示自信不足。自动化能否成立,取决于更高的置信度是否真的识别出更安全的样本。

0 1 0 1 预测置信度 PREDICTED CONFIDENCE 准确率 ACCURACY 理想校准 过度自信 自信不足
图 2 可靠性要在带标注的工作负载数据上评估,而不是从自信的措辞里推断。Fig. 2. Reliability is evaluated on labeled workload data, not inferred from confident language.

D.校准指标Calibration Metrics

对二元 Noul 决策,Brier 分数度量概率与结果之间的平方误差。对 Choice,top-label 或按类别(classwise)的校准可以暴露那些系统性过度或不足自信的罕见选项。按契约版本、后果等级、语言与罕见选项切分指标——全局平均值可能恰好藏住最重要的那条分支。

E.置信度不是权限Confidence Is Not Authority

即使校准良好的分布也仍然只是预测。策略、预算、允许清单、用户审批与确定性检查依然在下游。校准让自动化变得可度量;它不会把权限转移给模型。

F.校准的上线方式Calibration Rollout

校准应当先在影子模式中估计,自动化之后再复查,并在契约或状态 schema 发生重大变更后重新计算。置信度以工作负载为条件——把同一个契约迁移到新语言、新产品域或新用户群,可能让之前的曲线作废。

有选择但一致地使用人工标注:对罕见、高后果与贴近阈值的样本过采样。只用随机样本,可能得到一个令人安心的总体指标,却让自动化边界处于测量不足的状态。

← 上一页Ⅳ · 状态包与证据