对 Jev 系统的评估不是上线前跑一次的基准测试。工作负载会漂移、选项会变化、模型会更新、用户会找到你没预料到的措辞。评估是绑定在回执上的运维回路。
跟踪三个层次:契约在带标注 fixture 上的准确率;在实时影子流量上的校准;自动化分支的结果指标——人工改判率、事故率、用户纠正率。
层次之间的分歧会告诉你去哪儿看。fixture 准确率良好而实时校准糟糕,说明 fixture 已不再代表真实流量。
为每个契约版本维护黄金集:正常情况、对抗性措辞、陈旧状态、证据缺失、「以上都不是」。fixture 是不可变快照,附期望路由与理由。
从生产故障中扩充黄金集。每次事故都应在修复上线之前添加一个回归 fixture。钉不进 fixture 的修复是传说,不是工程。
| 运维工件 | 用途 |
|---|---|
| 黄金集 | 契约回归 |
| 回执存储 | 校准与审计 |
| 影子运行 | 部署前证据 |
| 金丝雀队列 | 限制爆炸半径 |
| 改判日志 | 标注流水线 |
影子模式让新契约在实时流量上运行但不执行动作。把路由、置信度与回执同现行版本对比;只有差异可解释时才发布。
金丝雀随后给新契约一小片真实权限。按切片盯住改判率与事故率,并在上线之前——而不是事故之中——定义自动回滚条件。
人工审查是一条路由,不是失败。把审查队列当产品来设计:展示状态包、概率分布与那个具体的问题。看不见证据的审查者只会盖橡皮章。
把审查者的纠正捕获为标注——这是你能得到的最便宜的高质量校准数据。闭合回路:纠正进入黄金集,并触发阈值复审。
每条分支都有预算:token、调用次数、墙钟时间、用户可见延迟。把预算声明在契约里,策略才能在超支前降级模型或升级人工,而不是悄悄爆掉。
度量每个已解决决策的成本,而不是每次调用的成本。一个便宜模型若带来 40% 的升级率,算上人工审查时间,可能比升级率 5% 的强模型更贵。
Jev 系统继承智能体的安全面:经由证据的提示注入、经由工具的数据外渗、经由路由的权限升级。把每个状态字段都当作决策的不可信输入。
机密不进状态包;工具参数做确定性校验;语义选择只能从声明的选项中挑选,永远不能合成命令。
上线前:契约已版本化、按后果等级校准的阈值、黄金集、影子证据、金丝雀计划、回滚条件、预算、回执接线完毕。
运行中:监控校准漂移、改判聚集、贴近阈值的流量、预算消耗;对照回执复盘事故并补 fixture。
变更时:重跑黄金集、重估校准、再走金丝雀。模型、契约、阈值的每次变更都是一次发布——哪怕应用代码一行未动。