2026 Jev 工程实践工作手册 · 第九章 第 10 页 / 共 12 页 · 返回目录
SECTION Ⅸ

评估与生产运维

Evaluation and Production Operations
Evaluation and Operations · 评估与运维
原版式注:双栏页,阅读顺序为左栏 → 右栏,章节字母按栏编号。

A.评估是持续过程Evaluation Is Continuous

对 Jev 系统的评估不是上线前跑一次的基准测试。工作负载会漂移、选项会变化、模型会更新、用户会找到你没预料到的措辞。评估是绑定在回执上的运维回路。

跟踪三个层次:契约在带标注 fixture 上的准确率;在实时影子流量上的校准;自动化分支的结果指标——人工改判率、事故率、用户纠正率。

层次之间的分歧会告诉你去哪儿看。fixture 准确率良好而实时校准糟糕,说明 fixture 已不再代表真实流量。

B.Fixture 与黄金集Fixtures and Golden Sets

为每个契约版本维护黄金集:正常情况、对抗性措辞、陈旧状态、证据缺失、「以上都不是」。fixture 是不可变快照,附期望路由与理由。

从生产故障中扩充黄金集。每次事故都应在修复上线之前添加一个回归 fixture。钉不进 fixture 的修复是传说,不是工程。

运维工件用途
黄金集契约回归
回执存储校准与审计
影子运行部署前证据
金丝雀队列限制爆炸半径
改判日志标注流水线
表 Ⅸ 每种工件回答一个不同的运维问题。
Table IX. Each artifact answers a different operational question.

C.影子模式与金丝雀Shadow Mode and Canary

影子模式让新契约在实时流量上运行但不执行动作。把路由、置信度与回执同现行版本对比;只有差异可解释时才发布。

金丝雀随后给新契约一小片真实权限。按切片盯住改判率与事故率,并在上线之前——而不是事故之中——定义自动回滚条件。

D.人在回路Human-in-the-Loop

人工审查是一条路由,不是失败。把审查队列当产品来设计:展示状态包、概率分布与那个具体的问题。看不见证据的审查者只会盖橡皮章。

把审查者的纠正捕获为标注——这是你能得到的最便宜的高质量校准数据。闭合回路:纠正进入黄金集,并触发阈值复审。

E.成本与延迟预算Cost and Latency Budgets

每条分支都有预算:token、调用次数、墙钟时间、用户可见延迟。把预算声明在契约里,策略才能在超支前降级模型或升级人工,而不是悄悄爆掉。

度量每个已解决决策的成本,而不是每次调用的成本。一个便宜模型若带来 40% 的升级率,算上人工审查时间,可能比升级率 5% 的强模型更贵。

F.安全边界Security Boundaries

Jev 系统继承智能体的安全面:经由证据的提示注入、经由工具的数据外渗、经由路由的权限升级。把每个状态字段都当作决策的不可信输入。

机密不进状态包;工具参数做确定性校验;语义选择只能从声明的选项中挑选,永远不能合成命令。

G.运维清单The Operations Checklist

上线前:契约已版本化、按后果等级校准的阈值、黄金集、影子证据、金丝雀计划、回滚条件、预算、回执接线完毕。

运行中:监控校准漂移、改判聚集、贴近阈值的流量、预算消耗;对照回执复盘事故并补 fixture。

变更时:重跑黄金集、重估校准、再走金丝雀。模型、契约、阈值的每次变更都是一次发布——哪怕应用代码一行未动。

← 上一页Ⅷ · 智能体与多智能体模式