METHOD 方法与工具

规则评测与发布门禁:让每次变更都能被回放

建立固定数据集、分群指标、新旧版本差异、审批与回滚记录,为规则学习和规则进化提供共同发布底座。

本页目录 5 节
  1. 固定评测输入
  2. 比较新旧版本
  3. 评测报告也是证据
  4. 发布门禁
  5. 运行后的观察

没有评测中心,规则学习只能证明“生成了一条规则”,规则进化也只能证明“提出了一个建议”。它们都无法回答更重要的问题:新版本相对旧版本改变了哪些结果,风险是否可接受。

固定评测输入

评测数据集需要版本化,包含正常、违规、边界、例外、缺失字段和异常附件等样本。每条样本保留脱敏状态、金标来源、适用组织与规则版本。

训练、验证和回放窗口按业务时间切分,避免把未来信息泄漏到候选生成过程。

比较新旧版本

每次运行同时保存基线版本和候选版本结果,逐例列出新增命中、取消命中与结果不变。总体准确率之外,还需要按组织、场景、金额区间和风险级别查看最差分群。

对于刚性违规,召回率不得下降;对于误报优化,不能以扩大漏报为代价。平均值只是一层视图,最差分群决定是否可以发布。

评测报告也是证据

一份可审批的报告应包含数据集版本、规则差异、指标、逐例差异、失败原因、模型与提示版本,以及仍未解决的假设。报告必须能回到原始样本和具体证据。

发布门禁

低影响变更可以采用单人复核和短观察期;涉及资金、合同、发票、刚性阻断和风险等级的变更,需要更高审批等级、影子运行和回滚准备。

发布动作生成不可变版本,记录审批意见、生效时间、依赖版本和使用范围。业务方案引用明确版本,而不是永远跟随“最新规则”。

运行后的观察

发布不是终点。观察期持续跟踪命中、人工终局、处置时长、异常分群和系统成本。超过阈值时触发调查或回滚建议,并保留当时的执行版本。

评测与发布门禁让规则资产拥有与代码相似的可测试、可发布和可回退能力,也让大模型建议停留在候选层,直到证据足够支持正式变化。

REVISION

发布与更新记录

首次发布
2026年8月4日
公开复核
2026年8月5日