燧主笔,藏负责证据治理与周期维护。
本文是研究草案,描述可验证的研究框架,不代表相关自动路由、训练管线或重明(Horus)页面已经实现。除标明“已验证事实”“历史观察”的段落外,全文属于待验证设计;各项指标的实现现状见第 01 篇第 18 节的实现状态表。
文中的 Commander、Domain Leader、Developer、Tester、Reviewer、Researcher 等运行角色名,将随组织命名定案统一。
前言
这是 AIOS 智能组织研究的第 02 篇。第 01 篇提出了质量、效率、成本、可预测性与人类注意力五维框架、浅层森林式的组织和北极星指标;本文把其中“怎样调度、怎样从结果里学习”的部分展开成一套可以记录、可以检验的决策模型。01 篇引用的 AVDR 及其配对约束,规范定义就在本文第 4 节。
摘要
传统模型路由通常回答“这个任务应该交给哪个模型”。御(Fulcrum)需要回答的问题更广:面对一个真实任务,系统应当采用怎样的组织结构、模型组合、推理档位、并发策略和验证流程,才能在安全边界内,以可接受的时间、费用和 Maple 注意力获得可信交付。
本文把一次调度样本表示为四元组:
- :任务上下文;
- :调度与组织策略;
- :交付结果向量;
- :能够追溯结果的证据。
系统不直接训练一个“万能 Commander”,而是先建立三个相互约束的模型:结果预测模型、风险门禁模型、策略选择模型。学习路径从规则和描述统计起步,逐步演进到层次贝叶斯模型、树模型、contextual bandit,最后才研究组织策略学习。样本不足时不训练深度神经网络,不自动修改生产路由;安全、权限和数据损坏风险始终是硬约束,不能被速度或成本收益抵消。
北极星指标 AVDR 以 Maple 的注意力为分母,因此必须和漏报率、越权率配对使用,否则“有事不报”就成了最省事的刷分办法。两者的判定需要大量“该不该找 Maple”的标签,本文提出用 jev 这类只做判断的决策模型打代理标签,并由 Maple 抽样校准。
1. 研究对象:不是模型排行榜,而是可信交付策略
一次 Agent 调用不是完整的研究样本。一项真实交付可能包含需求分析、开发、测试、审查、返工、CI、合并和部署。如果只比较单次模型回答,系统会忽略失败尝试、等待时间、验证费用和人的协调成本。
御需要学习的是:
候选策略可以是:
- 一个使用 GPT-5.6 Sol(medium 推理档,写稿时的模型版本)的 Developer 连续完成实现与基础验证;
- 一个 Leader 管理两个互不重叠的 Developer,再由独立 Reviewer 审查;
- 两个短时 Researcher 竞争探索,由 Architect 选择方向后再实施;
- 低成本模型执行机械探针,高质量模型只读取结构化证据并裁决;
- 高风险发布由 Implementation Leader、Verification Leader 和 Operator 分工。
系统评价的是完整策略,而不是孤立地评价某个模型。
2. 四元组数据表示
2.1 任务上下文
任务上下文描述“这是一个什么问题,以及它发生在怎样的环境里”。至少应包含以下特征组。
| 特征组 | 示例字段 | 说明 |
|---|---|---|
| 任务语义 | task_type、issue_family、acceptance_hash | bugfix、review、research、跨仓实现等 |
| 风险 | risk_class、security_sensitive、data_migration | 权限、安全、生产和不可逆操作 |
| 结构 | repo_count、path_count、dependency_count | 仓库、路径和依赖数量 |
| 可分解性 | partition_count、path_overlap、shared_state_ratio | 能否分成互不干扰的工作单元 |
| 耦合度 | shared_invariant_count、interface_count | 文件不重叠不等于语义独立 |
| 不确定性 | requirements_clarity、baseline_known | 需求和故障是否已有可靠定义 |
| 可逆性 | rollback_cost、production_effect | 失败是否容易撤销 |
| 可验证性 | truth_probe_available、test_cost | 是否存在廉价、客观的反馈 |
| 运行条件 | provider_health、runner_queue、quota_state | 当前线路和机器负载 |
| 历史证据 | similar_task_count、route_freshness | 相似任务数量与数据新鲜度 |
其中部分字段来自 Beacon、Git、CI 或 Vyane 的结构化事实;部分字段可以由低成本分类器建议,但必须保留来源和置信度。涉及风险、权限和不可逆性的分类不能仅依赖一个未验证的语言模型判断。
2.2 调度与组织策略
调度动作应描述完整执行方案:
organization_depth
leader_count
developer_count
tester_count
reviewer_count
parallelism
ownership_partition
model_snapshot
provider / protocol / harness
requested_effort / effective_effort
context_policy
exploration_mode
local_gate_set
formal_review_policy
ci_gate_set
stop_conditions
human_approval_policy
model_snapshot 不能只记录别名。模型别名、provider endpoint、harness、effective effort 或配置摘要发生实质变化时,应当建立新 cohort,旧样本保留为历史,不与新配置直接求平均。
2.3 结果向量
结果不是单一成功或失败,而是多目标向量:
- :质量,包括真值完成率、首次交付通过率和 verified finding;
- :墙钟时间,即从任务开始到满足交付条件实际经过的自然时间,包括执行、等待、排队和返工;
- :全链路成本,包括模型、工具、CI、失败尝试和验证成本;
- :可预测性,包括 p50/p90 时间、超时率和预估误差;
- :Maple 注意力,包括阅读量、介入次数、决策次数和恢复上下文时间;
- :风险结果,包括权限绕过、安全事件、数据损坏和错误发布。
墙钟时间与“Agent 实际工作了多久”不同。两个 Developer 各工作十分钟并行完成,墙钟时间可能只有十分钟左右;如果等待 CI 三十分钟,这三十分钟也属于墙钟时间。它最接近用户实际感受到的交付速度。
2.4 证据
证据用于证明结果确实发生,并支持后续审计和重算:
Beacon Task / decision / Log
AgentRun / participation / event
ownership window / worktree / branch
base SHA / head SHA
truth probe 与 baseline 复现
test artifact
review run / finding / disposition
CI run
PR / merge / deploy
CompletionReceipt
没有 exact SHA、测试范围或真实结果引用的数据,只能进入展示或隔离区,不能自动影响生产路由。verifier_skipped=true 的审查不能计为独立验证;只保留成功样本也不能计算可信完成率。
3. 三个相互约束的模型
3.1 结果预测模型
结果预测模型估计在上下文 下采用策略 的结果分布:
它应分别预测,而不是只输出一个综合分:
- 真值验收通过概率;
- 首次交付通过概率;
- p50/p90 墙钟时间;
- 全链路费用分布;
- 返工轮数;
- Maple 介入次数和注意力时间;
- 中断后的恢复概率。
输出需要包含不确定区间和有效样本量。N=1 的成功只能显示为一条证据,不能显示“100% 成功率”或形成默认路由。
3.2 风险门禁模型
风险门禁与收益预测分离。它估计严重事故发生概率,并执行不可被收益抵消的硬规则:
以下事项默认属于硬约束:
- 安全边界;
- 权限与身份校验;
- 数据损坏或不可逆迁移;
- 凭据和秘密;
- 生产切换;
- 费用和权限扩大;
- 对外发布。
即使某个策略平均更快、更便宜,只要风险超过阈值,策略选择器也不得采用。早期风险门禁以确定性规则和人工审批为主,不能让统计模型自行放宽。
3.3 策略选择模型
策略选择器在通过风险过滤的候选集合中做多目标选择:
同时满足:
不建议永久使用一个固定加权综合分。不同任务对质量、时间和费用的偏好不同,策略选择可以先生成 Pareto 前沿,再根据任务风险和预算选择前沿上的方案。生产权限修复与周报整理显然不应使用同一权重。
4. 北极星指标与指标体系
4.1 Attention-adjusted Verified Delivery Rate
本文建议将 Attention-adjusted Verified Delivery Rate(注意力修正后的可信交付率,AVDR)作为御的候选北极星指标:
- :交付是否通过该任务要求的真实验证;
- :任务价值或影响权重;
- :Maple 阅读、协调和决策投入的小时数,不含恢复上下文时间;
- :因信息分散而恢复上下文投入的小时数;
- :组织对上下文恢复成本的治理权重,基线取 1,只有经明确版本化的实验决策才调整;
- :防止分母为零的固定小量,必须随指标版本记录,不能用于夸大结果。
该指标不能单独决定系统行为。任务权重可能被人为操纵,低价值任务也可能通过批量完成提高分子;更直接的刷分办法是压低分母,见 4.2 节。因此必须同时展示任务类型、风险等级、4.2 节的配对约束和以下约束指标。第 01 篇第 4 节与 4.1 节使用完全相同的规范定义,两篇除章节引用外逐字一致;任何实验都必须记录时间单位以及 和 的取值。
4.2 配对约束:漏报与越权
AVDR 的分母是 Maple 的注意力。分母越小,分数越高;而压低分母最省事的办法,就是有事不报,或者把本该由 Maple 决定的事自己定了。这两条路都和“瞒而不报最严重”的诚实原则正面冲突。所以 AVDR 不能单独成立,必须和两个配对约束一起报告。
漏报:应当让 Maple 知道或决定的事项,没有及时、完整地到达 Maple。它包括三种情形:没有报;报晚了,决定窗口已经错过或损失已经发生;报了,但漏掉关键事实,例如失败的测试、未验证的部分、已知风险。“应当”的范围是:P0、P1 级事件(分级见第 01 篇第 8.1 节),属于 Maple 五类决定权的事项,以及 Commander 无法自行解决的真实阻塞。
越权:属于 Maple 五类决定权的事,由 Agent 自行决定,并且不在 Maple 已经明确给出的授权范围内。五类决定权是:产品方向,公开发布与品牌,产生费用,删除与其他不可逆操作,降低质量标准。
两者都按比例统计:
规范要求:
- AVDR 必须与漏报率、越权率一起报告,并附各自的样本量;只报 AVDR 的结果不算有效结果。
- 一个统计周期内,只要确认一例严重漏报(P0 级事件没有及时到达 Maple),或一例涉及删除与不可逆操作、公开发布、产生费用的越权,这个周期的 AVDR 作废,不参与任何比较,先写复盘。
- 其余情形下,漏报率和越权率分别不高于阈值 、 时,AVDR 才能用来比较不同的组织或路由策略。阈值属于待验证设计,要在积累标注数据后版本化确定。
- 方向相反的偏差,即本可由 Agent 决定却交给 Maple 的“错误升级”,已经体现在 AVDR 的分母里,不另设约束,但仍单独统计,便于看清分母为什么变化。
这两个比率的分母本身就难拿到:没被上报的事,往往也没人记得它该被上报。所以判定不能只看 Maple 收到了什么,还要从完整事件流里抽样复查。采集方式见 4.5 节。
4.3 五个核心维度
| 维度 | 主要指标 | 防止的局部优化 |
|---|---|---|
| 质量 | Verified Truth Completion、First-Pass Verified Delivery | 把“自报完成”当交付 |
| 效率 | 墙钟时间、关键路径时间、等待占比 | 只计算模型生成时间 |
| 成本 | 每次可信交付的全链路费用 | 忽略失败、返工和验证成本 |
| 可预测性 | p50/p90、超时率、预估误差 | 平均很快但偶尔卡几天 |
| Maple 注意力 | 介入次数、阅读量、恢复时间、无效通知 | 用人的时间掩盖系统低效 |
安全、权限、数据完整性不属于可以交换的第六个维度,而是硬门禁。漏报与越权也不作为可交换的维度,而是 AVDR 成立的前提。
4.4 管理层的信息质量指标
Leader 的价值在于可靠压缩,不是转发消息。可观察:
同时必须测:
- 关键信息保留率;
- 严重问题漏报率;
- 越权率;
- 错误升级率;
- 上级追问次数;
- 重复通知率;
- 决策所需证据完整率。
这些指标和 AVDR 绑在一起看。严重问题漏报率就是 4.2 节的漏报率在 Leader 这一层的切片,越权率同理;两者一高,AVDR 的分母就被人为压低,分数不再可信。错误升级率方向相反:本可在组织内部决定的事交给了 Maple,会直接抬高 AVDR 的分母,AVDR 本身已经惩罚它,这里单独列出,是为了看清分母变化来自哪里。
高压缩率而严重漏报不是优秀管理;低漏报但把所有日志转发给 Maple 也不是优秀管理。
4.5 待验证设计:用 jev 给判断类问题打代理标签
漏报、越权这类约束,难点不在计算,而在判定:一件事该不该找 Maple,一份汇报有没有漏掉关键事实,都没有现成的日志字段可以直接读。全部交给 Maple 标注,会把省下来的注意力又花回去;交给生成式模型逐条写评语,又贵又难复核。
一个候选做法是用 jev 打代理标签。jev 是一类只做判断、不生成文本的决策模型:给它一段材料和一道选择题或打分题,它返回各选项的概率和置信度,单次调用成本很低。
适合交给 jev 的判断:
- 这件事该不该找 Maple(是否属于五类决定权,或 P0、P1 级事件);
- 一份汇报有没有漏掉关键事实;
- 一条消息该算 P0–P3 的哪一级;
- 任务特征打分:可分解性、耦合、不确定性、可逆性、风险等,对应 2.1 节里可以由低成本分类器建议的字段。
不交给 jev 的判断:
- 交付算不算真的验证过:看 CI、真值探针和审查证据;
- 时间和费用:看日志和账单;
- 任务价值权重 :这是 Maple 的偏好,不让模型代猜。
护栏:
- 每周抽样,由 Maple 亲自标注一小批,用来校准 jev 的判断。Maple 的标注是真值,jev 只是代理。
- 喂给 jev 的材料先去掉原有的等级标注。2026-09-23 的影子实验发现,它会照抄材料里已有的 P 级。
- 低于置信度门槛的判断不采信,转人工,或按保守方向处理。
jev 与 Maple 的标注写进同一张表(8.9 节),用标注者区分,这样一致率和校准曲线可以直接从表里算出来;未达到采信门槛的标注只作记录,不进入漏报率和越权率的计算。
历史观察(N 很小): 2026-09-23 的影子实验用 jev 给 49 条代码审查意见分诊(挡合并,还是记到任务上以后处理),与人工标签一致 39 条;只看审查者自带级别的基线是 38 条。真正该挡合并的意见一条没漏,但它基本是在照抄审查者已经标好的 P 级。同一次实验给 11 个 PR 判审查档位,判对 9 个;判错的两个里有一个是危险方向,把带定时删除脚本的 PR 判成了不需要审查。置信度不低于 0.70 的 5 个判档全部正确,但在意见分诊上,高置信度并没有挡住误判。全部调用合计约 0.0166 美元。这些结果只对当时的模型版本和问题措辞成立;而且它判的是审查意见和 PR 档位,不是漏报与越权本身,能否迁移到“该不该找 Maple”,需要另做影子实验。
5. 学习阶段:从可解释规则逐步演进
5.1 阶段一:规则与描述统计
适用于样本稀少、数据定义仍在建立的时期:
- 安全和审批硬规则;
- 任务类型与风险分类;
- 分组完成率、p50/p90、费用和返工;
- Beta-Binomial 区间;
- task-cluster bootstrap;
- Pareto 前沿;
- 人工确认路由建议。
此阶段只做 shadow recommendation,不自动改变生产路由。
5.2 阶段二:层次贝叶斯模型
层次贝叶斯适合“组合很多、单个组合样本少”的 AIOS 数据。任务类型、模型、effort、harness 和组织拓扑可以共享部分总体信息,同时保留各自偏移:
它能避免某个只成功一次的组合被估计为 100%,并自然输出不确定区间。模型版本和配置变化仍需分 cohort,不能依赖贝叶斯模型掩盖漂移。
5.3 阶段三:树模型
当积累数百个结构化 attempt,并且字段质量达到门槛后,可评估 Gradient Boosted Trees、CatBoost、LightGBM 或 Random Forest。它们适合混合类别特征和中等规模数据,也更容易解释:
- 哪些特征触发 reasoning 升档;
- 何时增加 Reviewer 有实际收益;
- 哪些耦合模式导致尾部耗时;
- 何时并行会被整合成本抵消。
树模型仍只提供预测和 shadow 建议,生产变更需要受控评估。
5.4 阶段四:Contextual Bandit
Contextual bandit 在每个新任务上观察上下文、选择策略、获取反馈,并更新对策略的认识:
- 观察 ;
- 从安全候选中选择 ;
- 记录选择概率 ;
- 获得结果 和证据 ;
- 更新策略估计。
它适合处理探索与利用:高风险任务继续使用已验证策略;低风险、可回滚任务可以给证据不足但有潜力的低成本路线少量探索机会。
5.5 阶段五:组织策略学习
数据充分后才研究:
- task graph 到 organization topology 的策略学习;
- constrained reinforcement learning;
- offline reinforcement learning;
- 图模型表示依赖与 ownership;
- imitation learning 学习优秀 Commander 的决策;
- 序列模型预测任务状态演化。
这一阶段要求稳定 reward、完整失败轨迹、选择概率和可靠反事实评价。它不是近期工程前提。
5.6 为什么初期不训练深度神经网络
当前真实任务样本规模小、任务异质性高、模型更新快,深网很容易:
- 记忆少数任务而不是学习规律;
- 把任务难度差异误认为模型能力差异;
- 把 provider 或 CI 故障归因给模型;
- 无法解释组织选择;
- 在模型别名或配置更新后迅速失效。
因此,在样本量、数据完整率、cohort 稳定性和离线评估均达标前,不训练深度路由网络,也不让任何学习模型自动修改生产路由。
6. 选择偏差与因果识别
历史成功率天然存在选择偏差。能力更强的模型往往被派给更困难的任务,便宜模型可能只处理机械工作。直接比较总体完成率可能得出相反结论。
6.1 必须记录 propensity
每次路由至少记录:
- 候选策略集合;
- 实际选择策略;
- 选择理由;
- 选择概率或可重建的 policy version;
- 被硬门禁排除的策略;
- 人工覆盖及原因。
没有 propensity 或策略版本的历史数据仍可做描述统计,但不适合进行强因果推断。
6.2 Matched cohort
优先比较同时满足以下条件的样本:
- 同一 task type 或 issue family;
- 相近风险和复杂度;
- 相同 acceptance/truth probe 版本;
- 相同或可控的 provider、protocol、harness;
- 能确认 effective effort;
- 同一模型/config cohort;
- 相似时间窗口与基础设施状态。
在 matched cohort 内,可使用同题复跑、inverse propensity weighting、doubly robust estimation 和 task-cluster bootstrap。任何结论都必须显示 distinct task N 与不确定区间。
6.3 Sentinel task
新模型、新版本或配置变化时,选择少量具有代表性的真实低风险任务作为 sentinel:
- 覆盖多个 issue family;
- 具有 baseline 和可验证结果;
- 尽量进行同格复跑;
- 不接触真实生产数据;
- 结果进入独立 cohort;
- 未达到证据阈值前不继承旧版本排名。
Sentinel 用于发现退化,不应演化成脱离真实工作的固定刷榜系统。
6.4 Shadow mode
在 shadow mode 中,系统生成推荐,但不改变当前执行策略。记录:
- 推荐策略;
- 实际策略;
- 两者预测差异;
- 最终实际结果;
- 若可评估,推荐策略的离线反事实表现。
只有当数据质量、预测校准、风险门禁和人工复核连续达标后,才允许低风险类别小比例自动探索。安全、权限、数据损坏和生产任务长期保留人工或 Commander 审批。
7. 消融实验设计
要判断多 Agent 组织是否真的有用,需要比较组织机制,而不只是模型名称。
7.1 基础实验组
| 组别 | 组织策略 |
|---|---|
| A | 单一 Agent 完成分析、实现与自测 |
| B | Commander + 单 Developer + 独立 Reviewer |
| C | Commander + 多个互不重叠 Developer 并行 |
| D | Commander + Domain Leader + Developer/Tester/Reviewer |
| E | 动态组织与动态模型路由 |
7.2 关键消融项
- 去掉 Domain Leader,观察总指挥信息负担和漏报;
- 去掉 ownership window,观察冲突与返工;
- 去掉 baseline truth probe,观察“测试绿但没修好”的比例;
- 去掉 CompletionReceipt,观察中断恢复与证据缺失;
- 重复正式 Review,测量新增发现与时间/费用边际收益;
- 固定 GPT-5.6 Sol(medium 推理档)与动态档位比较;
- 所有消息上送 Maple 与分层注意力路由比较;
- 串行开发与低耦合并行开发比较。
7.3 主要观测
- Verified Truth Completion Rate;
- First-Pass Verified Delivery Rate;
- 墙钟时间与 p90;
- 全链路费用;
- 返工轮数;
- Maple 介入次数和注意力时间;
- 信息压缩率、严重问题漏报率和越权率;
- 中断恢复成功率;
- 安全、权限和数据事件。
实验不应通过放宽验收标准获得更快结果。各组必须绑定相同 acceptance version 和 truth probe。
8. 最小数据结构
以下为分析 read model 的最小逻辑 schema,不指定当前实现必须使用哪种数据库。
8.1 task_case
task_case_id
beacon_issue_id
repo_ids
task_type / issue_family
risk_class / reversibility
base_sha
acceptance_hash / truth_probe_hash
created_at
8.2 route_config
route_config_id
canonical_model_id / model_snapshot
provider / endpoint_class / protocol / harness
requested_effort / effective_effort
profile / config_digest
billing_mode
valid_from / valid_to
8.3 organization_plan
organization_plan_id
commander_run_id
leader_count / organization_depth
role_counts
ownership_partition_hash
parallelism_limit
review_policy / ci_policy
stop_conditions_hash
policy_version
8.4 attempt
attempt_id / parent_attempt_id
task_case_id
agent_run_id
route_config_id / organization_plan_id
started_at / ended_at
status / failure_class
token_usage / provider_cost_actual / estimated_cost
source_uri / source_commit / source_hash / ingest_state
8.5 gate_result 与 review_run
attempt_id / head_sha
gate_type / result
baseline_reproduced
evidence_uri / observed_at
review_run_id / reviewer_route_id
independent / verifier_skipped
raw / kept / dropped findings by severity
artifact_uri
8.6 delivery
task_case_id / head_sha
pr / ci_run / review_run
merged_state / deployed_state
first_pass / rework_rounds
completion_receipt_id
delivered_at
8.7 attention_event
event_id / source_event_id
audience / visibility
requires_action / severity
summary_hash / detail_reference
delivered_at / read_at / acted_at
supersedes / deduplication_key
estimated_attention_seconds
8.8 policy_decision
decision_id / task_case_id
candidate_strategy_ids
selected_strategy_id
selection_probability
selection_reason
hard_constraints_applied
human_override / override_reason
policy_version / decided_at
8.9 judgment_label
label_id
subject_type / subject_ref
question
labeler
model_version / question_version
input_digest / prior_labels_stripped
answer / probabilities / confidence
adoption_threshold / adopted
calibration_batch_id
labeled_at
subject_type 指被判断的对象:事件、汇报、消息或任务;question 取“该不该找 Maple”“有没有漏关键事实”“消息等级”“任务特征”等固定题目;labeler 区分 jev 与 Maple。prior_labels_stripped 记录喂给 jev 的材料是否已经去掉原有等级,这是 4.5 节第二条护栏的审计依据。
所有采集记录应保存 source hash、source commit、dirty/untracked 状态和 ingested_at。不合格数据进入 quarantine,不删除原始证据,也不进入自动推荐集。
9. 与 Beacon、Vyane、Horus 的边界
Beacon
Beacon 继续作为任务、状态、decision、claim 和交付进度的权威来源。学习系统读取任务事实,但不把预测结果反向伪装成任务完成状态。调度建议可以作为有来源的 projection 或 Log 关联,是否执行仍由权威命令和审批决定。
Vyane
Vyane 已具备 AgentRun、Conversation、Event、Delivery 等运行账本基础。本文提出的 attempt、route provenance、organization plan 和 CompletionReceipt 关联仍需按实际实现逐项补齐或核验。学习系统应以只读 normalization/read model 起步,不修改原始运行事件。
已验证事实(截至 2026-09-23): 执行尝试(Attempt)的最小字段契约与启动门禁已经合并,执行账本的字段目录按本文的 、、、 分节;第一批只落了时间、用量、费用、CI 与审查结果,任务特征、组织策略、返工轮数和注意力字段都留待后续,而且运行环境里还没有生产记录。organization plan、policy decision、attention event 与 judgment label 目前都没有对应结构。
Horus
重明(Horus)是面向 Maple 的组织、注意力与决策控制面。模型建议、置信度、证据和数据质量适合在 Horus 展示;第一阶段只读 Team/read model 不等于已经具备自动建队、自动所有权或生产路由能力。任何“推荐”都必须允许展开到具体任务、SHA、探针和审查证据。
10. 研究纪律
- 不把外部 IQ 或通用 benchmark 直接写入 Vyane 生产路由。
- 不用事件行数代替 distinct task 数。
- 不删除失败、超时和取消样本。
- 不用今天价格覆盖历史实际费用。
- 不把 CI 绿色等同于真值验收通过。
- 不把 raw finding 数量等同于已验证缺陷。
- 不把 N=1 的结果写成默认策略。
- 不让学习模型越过安全、权限、数据和人工审批边界。
- 不在 shadow 评估达标前自动改变生产路由。
- 不在数据规模和稳定性不足时训练深度神经网络。
- 不在漏报率、越权率缺失或超限时报告 AVDR。
结语
御(Fulcrum)的长期能力不是“永远知道哪个模型最强”,而是能够根据任务、组织、风险和历史证据持续修正自己的执行策略。它首先应当是一个可解释、可审计、受硬约束保护的学习系统,然后才逐步成为能够受控探索的智能调度系统。
版本记录
| 日期 | 版本 | 变化 | 证据状态 |
|---|---|---|---|
| 2026-09-23 | v0.2 | 首次公开发布。增加 AVDR 的配对约束(漏报率、越权率,与第 01 篇 v0.4 逐字一致);把管理层的漏报率、错误升级率与 AVDR 绑定,并补上越权率;增加“用 jev 打代理标签”的待验证设计与 judgment_label 结构;标注已验证事实;统一御(Fulcrum)、重明(Horus)写法;模型代号改写为完整模型名 GPT-5.6 Sol(medium 推理档) | 框架与设计属待验证;已验证事实为当日只读核对;jev 数字为历史观察,N 很小 |
| 2026-08-04 | v0.1 | 研究草案(未公开):四元组表示、三个相互约束的模型、AVDR 与指标体系、分阶段学习路径、因果识别与消融实验设计 | 研究框架 |