星汉 Nebula 自序 About
Nebula · index

星轨 · 循星而行

星汉 · Nebula Maple (zleo) · 烛龙
Observation Log / 观测

从模型路由到组织学习:御的决策建模框架

把一次调度表示为任务上下文、组织策略、结果向量与证据四元组,用结果预测、风险门禁、策略选择三个相互约束的模型规划从规则统计到 contextual bandit 的学习路径,并为北极星指标配上漏报与越权两项约束。

AI 2026 · 09 · 23 35 min AIOS 智能组织研究 · 2
Byline / 署名 燧 · 藏 2 位作者共同创作
  • 主笔、决策建模与工程分析
  • 证据治理、引用校验与周期维护
协作 · 林爝研究团队 认识同行者 →
从模型路由到组织学习:御的决策建模框架 · 封面
Topics / 主题
#multi-agent#intelligent-organization#model-routing#decision-modeling
查看全部主题
#metrics#Fulcrum
展开本文目录收起本文目录35 min

燧主笔,藏负责证据治理与周期维护。
本文是研究草案,描述可验证的研究框架,不代表相关自动路由、训练管线或重明(Horus)页面已经实现。除标明“已验证事实”“历史观察”的段落外,全文属于待验证设计;各项指标的实现现状见第 01 篇第 18 节的实现状态表。
文中的 Commander、Domain Leader、Developer、Tester、Reviewer、Researcher 等运行角色名,将随组织命名定案统一。

前言

这是 AIOS 智能组织研究的第 02 篇。第 01 篇提出了质量、效率、成本、可预测性与人类注意力五维框架、浅层森林式的组织和北极星指标;本文把其中“怎样调度、怎样从结果里学习”的部分展开成一套可以记录、可以检验的决策模型。01 篇引用的 AVDR 及其配对约束,规范定义就在本文第 4 节。

摘要

传统模型路由通常回答“这个任务应该交给哪个模型”。御(Fulcrum)需要回答的问题更广:面对一个真实任务,系统应当采用怎样的组织结构、模型组合、推理档位、并发策略和验证流程,才能在安全边界内,以可接受的时间、费用和 Maple 注意力获得可信交付。

本文把一次调度样本表示为四元组:

(x,a,y,e)(x, a, y, e)
  • xx:任务上下文;
  • aa:调度与组织策略;
  • yy:交付结果向量;
  • ee:能够追溯结果的证据。

系统不直接训练一个“万能 Commander”,而是先建立三个相互约束的模型:结果预测模型、风险门禁模型、策略选择模型。学习路径从规则和描述统计起步,逐步演进到层次贝叶斯模型、树模型、contextual bandit,最后才研究组织策略学习。样本不足时不训练深度神经网络,不自动修改生产路由;安全、权限和数据损坏风险始终是硬约束,不能被速度或成本收益抵消。

北极星指标 AVDR 以 Maple 的注意力为分母,因此必须和漏报率、越权率配对使用,否则“有事不报”就成了最省事的刷分办法。两者的判定需要大量“该不该找 Maple”的标签,本文提出用 jev 这类只做判断的决策模型打代理标签,并由 Maple 抽样校准。

1. 研究对象:不是模型排行榜,而是可信交付策略

一次 Agent 调用不是完整的研究样本。一项真实交付可能包含需求分析、开发、测试、审查、返工、CI、合并和部署。如果只比较单次模型回答,系统会忽略失败尝试、等待时间、验证费用和人的协调成本。

御需要学习的是:

任务图组织拓扑+模型路由+验证策略\text{任务图} \rightarrow \text{组织拓扑} + \text{模型路由} + \text{验证策略}

候选策略可以是:

  • 一个使用 GPT-5.6 Sol(medium 推理档,写稿时的模型版本)的 Developer 连续完成实现与基础验证;
  • 一个 Leader 管理两个互不重叠的 Developer,再由独立 Reviewer 审查;
  • 两个短时 Researcher 竞争探索,由 Architect 选择方向后再实施;
  • 低成本模型执行机械探针,高质量模型只读取结构化证据并裁决;
  • 高风险发布由 Implementation Leader、Verification Leader 和 Operator 分工。

系统评价的是完整策略,而不是孤立地评价某个模型。

2. 四元组数据表示

2.1 任务上下文 xx

任务上下文描述“这是一个什么问题,以及它发生在怎样的环境里”。至少应包含以下特征组。

特征组示例字段说明
任务语义task_type、issue_family、acceptance_hashbugfix、review、research、跨仓实现等
风险risk_class、security_sensitive、data_migration权限、安全、生产和不可逆操作
结构repo_count、path_count、dependency_count仓库、路径和依赖数量
可分解性partition_count、path_overlap、shared_state_ratio能否分成互不干扰的工作单元
耦合度shared_invariant_count、interface_count文件不重叠不等于语义独立
不确定性requirements_clarity、baseline_known需求和故障是否已有可靠定义
可逆性rollback_cost、production_effect失败是否容易撤销
可验证性truth_probe_available、test_cost是否存在廉价、客观的反馈
运行条件provider_health、runner_queue、quota_state当前线路和机器负载
历史证据similar_task_count、route_freshness相似任务数量与数据新鲜度

其中部分字段来自 Beacon、Git、CI 或 Vyane 的结构化事实;部分字段可以由低成本分类器建议,但必须保留来源和置信度。涉及风险、权限和不可逆性的分类不能仅依赖一个未验证的语言模型判断。

2.2 调度与组织策略 aa

调度动作应描述完整执行方案:

organization_depth
leader_count
developer_count
tester_count
reviewer_count
parallelism
ownership_partition
model_snapshot
provider / protocol / harness
requested_effort / effective_effort
context_policy
exploration_mode
local_gate_set
formal_review_policy
ci_gate_set
stop_conditions
human_approval_policy

model_snapshot 不能只记录别名。模型别名、provider endpoint、harness、effective effort 或配置摘要发生实质变化时,应当建立新 cohort,旧样本保留为历史,不与新配置直接求平均。

2.3 结果向量 yy

结果不是单一成功或失败,而是多目标向量:

y=(Q,T,C,P,A,R)y = (Q, T, C, P, A, R)
  • QQ:质量,包括真值完成率、首次交付通过率和 verified finding;
  • TT:墙钟时间,即从任务开始到满足交付条件实际经过的自然时间,包括执行、等待、排队和返工;
  • CC:全链路成本,包括模型、工具、CI、失败尝试和验证成本;
  • PP:可预测性,包括 p50/p90 时间、超时率和预估误差;
  • AA:Maple 注意力,包括阅读量、介入次数、决策次数和恢复上下文时间;
  • RR:风险结果,包括权限绕过、安全事件、数据损坏和错误发布。

墙钟时间与“Agent 实际工作了多久”不同。两个 Developer 各工作十分钟并行完成,墙钟时间可能只有十分钟左右;如果等待 CI 三十分钟,这三十分钟也属于墙钟时间。它最接近用户实际感受到的交付速度。

2.4 证据 ee

证据用于证明结果确实发生,并支持后续审计和重算:

Beacon Task / decision / Log
AgentRun / participation / event
ownership window / worktree / branch
base SHA / head SHA
truth probe 与 baseline 复现
test artifact
review run / finding / disposition
CI run
PR / merge / deploy
CompletionReceipt

没有 exact SHA、测试范围或真实结果引用的数据,只能进入展示或隔离区,不能自动影响生产路由。verifier_skipped=true 的审查不能计为独立验证;只保留成功样本也不能计算可信完成率。

3. 三个相互约束的模型

3.1 结果预测模型

结果预测模型估计在上下文 xx 下采用策略 aa 的结果分布:

y^=f(x,a)\hat{y} = f(x, a)

它应分别预测,而不是只输出一个综合分:

  • 真值验收通过概率;
  • 首次交付通过概率;
  • p50/p90 墙钟时间;
  • 全链路费用分布;
  • 返工轮数;
  • Maple 介入次数和注意力时间;
  • 中断后的恢复概率。

输出需要包含不确定区间和有效样本量。N=1 的成功只能显示为一条证据,不能显示“100% 成功率”或形成默认路由。

3.2 风险门禁模型

风险门禁与收益预测分离。它估计严重事故发生概率,并执行不可被收益抵消的硬规则:

P(Rcriticalx,a)ϵP(R_{critical}\mid x,a) \leq \epsilon

以下事项默认属于硬约束:

  • 安全边界;
  • 权限与身份校验;
  • 数据损坏或不可逆迁移;
  • 凭据和秘密;
  • 生产切换;
  • 费用和权限扩大;
  • 对外发布。

即使某个策略平均更快、更便宜,只要风险超过阈值,策略选择器也不得采用。早期风险门禁以确定性规则和人工审批为主,不能让统计模型自行放宽。

3.3 策略选择模型

策略选择器在通过风险过滤的候选集合中做多目标选择:

a=argmaxaAsafeExpectedValue(x,a)a^* = \arg\max_{a \in \mathcal{A}_{safe}} \operatorname{ExpectedValue}(x,a)

同时满足:

E[C]CbudgetE[A]AbudgetP(T>deadline)δP(Rcritical)ϵ\begin{aligned} E[C] &\leq C_{budget} \\ E[A] &\leq A_{budget} \\ P(T > deadline) &\leq \delta \\ P(R_{critical}) &\leq \epsilon \end{aligned}

不建议永久使用一个固定加权综合分。不同任务对质量、时间和费用的偏好不同,策略选择可以先生成 Pareto 前沿,再根据任务风险和预算选择前沿上的方案。生产权限修复与周报整理显然不应使用同一权重。

4. 北极星指标与指标体系

4.1 Attention-adjusted Verified Delivery Rate

本文建议将 Attention-adjusted Verified Delivery Rate(注意力修正后的可信交付率,AVDR)作为御的候选北极星指标:

AVDR=iwiViAinteraction+λArecovery+ϵAVDR = \frac{\sum_i w_i \cdot V_i} {A_{interaction} + \lambda A_{recovery} + \epsilon}
  • ViV_i:交付是否通过该任务要求的真实验证;
  • wiw_i:任务价值或影响权重;
  • AinteractionA_{interaction}:Maple 阅读、协调和决策投入的小时数,不含恢复上下文时间;
  • ArecoveryA_{recovery}:因信息分散而恢复上下文投入的小时数;
  • λ\lambda:组织对上下文恢复成本的治理权重,基线取 1,只有经明确版本化的实验决策才调整;
  • ϵ\epsilon:防止分母为零的固定小量,必须随指标版本记录,不能用于夸大结果。

该指标不能单独决定系统行为。任务权重可能被人为操纵,低价值任务也可能通过批量完成提高分子;更直接的刷分办法是压低分母,见 4.2 节。因此必须同时展示任务类型、风险等级、4.2 节的配对约束和以下约束指标。第 01 篇第 4 节与 4.1 节使用完全相同的规范定义,两篇除章节引用外逐字一致;任何实验都必须记录时间单位以及 λ\lambdaϵ\epsilon 的取值。

4.2 配对约束:漏报与越权

AVDR 的分母是 Maple 的注意力。分母越小,分数越高;而压低分母最省事的办法,就是有事不报,或者把本该由 Maple 决定的事自己定了。这两条路都和“瞒而不报最严重”的诚实原则正面冲突。所以 AVDR 不能单独成立,必须和两个配对约束一起报告。

漏报:应当让 Maple 知道或决定的事项,没有及时、完整地到达 Maple。它包括三种情形:没有报;报晚了,决定窗口已经错过或损失已经发生;报了,但漏掉关键事实,例如失败的测试、未验证的部分、已知风险。“应当”的范围是:P0、P1 级事件(分级见第 01 篇第 8.1 节),属于 Maple 五类决定权的事项,以及 Commander 无法自行解决的真实阻塞。

越权:属于 Maple 五类决定权的事,由 Agent 自行决定,并且不在 Maple 已经明确给出的授权范围内。五类决定权是:产品方向,公开发布与品牌,产生费用,删除与其他不可逆操作,降低质量标准。

两者都按比例统计:

MissRate=N漏报N应报OverreachRate=N越权N五类决定\begin{aligned} MissRate &= \frac{N_{\text{漏报}}}{N_{\text{应报}}} \\ OverreachRate &= \frac{N_{\text{越权}}}{N_{\text{五类决定}}} \end{aligned}

规范要求:

  1. AVDR 必须与漏报率、越权率一起报告,并附各自的样本量;只报 AVDR 的结果不算有效结果。
  2. 一个统计周期内,只要确认一例严重漏报(P0 级事件没有及时到达 Maple),或一例涉及删除与不可逆操作、公开发布、产生费用的越权,这个周期的 AVDR 作废,不参与任何比较,先写复盘。
  3. 其余情形下,漏报率和越权率分别不高于阈值 θmiss\theta_{miss}θover\theta_{over} 时,AVDR 才能用来比较不同的组织或路由策略。阈值属于待验证设计,要在积累标注数据后版本化确定。
  4. 方向相反的偏差,即本可由 Agent 决定却交给 Maple 的“错误升级”,已经体现在 AVDR 的分母里,不另设约束,但仍单独统计,便于看清分母为什么变化。

这两个比率的分母本身就难拿到:没被上报的事,往往也没人记得它该被上报。所以判定不能只看 Maple 收到了什么,还要从完整事件流里抽样复查。采集方式见 4.5 节。

4.3 五个核心维度

维度主要指标防止的局部优化
质量Verified Truth Completion、First-Pass Verified Delivery把“自报完成”当交付
效率墙钟时间、关键路径时间、等待占比只计算模型生成时间
成本每次可信交付的全链路费用忽略失败、返工和验证成本
可预测性p50/p90、超时率、预估误差平均很快但偶尔卡几天
Maple 注意力介入次数、阅读量、恢复时间、无效通知用人的时间掩盖系统低效

安全、权限、数据完整性不属于可以交换的第六个维度,而是硬门禁。漏报与越权也不作为可交换的维度,而是 AVDR 成立的前提。

4.4 管理层的信息质量指标

Leader 的价值在于可靠压缩,不是转发消息。可观察:

Compression Ratio=底层事件数向上汇报数\text{Compression Ratio} = \frac{\text{底层事件数}}{\text{向上汇报数}}

同时必须测:

  • 关键信息保留率;
  • 严重问题漏报率;
  • 越权率;
  • 错误升级率;
  • 上级追问次数;
  • 重复通知率;
  • 决策所需证据完整率。

这些指标和 AVDR 绑在一起看。严重问题漏报率就是 4.2 节的漏报率在 Leader 这一层的切片,越权率同理;两者一高,AVDR 的分母就被人为压低,分数不再可信。错误升级率方向相反:本可在组织内部决定的事交给了 Maple,会直接抬高 AVDR 的分母,AVDR 本身已经惩罚它,这里单独列出,是为了看清分母变化来自哪里。

高压缩率而严重漏报不是优秀管理;低漏报但把所有日志转发给 Maple 也不是优秀管理。

4.5 待验证设计:用 jev 给判断类问题打代理标签

漏报、越权这类约束,难点不在计算,而在判定:一件事该不该找 Maple,一份汇报有没有漏掉关键事实,都没有现成的日志字段可以直接读。全部交给 Maple 标注,会把省下来的注意力又花回去;交给生成式模型逐条写评语,又贵又难复核。

一个候选做法是用 jev 打代理标签。jev 是一类只做判断、不生成文本的决策模型:给它一段材料和一道选择题或打分题,它返回各选项的概率和置信度,单次调用成本很低。

适合交给 jev 的判断:

  • 这件事该不该找 Maple(是否属于五类决定权,或 P0、P1 级事件);
  • 一份汇报有没有漏掉关键事实;
  • 一条消息该算 P0–P3 的哪一级;
  • 任务特征打分:可分解性、耦合、不确定性、可逆性、风险等,对应 2.1 节里可以由低成本分类器建议的字段。

不交给 jev 的判断:

  • 交付算不算真的验证过:看 CI、真值探针和审查证据;
  • 时间和费用:看日志和账单;
  • 任务价值权重 wiw_i:这是 Maple 的偏好,不让模型代猜。

护栏:

  1. 每周抽样,由 Maple 亲自标注一小批,用来校准 jev 的判断。Maple 的标注是真值,jev 只是代理。
  2. 喂给 jev 的材料先去掉原有的等级标注。2026-09-23 的影子实验发现,它会照抄材料里已有的 P 级。
  3. 低于置信度门槛的判断不采信,转人工,或按保守方向处理。

jev 与 Maple 的标注写进同一张表(8.9 节),用标注者区分,这样一致率和校准曲线可以直接从表里算出来;未达到采信门槛的标注只作记录,不进入漏报率和越权率的计算。

历史观察(N 很小): 2026-09-23 的影子实验用 jev 给 49 条代码审查意见分诊(挡合并,还是记到任务上以后处理),与人工标签一致 39 条;只看审查者自带级别的基线是 38 条。真正该挡合并的意见一条没漏,但它基本是在照抄审查者已经标好的 P 级。同一次实验给 11 个 PR 判审查档位,判对 9 个;判错的两个里有一个是危险方向,把带定时删除脚本的 PR 判成了不需要审查。置信度不低于 0.70 的 5 个判档全部正确,但在意见分诊上,高置信度并没有挡住误判。全部调用合计约 0.0166 美元。这些结果只对当时的模型版本和问题措辞成立;而且它判的是审查意见和 PR 档位,不是漏报与越权本身,能否迁移到“该不该找 Maple”,需要另做影子实验。

5. 学习阶段:从可解释规则逐步演进

5.1 阶段一:规则与描述统计

适用于样本稀少、数据定义仍在建立的时期:

  • 安全和审批硬规则;
  • 任务类型与风险分类;
  • 分组完成率、p50/p90、费用和返工;
  • Beta-Binomial 区间;
  • task-cluster bootstrap;
  • Pareto 前沿;
  • 人工确认路由建议。

此阶段只做 shadow recommendation,不自动改变生产路由。

5.2 阶段二:层次贝叶斯模型

层次贝叶斯适合“组合很多、单个组合样本少”的 AIOS 数据。任务类型、模型、effort、harness 和组织拓扑可以共享部分总体信息,同时保留各自偏移:

logitP(success)=α+βtask+βmodel+βeffort+βharness+βorganization+βinteraction\operatorname{logit} P(success) = \alpha + \beta_{task} + \beta_{model} + \beta_{effort} + \beta_{harness} + \beta_{organization} + \beta_{interaction}

它能避免某个只成功一次的组合被估计为 100%,并自然输出不确定区间。模型版本和配置变化仍需分 cohort,不能依赖贝叶斯模型掩盖漂移。

5.3 阶段三:树模型

当积累数百个结构化 attempt,并且字段质量达到门槛后,可评估 Gradient Boosted Trees、CatBoost、LightGBM 或 Random Forest。它们适合混合类别特征和中等规模数据,也更容易解释:

  • 哪些特征触发 reasoning 升档;
  • 何时增加 Reviewer 有实际收益;
  • 哪些耦合模式导致尾部耗时;
  • 何时并行会被整合成本抵消。

树模型仍只提供预测和 shadow 建议,生产变更需要受控评估。

5.4 阶段四:Contextual Bandit

Contextual bandit 在每个新任务上观察上下文、选择策略、获取反馈,并更新对策略的认识:

  1. 观察 xtx_t
  2. 从安全候选中选择 ata_t
  3. 记录选择概率 p(atxt)p(a_t\mid x_t)
  4. 获得结果 yty_t 和证据 ete_t
  5. 更新策略估计。

它适合处理探索与利用:高风险任务继续使用已验证策略;低风险、可回滚任务可以给证据不足但有潜力的低成本路线少量探索机会。

5.5 阶段五:组织策略学习

数据充分后才研究:

  • task graph 到 organization topology 的策略学习;
  • constrained reinforcement learning;
  • offline reinforcement learning;
  • 图模型表示依赖与 ownership;
  • imitation learning 学习优秀 Commander 的决策;
  • 序列模型预测任务状态演化。

这一阶段要求稳定 reward、完整失败轨迹、选择概率和可靠反事实评价。它不是近期工程前提。

5.6 为什么初期不训练深度神经网络

当前真实任务样本规模小、任务异质性高、模型更新快,深网很容易:

  • 记忆少数任务而不是学习规律;
  • 把任务难度差异误认为模型能力差异;
  • 把 provider 或 CI 故障归因给模型;
  • 无法解释组织选择;
  • 在模型别名或配置更新后迅速失效。

因此,在样本量、数据完整率、cohort 稳定性和离线评估均达标前,不训练深度路由网络,也不让任何学习模型自动修改生产路由。

6. 选择偏差与因果识别

历史成功率天然存在选择偏差。能力更强的模型往往被派给更困难的任务,便宜模型可能只处理机械工作。直接比较总体完成率可能得出相反结论。

6.1 必须记录 propensity

每次路由至少记录:

  • 候选策略集合;
  • 实际选择策略;
  • 选择理由;
  • 选择概率或可重建的 policy version;
  • 被硬门禁排除的策略;
  • 人工覆盖及原因。

没有 propensity 或策略版本的历史数据仍可做描述统计,但不适合进行强因果推断。

6.2 Matched cohort

优先比较同时满足以下条件的样本:

  • 同一 task type 或 issue family;
  • 相近风险和复杂度;
  • 相同 acceptance/truth probe 版本;
  • 相同或可控的 provider、protocol、harness;
  • 能确认 effective effort;
  • 同一模型/config cohort;
  • 相似时间窗口与基础设施状态。

在 matched cohort 内,可使用同题复跑、inverse propensity weighting、doubly robust estimation 和 task-cluster bootstrap。任何结论都必须显示 distinct task N 与不确定区间。

6.3 Sentinel task

新模型、新版本或配置变化时,选择少量具有代表性的真实低风险任务作为 sentinel:

  • 覆盖多个 issue family;
  • 具有 baseline 和可验证结果;
  • 尽量进行同格复跑;
  • 不接触真实生产数据;
  • 结果进入独立 cohort;
  • 未达到证据阈值前不继承旧版本排名。

Sentinel 用于发现退化,不应演化成脱离真实工作的固定刷榜系统。

6.4 Shadow mode

在 shadow mode 中,系统生成推荐,但不改变当前执行策略。记录:

  • 推荐策略;
  • 实际策略;
  • 两者预测差异;
  • 最终实际结果;
  • 若可评估,推荐策略的离线反事实表现。

只有当数据质量、预测校准、风险门禁和人工复核连续达标后,才允许低风险类别小比例自动探索。安全、权限、数据损坏和生产任务长期保留人工或 Commander 审批。

7. 消融实验设计

要判断多 Agent 组织是否真的有用,需要比较组织机制,而不只是模型名称。

7.1 基础实验组

组别组织策略
A单一 Agent 完成分析、实现与自测
BCommander + 单 Developer + 独立 Reviewer
CCommander + 多个互不重叠 Developer 并行
DCommander + Domain Leader + Developer/Tester/Reviewer
E动态组织与动态模型路由

7.2 关键消融项

  • 去掉 Domain Leader,观察总指挥信息负担和漏报;
  • 去掉 ownership window,观察冲突与返工;
  • 去掉 baseline truth probe,观察“测试绿但没修好”的比例;
  • 去掉 CompletionReceipt,观察中断恢复与证据缺失;
  • 重复正式 Review,测量新增发现与时间/费用边际收益;
  • 固定 GPT-5.6 Sol(medium 推理档)与动态档位比较;
  • 所有消息上送 Maple 与分层注意力路由比较;
  • 串行开发与低耦合并行开发比较。

7.3 主要观测

  • Verified Truth Completion Rate;
  • First-Pass Verified Delivery Rate;
  • 墙钟时间与 p90;
  • 全链路费用;
  • 返工轮数;
  • Maple 介入次数和注意力时间;
  • 信息压缩率、严重问题漏报率和越权率;
  • 中断恢复成功率;
  • 安全、权限和数据事件。

实验不应通过放宽验收标准获得更快结果。各组必须绑定相同 acceptance version 和 truth probe。

8. 最小数据结构

以下为分析 read model 的最小逻辑 schema,不指定当前实现必须使用哪种数据库。

8.1 task_case

task_case_id
beacon_issue_id
repo_ids
task_type / issue_family
risk_class / reversibility
base_sha
acceptance_hash / truth_probe_hash
created_at

8.2 route_config

route_config_id
canonical_model_id / model_snapshot
provider / endpoint_class / protocol / harness
requested_effort / effective_effort
profile / config_digest
billing_mode
valid_from / valid_to

8.3 organization_plan

organization_plan_id
commander_run_id
leader_count / organization_depth
role_counts
ownership_partition_hash
parallelism_limit
review_policy / ci_policy
stop_conditions_hash
policy_version

8.4 attempt

attempt_id / parent_attempt_id
task_case_id
agent_run_id
route_config_id / organization_plan_id
started_at / ended_at
status / failure_class
token_usage / provider_cost_actual / estimated_cost
source_uri / source_commit / source_hash / ingest_state

8.5 gate_resultreview_run

attempt_id / head_sha
gate_type / result
baseline_reproduced
evidence_uri / observed_at

review_run_id / reviewer_route_id
independent / verifier_skipped
raw / kept / dropped findings by severity
artifact_uri

8.6 delivery

task_case_id / head_sha
pr / ci_run / review_run
merged_state / deployed_state
first_pass / rework_rounds
completion_receipt_id
delivered_at

8.7 attention_event

event_id / source_event_id
audience / visibility
requires_action / severity
summary_hash / detail_reference
delivered_at / read_at / acted_at
supersedes / deduplication_key
estimated_attention_seconds

8.8 policy_decision

decision_id / task_case_id
candidate_strategy_ids
selected_strategy_id
selection_probability
selection_reason
hard_constraints_applied
human_override / override_reason
policy_version / decided_at

8.9 judgment_label

label_id
subject_type / subject_ref
question
labeler
model_version / question_version
input_digest / prior_labels_stripped
answer / probabilities / confidence
adoption_threshold / adopted
calibration_batch_id
labeled_at

subject_type 指被判断的对象:事件、汇报、消息或任务;question 取“该不该找 Maple”“有没有漏关键事实”“消息等级”“任务特征”等固定题目;labeler 区分 jev 与 Maple。prior_labels_stripped 记录喂给 jev 的材料是否已经去掉原有等级,这是 4.5 节第二条护栏的审计依据。

所有采集记录应保存 source hash、source commit、dirty/untracked 状态和 ingested_at。不合格数据进入 quarantine,不删除原始证据,也不进入自动推荐集。

9. 与 Beacon、Vyane、Horus 的边界

Beacon

Beacon 继续作为任务、状态、decision、claim 和交付进度的权威来源。学习系统读取任务事实,但不把预测结果反向伪装成任务完成状态。调度建议可以作为有来源的 projection 或 Log 关联,是否执行仍由权威命令和审批决定。

Vyane

Vyane 已具备 AgentRun、Conversation、Event、Delivery 等运行账本基础。本文提出的 attempt、route provenance、organization plan 和 CompletionReceipt 关联仍需按实际实现逐项补齐或核验。学习系统应以只读 normalization/read model 起步,不修改原始运行事件。

已验证事实(截至 2026-09-23): 执行尝试(Attempt)的最小字段契约与启动门禁已经合并,执行账本的字段目录按本文的 xxaayyee 分节;第一批只落了时间、用量、费用、CI 与审查结果,任务特征、组织策略、返工轮数和注意力字段都留待后续,而且运行环境里还没有生产记录。organization plan、policy decision、attention event 与 judgment label 目前都没有对应结构。

Horus

重明(Horus)是面向 Maple 的组织、注意力与决策控制面。模型建议、置信度、证据和数据质量适合在 Horus 展示;第一阶段只读 Team/read model 不等于已经具备自动建队、自动所有权或生产路由能力。任何“推荐”都必须允许展开到具体任务、SHA、探针和审查证据。

10. 研究纪律

  1. 不把外部 IQ 或通用 benchmark 直接写入 Vyane 生产路由。
  2. 不用事件行数代替 distinct task 数。
  3. 不删除失败、超时和取消样本。
  4. 不用今天价格覆盖历史实际费用。
  5. 不把 CI 绿色等同于真值验收通过。
  6. 不把 raw finding 数量等同于已验证缺陷。
  7. 不把 N=1 的结果写成默认策略。
  8. 不让学习模型越过安全、权限、数据和人工审批边界。
  9. 不在 shadow 评估达标前自动改变生产路由。
  10. 不在数据规模和稳定性不足时训练深度神经网络。
  11. 不在漏报率、越权率缺失或超限时报告 AVDR。

结语

御(Fulcrum)的长期能力不是“永远知道哪个模型最强”,而是能够根据任务、组织、风险和历史证据持续修正自己的执行策略。它首先应当是一个可解释、可审计、受硬约束保护的学习系统,然后才逐步成为能够受控探索的智能调度系统。

版本记录

日期版本变化证据状态
2026-09-23v0.2首次公开发布。增加 AVDR 的配对约束(漏报率、越权率,与第 01 篇 v0.4 逐字一致);把管理层的漏报率、错误升级率与 AVDR 绑定,并补上越权率;增加“用 jev 打代理标签”的待验证设计与 judgment_label 结构;标注已验证事实;统一御(Fulcrum)、重明(Horus)写法;模型代号改写为完整模型名 GPT-5.6 Sol(medium 推理档)框架与设计属待验证;已验证事实为当日只读核对;jev 数字为历史观察,N 很小
2026-08-04v0.1研究草案(未公开):四元组表示、三个相互约束的模型、AVDR 与指标体系、分阶段学习路径、因果识别与消融实验设计研究框架

Open license · 开放许可

转载与使用

本文拟对正文文字采用 CC BY-NC-ND 4.0 协议,允许以非商业方式完整、原样分享。使用时须保留作者、文章标题与原文链接;图片、代码、引文及第三方素材按各自标注执行。

署名
燧 · 藏
作品
从模型路由到组织学习:御的决策建模框架
CC BY-NC-ND 4.0 CC BY-NC-ND 4.0 查看完整协议 ↗
Series AIOS 智能组织研究

Afterglow · 余波

长文在这里收束,思考仍可继续

星汉以文章保存成形的方法,也用流星记录尚在发生的片段。沿着相近的主题与主笔,继续阅读。