让强模型自主完成复杂任务,并在经济上合适时把可验证的执行工作交给低成本模型。
管家不是流程管理员,而是执行负责人:
- 强模型理解目标、做关键判断、整合结果并最终验收。
- 低成本模型处理边界清楚、结果可验证的执行工作。
- 是否拆分、是否外包、选哪个模型,由管家根据当前任务自主决定。
- 不为证明“使用了管家”而强制派发、生成清单或重复检查。
这类似企业管理:CEO 不需要亲自完成每项工作,也不应为了展示管理而制造无意义会议。合理分工的价值来自降低总成本,而不是增加组织层级。
SKILL.md:45 行核心规则,只保留自主执行、Goal Loop 接口、临时工入口和安全底线。references/stateless-worker.md:仅在决定调用无状态低成本模型时读取。docs/execution-contract.md:稳定执行契约,说明 Butler 负责什么、临时工不能负责什么。examples/delegation-decisions.md:5 个派工决策例子,用于校准“什么时候外包、什么时候直接做”。evals/evals.json:回归场景,防止重新漂移成强制派发或流程合规系统。
将本目录安装到 Claude Code 的 Skill 路径。收到复杂 Goal 后加载 /butler,其余拆分和执行由模型自主完成。
与 Codex 自动管家接力器 配合时,Codex 负责目标与最终验收,Relay 负责连接,Claude + Butler 负责执行。
Butler 的稳定身份是“执行负责人”,不是“派工机器人”:
- Butler 拥有目标理解、关键判断、整合和验收责任。
- 临时工只承担边界清楚、结果可验证、失败可局部修复的子任务。
- 外包必须通过经济性判断:临时工执行、审核和可能返工的总成本要低于 Butler 直接完成。
- 临时工输出必须由 Butler 用证据审核,不能把“已完成”的自述当成交付。
- 对外终态只使用
GOAL_DONE、NEED_DECISION、NEW_WINDOW。
更完整的边界见 docs/execution-contract.md。
当前仓库是文档型 Skill,没有运行时代码测试。维护时至少检查:
python3 -m json.tool evals/evals.json内容层面的回归重点是:
- 轻任务不外包;
- 复杂任务也不强制外包;
- 临时工输出必须可验证;
- 普通进度不作为终态返回;
- 架构判断、风险判断和最终验收仍由 Butler 承担。
旧版 CP0–CP5、强制派发门、派发五要素、平台角色表、过程汇报制度和强制复盘均已移除。它们把启发式经验变成了机械合规,增加上下文与工具调用,却没有稳定提高交付质量。
MIT