2026-08-12 · Wednesday · 5 个可迁移的工程发现
diri v0.5.0 区分了 daemon restart 与整机宕机两种故障面:只有本地 PTY holder 未能重新 attach 的 session 才会被归类为可恢复的 exited:daemonRestart;远程 tmux 会话被刻意保留为"可能仍存活"。恢复动作(reattach / resume / wait)的选择来自故障范围的证据,而不是来自持久化的状态值。
教学要点:恢复逻辑要先诊断"出了什么问题"(故障范围),再决定"该做什么"(恢复动作)。持久化状态是线索,不是命令。
SHE(arXiv:2608.09885)把 agent harness 拆成四层:System Prompt、Rule Bank、Safety Memory、Tool Policy。演化循环走 trajectory failure → artifact attribution → safety/utility verification,但评分与选择始终在上层完成,被变对象不能修改自己的评估标准。
教学要点:可自我修改的系统需要显式的 attribution(归因)才能做到定向演化。笼统的"变好"是一维的优化目标,但安全问题需要从"哪一层变、变什么、谁来判"三个维度思考。
OfficeBuddy 的 108-run Render-Truth Bench 是一个好的信号——它展示了证据习惯——但它仍是作者的自我发布评估,不是独立验证。同样,optim-plans v0.3.0 把执行引擎和校验引擎合并回了当前 session,eliminate 了分离式的 checkpoint 中间层,这是成熟的简化信号,但简化本身也不等于证据。
教学要点:看到 benchmark 分数先问"谁跑的、数据哪来的、有没有人独立复现过"。工具本身的简化(去掉多余引擎)有时候比 benchmark 分数更值得学。
MkAgent 把 Electron/WebUI/CLI 全部做薄,只通过一条认证过的 WebSocket 控制面通信;Pi agent 以 JSONL 子进程运行。session-scoped grants + 对抗式 Bash 解析器测试,把"用户配置的 allowlist"与"OS 级 containment"的边界拉清楚。
allow-all 仍是可用性兜底,不是安全边界。教学要点:权限收缩不是做"更小的白名单",而是把 UI、通信、执行三个面的授权边界分清楚。一条 WebSocket 控制面比 N 个分散的 CLI 入口更容易审计。
open-kritt 的新代码让 workflow 编辑在被其他 session 占用时返回 typed 409 workflow_in_use + scanCount,而不是静默覆盖或报个 generic error。这支持了 operational-maturity 的核心理念:在保留 provenance-bearing 工作的同时,提供安全的恢复路径。
教学要点:并发冲突不应该被悄悄消解。typed 409 + scanCount + 显式确认是三件套:告诉用户"有人在用"、"有多少人在用",然后让用户选择。