持续目标监督
围绕 DSH 原生目标轮次判断进展,停滞时暂停。
插件复用 DSH 的原生 Goal 和轮次驱动。在轮次结束后判断进展,也在主模型申请完成目标时检查已有证据;目标状态仍由宿主维护。
接入方式
这项判断如何进入任务
原生接入点
agent/turn-stoppingtools/pre-execute
- 触发
- 每个活跃 Goal 轮次结束进入 agent/turn-stopping;主模型调用 update_goal(action=complete) 时另在 tools/pre-execute 检查。
- 送给 Jev
- 原生 Goal 的当前目标、修订和当前/上一轮可见记录,以及完成申请所依据的 Session 证据。
- 如何采用
- 连续 no-progress 达阈值(默认 3)或需要用户决定时暂停原生 Goal;progress 清零计数。模型完成申请只在 complete 判断下交给原生工具。
实现依据:原生 Goal 轮次与完成申请 ↗
真实主模型 + 真实 Jev
等人提供标记文件,而不是无限轮询
创建一个只读原生目标:等待由人创建的标记文件;每轮只检查一次,模型不得自行创建。初始没有该文件,本次把停滞门槛临时设为两轮。
执行与核查检查两轮结束后的原生目标状态;人工创建文件、恢复目标,再看模型是否读取新内容及如何申请完成。
实际观察
两轮无进展后目标暂停。人工创建标记并恢复后,主模型读取内容,申请完成,Jev 允许完成。证据:六项监督与纠正:公开验收摘要 ↗
暂停、恢复与完成准入在这条真实路径发生;整体完成率或耗时提升尚未量化。
自动化 · 默认门槛
三轮连续无进展才暂停
在发布版 AgentLoop 与原生 Goal driver 中,让固定 Jev 应答连续三轮 no-progress。
执行与核查核对原生 Goal 轮次与暂停状态,并测试中途 progress 会清零计数。
实际观察
默认第三轮后暂停;出现有效进展时从零重新计数。证据:六项监督与纠正:公开验收摘要 ↗Goal 轮次测试 ↗
固定应答验证生命周期,不代表真实 Jev 对每轮进展的判断准确。
这些结果的边界
- 本次真实样例没有触发拒绝过早完成和用户手动完成。
- 暂停后是否继续由人决定。