看住任务真实暂停与恢复

持续目标监督

围绕 DSH 原生目标轮次判断进展,停滞时暂停。

插件复用 DSH 的原生 Goal 和轮次驱动。在轮次结束后判断进展,也在主模型申请完成目标时检查已有证据;目标状态仍由宿主维护。

接入方式

这项判断如何进入任务

原生接入点
  • agent/turn-stopping
  • tools/pre-execute
触发
每个活跃 Goal 轮次结束进入 agent/turn-stopping;主模型调用 update_goal(action=complete) 时另在 tools/pre-execute 检查。
送给 Jev
原生 Goal 的当前目标、修订和当前/上一轮可见记录,以及完成申请所依据的 Session 证据。
如何采用
连续 no-progress 达阈值(默认 3)或需要用户决定时暂停原生 Goal;progress 清零计数。模型完成申请只在 complete 判断下交给原生工具。

实现依据:原生 Goal 轮次与完成申请 ↗

真实主模型 + 真实 Jev

等人提供标记文件,而不是无限轮询

创建一个只读原生目标:等待由人创建的标记文件;每轮只检查一次,模型不得自行创建。初始没有该文件,本次把停滞门槛临时设为两轮。

执行与核查检查两轮结束后的原生目标状态;人工创建文件、恢复目标,再看模型是否读取新内容及如何申请完成。

实际观察

两轮无进展后目标暂停。人工创建标记并恢复后,主模型读取内容,申请完成,Jev 允许完成。证据:六项监督与纠正:公开验收摘要 ↗

暂停、恢复与完成准入在这条真实路径发生;整体完成率或耗时提升尚未量化。

自动化 · 默认门槛

三轮连续无进展才暂停

在发布版 AgentLoop 与原生 Goal driver 中,让固定 Jev 应答连续三轮 no-progress。

执行与核查核对原生 Goal 轮次与暂停状态,并测试中途 progress 会清零计数。

实际观察

默认第三轮后暂停;出现有效进展时从零重新计数。证据:六项监督与纠正:公开验收摘要 ↗Goal 轮次测试 ↗

固定应答验证生命周期,不代表真实 Jev 对每轮进展的判断准确。

这些结果的边界

  • 本次真实样例没有触发拒绝过早完成和用户手动完成。
  • 暂停后是否继续由人决定。