Behavioral evaluation / public research snapshot

CCB 不只看最终答案,也检查它是怎么完成的。

九类真实编码 Agent 行为实验,把 Prompt、Verifier、Runtime Gate、Skill、工具干预和最终声明放进同一条可回溯证据链。

查看 GitHub 项目 阅读完整报告 浏览九类实验
证据边界当前页面展示的是 macOS development smoke:Fresh Verification 为每臂 3 次,其余多为每臂 1 次或单个 probe。它证明链路可运行,不证明策略具有普遍优势,也不替代预注册的 clean Linux campaign。
9独立实验族
3-statePASS / FAIL / INDETERMINATE
6Fresh Verification 正式编排槽位
0已观察到的 Fresh Verification 描述性 delta

九类实验与最后结果

结果保留“任务是否完成”和“机制是否按预期执行”的区别。一次 PASS/FAIL 是可审计观察,不自动升级为产品结论。

01 / VERIFICATION

Fresh Verification Under User Pressure

用户声称测试已通过并施压跳过复验时,Agent 是否仍在最终修改后验证并再提交。

Control 2/3 · Treatment 2/3
02 / AGENT

Verification Agent

比较 none、always、after-third-edit、risk-triggered 四种触发策略是否形成完整验证闭环。

0 PASS · 3 FAIL · 1 INDETERMINATE
03 / GATE

Goal Complete Gate

比较 Prompt、自报结构化完成条件与高风险 Verifier Gate 对无证据完成的约束。

3/3 PASS(每臂 n=1)
04 / LEARNING

Skill Learning Deferral

比较按次数晋升与按成功结果晋升,检查坏 Skill 是否被错误激活。

两臂任务 FAIL;outcome gate 阻止坏 Skill
05 / VERIFIER

Verifier Independence

改变 Verifier 接收的上下文,检查锚定、rubber-stamp、缺陷发现和最终结果生成。

0 PASS;两臂发现 planted defect
06 / KNOWLEDGE

Skill Value / Knowledge Consumption

区分 Skill 可用、被召回、进入关键请求以及最终改变任务结果。

0/2 PASS;召回 ≠ 首请求消费
07 / TOOLING

Read Before Write

比较静态 Prompt、动态提醒、Hook warning/block 和系统 auto-read。

Reminder、Auto-read PASS;其余 FAIL
08 / TRUTH

Hallucination Catalog

按 Path、Symbol、API、Config、Dependency、Platform、Result 分类事实错误和恢复。

Result probe 0/2 PASS;遗漏不误算为幻觉
09 / PROMPT

Legacy Prompt vs Lean Prompt

固定 binary 与工具 schema,只替换主 System Prompt,检查效果和方差。

最新 Legacy PASS / Lean FAIL;早期结果相反

真正要测的是执行链

配置存在、规则触发或工具被调用,都不等于知识真的进入决策并改变结果。

Eligible策略适用于当前情境
Triggered触发条件被识别
ExecutedAgent / Gate / Skill 真正执行
Consumed结果进入主决策
Outcome行为或任务结果改变

目前能说什么

追加规则没有显示出可见增益

Fresh Verification 的 Control 与 Treatment 都是 2/3。样本极小,且默认 Prompt 已经要求验证,所以这只是一条描述性观察。

动态干预比静态文本更接近行为点

Read Before Write 的单个 user-pressure probe 中,dynamic reminder 与 auto-read 通过;但 hook-block 分支并未真正被触发。

召回不是消费

Skill Value 的 Treatment 能召回目标 Skill,却没有证据证明 Skill 正文进入第一个关键 provider request,也没有改善任务成功。

小样本结果会反转

Legacy vs Lean 的两轮 development smoke 出现相反排序,说明 n=1 不足以决定 Prompt 方向。

运行与检查

公开 CI 只运行静态检查。Live eval 会启动具有宽权限的 Coding-Agent,必须在可信、隔离的本地或容器环境中执行。

bun install
bun run check
bun run quorum check

# 启动只读实时 dashboard
bun run dashboard -- --results /absolute/path/to/results

# 查看 CCB 实验入口
bun run ccb-eval --help