- 已覆盖 8 条 fixture:
clean.diffsecurity_issue.diffasync_resource_leak.diffdb_lifecycle_issue.diffmissing_tests.diffduplicate_finding.diffsandbox_failure.diffsecret_redaction.diff
- 已有集成测试和 CLI 路径生成
review_report.json与review_report.md - Phase 6 额外验证:
fixture_runs_ok=8- 新增质量门禁测试
test_all_public_fixtures_generate_reports
- 当前实现以高信号确定性规则优先:
evalexecpickle.loadsyaml.loadshell=True- secret patterns
- 低置信项自动降级为
needs_human_review或warning - 当前示例给出工程策略和测试基线,但隐藏样本上的最终指标仍需 PR 前人工复核说明
- SQLite 已持久化:
review_tasksreview_inputsfilter_decisionssandbox_runsfindingsreview_reports
- 已支持
get_review_bundle(task_id)查询完整链路
- 脚本执行层有 timeout
- stdout/stderr 有统一截断上限
- sandbox failure / timeout 转换为结构化记录和 finding
- 已有
sandbox_failure.diff测试
- 报告和数据库前统一调用
redactor.py - 覆盖:
- API key
- token
- password
- bearer token
- private key
- 已有
secret_redaction.diff集成测试
- 主链路不依赖真实模型
- 规则和脚本执行均为轻量 deterministic 路径
- 当前测试集运行时间远低于 2 分钟
- Phase 6 单次 security fixture dry-run 实测约
9.87s
- 所有 skill 脚本执行前统一经过
filter_policy.py deny / needs_human_review不直接进入执行- 已测试 forbidden path 拦截
- 当前报告包含:
- findings
- severity stats
- human review items
- filter summary
- sandbox summary
- monitoring summary
- actionable recommendations
- README 与最终示例输出是否同步
- 设计说明是否满足 300-500 字要求
- 是否需要再补一轮原生
skill_run接入说明 - 是否需要附上最终 sample outputs 供 reviewer 直接查看