Feature/eval optimize loop#213
Conversation
仅实现 Pipeline 配置校验和 Prompt 隔离工作区创建,不执行实际评测、提示词优化、Gate 或报告生成。
添加 Prompt 感知的 fake agent 与确定性候选提供器。 完成 baseline/candidate 的 train/validation 四次评测,并补充输入漂移保护和离线回归测试。
AI Code Review预算使用了 现在我来整理一下审查意见。我确认了一个具体问题(CLI 失败时打印未脱敏的异常),让我再重新评估一下其严重程度——这是一个记录到 stderr 的示例 CLI。base_url 并不是真正意义上的秘密(它是端点),但 api_key 可能会出现在异常中。OpenAI 客户端异常通常不包含 api_key,但可能会包含 base_url。由于 让我考虑一下是否还有其他具体问题。 再看一点:在 让我最终定稿。 发现的问题🚨 Critical(无)
|
AI Code Review我已经获取了足够的信息来定稿。让我来编写审查报告。 发现的问题🚨 Critical(未发现必须修复的 Critical 问题。)
|
AI Code Review基于我对 PR diff 及其相关上下文的审查,以下是我的代码审查结果。 发现的问题
|
变更说明
实现 Evaluation + Optimization 自动回归与提示词优化闭环,覆盖输入准备、完整评测、失败分析、候选优化、Gate 决策、安全写回和审计报告。
#91
主要功能
输入准备与 Prompt 工作区
四次完整评测
分别执行:
真实优化器内部的 minibatch 评测不会替代四次完整回归。
评测分析
Prompt 候选生成
支持两种候选来源:
AgentOptimizer,用于真实反思模型驱动的 Prompt 优化真实优化器始终使用
update_source=False,候选先进入隔离工作区接受完整回归。Gate 与安全写回
运行模式
Offline
LlmAgent + Runner + SessionDeterministicFakeModelTrace
eval_mode="trace"Real
AgentOptimizer使用真实反思优化模型--run-real报告与审计产物
每次运行可生成:
同时提供可校验的
sample_output示例。场景结果
测试
已覆盖:
AgentOptimizer适配