feat(examples): add evaluation-optimization closed-loop example with report and gate - #255
feat(examples): add evaluation-optimization closed-loop example with report and gate#255AsyncKurisu wants to merge 2 commits into
Conversation
Codecov Report✅ All modified and coverable lines are covered by tests. Additional details and impacted files@@ Coverage Diff @@
## main #255 +/- ##
==========================================
Coverage ? 87.86456%
==========================================
Files ? 482
Lines ? 45157
Branches ? 0
==========================================
Hits ? 39677
Misses ? 5480
Partials ? 0 ☔ View full report in Codecov by Harness. 🚀 New features to boost your workflow:
|
AI Code Review已确认。这些测试断言(overall=5, train candidate failed=0, overall_change_type="mixed", new_pass=2, critical_regression=1)与已提交报告中的值(overall=6, train candidate failed=1, "unchanged", new_pass=0, critical_regression=0)存在冲突。由于测试在执行时会重新运行流水线并重新生成报告,因此它们会通过(我的逻辑推导结果与测试一致)——但这意味着仓库中已提交的 注意:我无法在此沙箱环境中执行测试套件进行验证,但逻辑推导结果是决定性的:模拟候选路径添加了 让我写出审查意见。 发现的问题🚨 Critical
|
AI Code Review很好,SDK 会展开 注意:如果设置了 现在我已经掌握了足够的信息来定稿。我的结论是:没有 Critical 问题,有几个小的 Warning/Suggestion。鉴于指示要求避免低价值的建议且限制 Suggestion 的数量,我将只报告真正有维护价值的问题。 让我重新考虑 regex 问题是否符合条件。在 再重新考虑一下: 让我再重新考虑一下是否存在真正的资源/超时问题 —— real 模式按顺序运行用例且没有超时设置,依赖 SDK 自身的超时机制。对于示例来说是可以接受的。 我将定稿并附上这些发现。让我再快速验证一下一个可能确实重要的正确性细节: 现在我来写最终审查报告。我会保持简洁。我指出的问题都很轻微;我应该诚实评估是否需要将其提高到 Warning 级别。我将其报告为两个 Warning 级别的问题(它们都是真实的,但不会阻塞合并)。 实际上,让我重新考虑一下 pass-rate 规则是否真的会产生错误行为。当 我将提出 regex 问题作为主要可操作项,pass-rate 不一致作为一个次要问题。我不需要 Suggestion,因为它们价值很低。让我写下来。基于对 发现的问题
|
Overview
Resolves #91
This PR adds a complete example-only evaluation and optimization loop under
examples/optimization/eval_optimize_loop/. The pipeline runs baseline evaluation, failure attribution, prompt optimization, candidate validation, delta analysis, and gate decisioning, then writes both a machine-readable JSON report and a human-readable Markdown report.Key Changes
How to Run
Fake mode
cd examples/optimization/eval_optimize_loop python run_pipeline.py --mode fake pytest examples/optimization/eval_optimize_loop/tests -qReal mode