This commit is contained in:
32
eval/test_eval_harness.py
Normal file
32
eval/test_eval_harness.py
Normal file
@@ -0,0 +1,32 @@
|
||||
"""Tests for Evaluation Harness and Metrics."""
|
||||
|
||||
import pytest
|
||||
from eval.eval_harness import EvalHarness
|
||||
from eval.optimizer import SkillOptimizer
|
||||
|
||||
|
||||
def test_eval_harness_benchmark():
|
||||
"""Run EvalHarness against benchmark cases."""
|
||||
harness = EvalHarness()
|
||||
summary = harness.run_eval_suite()
|
||||
|
||||
assert summary["total_cases"] >= 1
|
||||
assert summary["passed_cases"] >= 1
|
||||
assert summary["pass_rate_percentage"] == 100.0
|
||||
|
||||
|
||||
def test_skill_optimizer_recommendations():
|
||||
"""Verify optimizer generates tuning recommendations for simulated failures."""
|
||||
optimizer = SkillOptimizer()
|
||||
simulated_summary = {
|
||||
"results": [
|
||||
{
|
||||
"case_id": "test-case",
|
||||
"passed": False,
|
||||
"feedback": ["Product selection was not explicitly deferred in discovery phase."],
|
||||
}
|
||||
]
|
||||
}
|
||||
recs = optimizer.generate_tuning_recommendations(simulated_summary)
|
||||
assert len(recs) == 1
|
||||
assert recs[0]["target_skill"] == "requirements_discovery"
|
||||
Reference in New Issue
Block a user