test_orchestration_validation_policy.py 15 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330331332333334335336337338339340341342343344345346347348349350351352353354355356357358359360361362363364365366367368369370371372373374375376377378379380381382383384385386387388389390391392393394395396397398399400401402403404405406407408409410411412413414415416417418419420421422423424425426427428429430431432433434435436437438439440441442443444445446447448449450451452453454455456
  1. from __future__ import annotations
  2. import asyncio
  3. import pytest
  4. from agent.orchestration.config import OrchestrationConfig
  5. from agent.orchestration.evidence import (
  6. EvidenceBudgetExceeded,
  7. EvidenceOwnershipError,
  8. EvidenceProviderError,
  9. EvidenceProviderResult,
  10. EvidenceQuery,
  11. )
  12. from agent.orchestration.models import (
  13. AgentRole,
  14. ArtifactRef,
  15. ArtifactSnapshot,
  16. AttemptSubmission,
  17. TaskAttempt,
  18. TaskRecord,
  19. TaskSpec,
  20. ValidationMode,
  21. ValidationPlan,
  22. ValidationVerdict,
  23. )
  24. from agent.orchestration.protocols import WorkerRunResult
  25. from agent.orchestration.validation_policy import (
  26. DefaultValidationPolicy,
  27. DeterministicRuleResult,
  28. RuleBasedDeterministicValidator,
  29. ValidationContext,
  30. )
  31. from test_coordinator_integration import FakeExecutor, create_task, make_coordinator
  32. def make_context(root: str = "root") -> ValidationContext:
  33. task = TaskRecord(
  34. task_id="task-1",
  35. goal_id=None,
  36. parent_task_id=None,
  37. display_path="1",
  38. specs=[TaskSpec(version=1, objective="validate")],
  39. )
  40. attempt = TaskAttempt(
  41. attempt_id="attempt-1",
  42. task_id=task.task_id,
  43. spec_version=1,
  44. worker_trace_id="worker-1",
  45. worker_preset="worker",
  46. execution_mode="new",
  47. snapshot_id="snapshot-1",
  48. )
  49. snapshot = ArtifactSnapshot(
  50. snapshot_id="snapshot-1",
  51. attempt_id=attempt.attempt_id,
  52. normalized_content={"summary": "done"},
  53. sha256="digest",
  54. artifact_refs=[],
  55. evidence_refs=[],
  56. )
  57. return ValidationContext(root, task, attempt, snapshot)
  58. class StaticRule:
  59. def __init__(self, rule_id, verdict):
  60. self.rule_id = rule_id
  61. self.verdict = verdict
  62. def evaluate(self, context):
  63. assert context.snapshot.snapshot_id
  64. return DeterministicRuleResult(self.rule_id, self.verdict, "checked")
  65. class AsyncRule(StaticRule):
  66. async def evaluate(self, context):
  67. await asyncio.sleep(0)
  68. return super().evaluate(context)
  69. class ErrorRule:
  70. rule_id = "error"
  71. def evaluate(self, context):
  72. raise RuntimeError("broken rule")
  73. class DeterministicPolicy:
  74. def __init__(self, verdict=ValidationVerdict.PASSED):
  75. self.verdict = verdict
  76. def plan(self, context):
  77. return ValidationPlan(
  78. mode=ValidationMode.DETERMINISTIC,
  79. validator_preset=None,
  80. rule_ids=[item.criterion_id for item in context.task.current_spec.acceptance_criteria],
  81. )
  82. class FixedPolicy:
  83. def __init__(self, plan):
  84. self.fixed_plan = plan
  85. def plan(self, context):
  86. return self.fixed_plan
  87. class InvalidBlankPolicy:
  88. def plan(self, context):
  89. plan = ValidationPlan()
  90. object.__setattr__(plan, "validator_preset", " ")
  91. return plan
  92. @pytest.mark.asyncio
  93. async def test_default_policy_and_validation_plan_roundtrip():
  94. plan = DefaultValidationPolicy("careful-validator").plan(make_context())
  95. assert plan.mode == ValidationMode.AGENT
  96. assert plan.validator_preset == "careful-validator"
  97. assert ValidationPlan.from_dict(plan.to_dict()) == plan
  98. deterministic = ValidationPlan(
  99. mode=ValidationMode.DETERMINISTIC,
  100. validator_preset=None,
  101. rule_ids=["schema", "checksum"],
  102. max_evidence_queries=2,
  103. )
  104. assert ValidationPlan.from_dict(deterministic.to_dict()) == deterministic
  105. assert ValidationPlan.from_dict(
  106. {"mode": "deterministic", "rule_ids": []}
  107. ).validator_preset is None
  108. with pytest.raises(ValueError, match="cannot contain"):
  109. ValidationPlan(rule_ids=["unexpected"])
  110. with pytest.raises(ValueError, match="cannot be blank"):
  111. ValidationPlan(validator_preset=" ")
  112. for kwargs in (
  113. {"max_evidence_queries": True},
  114. {"max_evidence_queries": 1.5},
  115. {"max_evidence_items_per_query": False},
  116. {"evidence_timeout_seconds": True},
  117. ):
  118. with pytest.raises(ValueError):
  119. ValidationPlan(**kwargs)
  120. with pytest.raises(ValueError, match="cannot select"):
  121. ValidationPlan(mode=ValidationMode.DETERMINISTIC)
  122. with pytest.raises(ValueError, match="unique"):
  123. ValidationPlan(
  124. mode=ValidationMode.DETERMINISTIC,
  125. validator_preset=None,
  126. rule_ids=["same", "same"],
  127. )
  128. @pytest.mark.asyncio
  129. async def test_deterministic_rules_aggregate_failures_and_errors():
  130. context = make_context()
  131. validator = RuleBasedDeterministicValidator(
  132. [
  133. StaticRule("pass", ValidationVerdict.PASSED),
  134. AsyncRule("fail", ValidationVerdict.FAILED),
  135. ErrorRule(),
  136. ]
  137. )
  138. result = await validator.validate(
  139. context,
  140. ValidationPlan(
  141. mode=ValidationMode.DETERMINISTIC,
  142. validator_preset=None,
  143. rule_ids=["pass", "missing", "error", "fail"],
  144. ),
  145. )
  146. assert result.verdict == ValidationVerdict.FAILED
  147. assert len(result.errors) == 2
  148. assert result.to_dict()["verdict"] == "failed"
  149. empty = await validator.validate(
  150. context,
  151. ValidationPlan(mode=ValidationMode.DETERMINISTIC, validator_preset=None),
  152. )
  153. assert empty.verdict == ValidationVerdict.INCONCLUSIVE
  154. with pytest.raises(ValueError, match="deterministic plan"):
  155. await validator.validate(context, ValidationPlan())
  156. with pytest.raises(ValueError, match="Duplicate"):
  157. RuleBasedDeterministicValidator(
  158. [
  159. StaticRule("same", ValidationVerdict.PASSED),
  160. StaticRule("same", ValidationVerdict.PASSED),
  161. ]
  162. )
  163. @pytest.mark.asyncio
  164. async def test_coordinator_freezes_default_agent_plan(tmp_path):
  165. executor = FakeExecutor([ValidationVerdict.PASSED])
  166. coordinator, store, _ = await make_coordinator(tmp_path, executor)
  167. task_id = await create_task(coordinator, "default agent policy")
  168. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  169. report = (await store.load("root")).validations[result.validation_id]
  170. assert executor.validator_calls == 1
  171. assert report.validation_plan.mode == ValidationMode.AGENT
  172. assert report.validation_plan.validator_preset == "validator"
  173. assert ValidationPlan.from_dict(report.validation_plan) == report.validation_plan
  174. @pytest.mark.asyncio
  175. @pytest.mark.parametrize(
  176. "verdict", [ValidationVerdict.PASSED, ValidationVerdict.FAILED]
  177. )
  178. async def test_coordinator_executes_deterministic_plan_without_agent_validator(
  179. tmp_path, verdict
  180. ):
  181. executor = FakeExecutor([])
  182. coordinator, store, _ = await make_coordinator(tmp_path, executor)
  183. coordinator.validation_policy = DeterministicPolicy()
  184. coordinator.deterministic_validator = RuleBasedDeterministicValidator(
  185. [StaticRule("c1", verdict)]
  186. )
  187. task_id = await create_task(coordinator, "deterministic")
  188. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  189. report = (await store.load("root")).validations[result.validation_id]
  190. assert executor.worker_calls == 1
  191. assert executor.validator_calls == 0
  192. assert report.validation_plan.mode == ValidationMode.DETERMINISTIC
  193. assert report.verdict == verdict
  194. assert report.criterion_results[0].criterion_id == "c1"
  195. @pytest.mark.asyncio
  196. @pytest.mark.parametrize("rule_ids", [[], ["unknown"]])
  197. async def test_deterministic_plan_must_cover_hard_criteria_without_unknowns(
  198. tmp_path, rule_ids
  199. ):
  200. executor = FakeExecutor([])
  201. coordinator, _, _ = await make_coordinator(tmp_path, executor)
  202. coordinator.validation_policy = FixedPolicy(
  203. ValidationPlan(
  204. mode=ValidationMode.DETERMINISTIC,
  205. validator_preset=None,
  206. rule_ids=rule_ids,
  207. )
  208. )
  209. coordinator.deterministic_validator = RuleBasedDeterministicValidator([])
  210. task_id = await create_task(coordinator, "invalid deterministic mapping")
  211. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  212. assert "criteria" in (result.error or "")
  213. assert executor.validator_calls == 0
  214. @pytest.mark.asyncio
  215. async def test_coordinator_rejects_custom_policy_with_blank_agent_preset(tmp_path):
  216. executor = FakeExecutor([])
  217. coordinator, _, _ = await make_coordinator(tmp_path, executor)
  218. coordinator.validation_policy = InvalidBlankPolicy()
  219. task_id = await create_task(coordinator, "invalid preset")
  220. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  221. assert "cannot be blank" in (result.error or "")
  222. assert executor.validator_calls == 0
  223. class EvidencePolicy:
  224. def __init__(self, max_queries=1, timeout=0.1):
  225. self.max_queries = max_queries
  226. self.timeout = timeout
  227. def plan(self, context):
  228. return ValidationPlan(
  229. max_evidence_queries=self.max_queries,
  230. max_evidence_items_per_query=1,
  231. evidence_timeout_seconds=self.timeout,
  232. )
  233. class EvidenceProvider:
  234. def __init__(self, *, delay=0, error=None, item_count=1, items=None):
  235. self.delay = delay
  236. self.error = error
  237. self.item_count = item_count
  238. self.items = items
  239. self.requests = []
  240. async def query(self, request):
  241. self.requests.append(request)
  242. if self.delay:
  243. await asyncio.sleep(self.delay)
  244. if self.error:
  245. raise self.error
  246. return EvidenceProviderResult(
  247. items=(
  248. self.items
  249. if self.items is not None
  250. else [{"index": index} for index in range(self.item_count)]
  251. ),
  252. evidence_refs=[ArtifactRef(uri="memory://evidence", version="1")],
  253. )
  254. class BlockingValidatorExecutor:
  255. def __init__(self):
  256. self.coordinator = None
  257. self.context_ready = asyncio.Event()
  258. self.context = None
  259. async def run_worker(self, context):
  260. await self.coordinator.submit_attempt(
  261. {
  262. **context,
  263. "role": AgentRole.WORKER.value,
  264. "trace_id": context["worker_trace_id"],
  265. "tool_call_id": f"submit-{context['attempt_id']}",
  266. },
  267. AttemptSubmission("done", [ArtifactRef(uri="memory://work", version="1")]),
  268. )
  269. return WorkerRunResult(context["worker_trace_id"], "completed")
  270. async def run_validator(self, context):
  271. self.context = context
  272. self.context_ready.set()
  273. await asyncio.Event().wait()
  274. async def stop(self, trace_id):
  275. return True
  276. async def running_evidence_validation(tmp_path, provider, *, max_queries=1, timeout=0.1):
  277. executor = BlockingValidatorExecutor()
  278. coordinator, store, _ = await make_coordinator(tmp_path, executor)
  279. coordinator.config = OrchestrationConfig(stop_grace_seconds=0)
  280. coordinator.validation_policy = EvidencePolicy(max_queries, timeout)
  281. coordinator.evidence_provider = provider
  282. task_id = await create_task(coordinator, "evidence")
  283. operation = await coordinator.start_operation("root", "dispatch", task_ids=[task_id])
  284. await asyncio.wait_for(executor.context_ready.wait(), timeout=1)
  285. context = executor.context
  286. actor = {
  287. **context,
  288. "role": AgentRole.VALIDATOR.value,
  289. "trace_id": context["validator_trace_id"],
  290. "tool_call_id": "evidence-1",
  291. }
  292. request = EvidenceQuery(
  293. root_trace_id="root",
  294. task_id=task_id,
  295. attempt_id=context["attempt_id"],
  296. snapshot_id=context["snapshot_id"],
  297. validation_id=context["validation_id"],
  298. query="facts",
  299. limit=100,
  300. )
  301. return coordinator, store, operation, actor, request
  302. @pytest.mark.asyncio
  303. async def test_coordinator_evidence_ownership_and_persistent_budget(tmp_path):
  304. provider = EvidenceProvider()
  305. coordinator, store, operation, actor, request = await running_evidence_validation(
  306. tmp_path, provider
  307. )
  308. response = await coordinator.query_evidence(actor, request)
  309. assert response.queries_used == 1
  310. assert response.queries_remaining == 0
  311. assert provider.requests[0].limit == 1
  312. report = (await store.load("root")).validations[request.validation_id]
  313. assert report.evidence_queries_used == 1
  314. assert next(iter(report.evidence_query_results.values()))["status"] == "completed"
  315. replay = await coordinator.query_evidence(actor, request)
  316. assert replay.queries_used == 1
  317. assert len(provider.requests) == 1
  318. with pytest.raises(EvidenceBudgetExceeded):
  319. await coordinator.query_evidence(
  320. {**actor, "tool_call_id": "evidence-2"},
  321. EvidenceQuery(**{**request.__dict__, "query": "more"}),
  322. )
  323. with pytest.raises(EvidenceOwnershipError):
  324. await coordinator.query_evidence(
  325. {**actor, "tool_call_id": "foreign"},
  326. EvidenceQuery(**{**request.__dict__, "snapshot_id": "foreign"}),
  327. )
  328. with pytest.raises(EvidenceOwnershipError):
  329. await coordinator.query_evidence(
  330. {**actor, "trace_id": "foreign", "tool_call_id": "foreign-trace"},
  331. request,
  332. )
  333. await coordinator.stop_operation("root", operation.operation_id)
  334. @pytest.mark.asyncio
  335. @pytest.mark.parametrize(
  336. ("provider", "message"),
  337. [
  338. (EvidenceProvider(delay=0.05), "timed out"),
  339. (EvidenceProvider(error=RuntimeError("offline")), "offline"),
  340. (EvidenceProvider(item_count=2), "more than"),
  341. (EvidenceProvider(items=[{"bad": object()}]), "non-JSON"),
  342. ],
  343. )
  344. async def test_evidence_provider_failures_are_validation_errors(
  345. tmp_path, provider, message
  346. ):
  347. timeout = 0.001 if provider.delay else 0.1
  348. coordinator, store, operation, actor, request = await running_evidence_validation(
  349. tmp_path,
  350. provider,
  351. timeout=timeout,
  352. )
  353. with pytest.raises(EvidenceProviderError, match=message):
  354. await coordinator.query_evidence(actor, request)
  355. assert (await store.load("root")).validations[request.validation_id].evidence_queries_used == 1
  356. with pytest.raises(EvidenceProviderError, match=message):
  357. await coordinator.query_evidence(actor, request)
  358. assert len(provider.requests) == 1
  359. await coordinator.stop_operation("root", operation.operation_id)
  360. @pytest.mark.asyncio
  361. async def test_concurrent_evidence_replay_calls_provider_once(tmp_path):
  362. provider = EvidenceProvider(delay=0.02)
  363. coordinator, _, operation, actor, request = await running_evidence_validation(
  364. tmp_path,
  365. provider,
  366. )
  367. responses = await asyncio.gather(
  368. coordinator.query_evidence(actor, request),
  369. coordinator.query_evidence(actor, request),
  370. )
  371. assert [item.queries_used for item in responses] == [1, 1]
  372. assert len(provider.requests) == 1
  373. await coordinator.stop_operation("root", operation.operation_id)
  374. def test_evidence_query_rejects_empty_scope_and_limit():
  375. values = {
  376. "root_trace_id": "root",
  377. "task_id": "task",
  378. "attempt_id": "attempt",
  379. "snapshot_id": "snapshot",
  380. "validation_id": "validation",
  381. "query": "facts",
  382. }
  383. with pytest.raises(ValueError, match="query"):
  384. EvidenceQuery(**{**values, "query": " "})
  385. with pytest.raises(ValueError, match="limit"):
  386. EvidenceQuery(**values, limit=0)
  387. with pytest.raises(ValueError, match="limit"):
  388. EvidenceQuery(**values, limit=True)
  389. with pytest.raises(ValueError, match="root_trace_id"):
  390. EvidenceQuery(**{**values, "root_trace_id": 123})