test_orchestration_validation_policy.py 21 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330331332333334335336337338339340341342343344345346347348349350351352353354355356357358359360361362363364365366367368369370371372373374375376377378379380381382383384385386387388389390391392393394395396397398399400401402403404405406407408409410411412413414415416417418419420421422423424425426427428429430431432433434435436437438439440441442443444445446447448449450451452453454455456457458459460461462463464465466467468469470471472473474475476477478479480481482483484485486487488489490491492493494495496497498499500501502503504505506507508509510511512513514515516517518519520521522523524525526527528529530531532533534535536537538539540541542543544545546547548549550551552553554555556557558559560561562563564565566567568569570571572573574575576577578579580581582583584585586
  1. from __future__ import annotations
  2. import asyncio
  3. from types import SimpleNamespace
  4. import pytest
  5. from agent.orchestration.config import OrchestrationConfig
  6. from agent.orchestration.evidence import (
  7. EvidenceBudgetExceeded,
  8. EvidenceOwnershipError,
  9. EvidenceProviderError,
  10. EvidenceProviderResult,
  11. EvidenceQuery,
  12. )
  13. from agent.orchestration.models import (
  14. AcceptanceCriterion,
  15. AgentRole,
  16. ArtifactRef,
  17. ArtifactSnapshot,
  18. AttemptSubmission,
  19. TaskAttempt,
  20. TaskRecord,
  21. TaskSpec,
  22. ValidationMode,
  23. ValidationPlan,
  24. ValidationVerdict,
  25. )
  26. from agent.orchestration.protocols import WorkerRunResult
  27. from agent.orchestration.store import FileSystemArtifactStore, FileSystemTaskStore
  28. from agent.orchestration.validation_policy import (
  29. DefaultValidationPolicy,
  30. DeterministicRuleResult,
  31. RuleBasedDeterministicValidator,
  32. ValidationContext,
  33. )
  34. from agent.orchestration.wiring import wire_orchestration
  35. from test_coordinator_integration import (
  36. ROOT_TASK_SPEC,
  37. FakeExecutor,
  38. create_task,
  39. make_coordinator,
  40. )
  41. def make_context(root: str = "root") -> ValidationContext:
  42. task = TaskRecord(
  43. task_id="task-1",
  44. parent_task_id=None,
  45. display_path="1",
  46. specs=[
  47. TaskSpec(
  48. version=1,
  49. objective="validate",
  50. acceptance_criteria=[AcceptanceCriterion("criterion", "validate result")],
  51. )
  52. ],
  53. )
  54. attempt = TaskAttempt(
  55. attempt_id="attempt-1",
  56. task_id=task.task_id,
  57. spec_version=1,
  58. worker_trace_id="worker-1",
  59. worker_preset="worker",
  60. execution_mode="new",
  61. snapshot_id="snapshot-1",
  62. )
  63. snapshot = ArtifactSnapshot(
  64. snapshot_id="snapshot-1",
  65. attempt_id=attempt.attempt_id,
  66. normalized_content={"summary": "done"},
  67. sha256="digest",
  68. artifact_refs=[],
  69. evidence_refs=[],
  70. )
  71. return ValidationContext(root, task, attempt, snapshot)
  72. class StaticRule:
  73. def __init__(self, rule_id, verdict):
  74. self.rule_id = rule_id
  75. self.verdict = verdict
  76. def evaluate(self, context):
  77. assert context.snapshot.snapshot_id
  78. return DeterministicRuleResult(self.rule_id, self.verdict, "checked")
  79. class AsyncRule(StaticRule):
  80. async def evaluate(self, context):
  81. await asyncio.sleep(0)
  82. return super().evaluate(context)
  83. class ErrorRule:
  84. rule_id = "error"
  85. def evaluate(self, context):
  86. raise RuntimeError("broken rule")
  87. class DeterministicPolicy:
  88. def __init__(self, verdict=ValidationVerdict.PASSED):
  89. self.verdict = verdict
  90. def plan(self, context):
  91. return ValidationPlan(
  92. mode=ValidationMode.DETERMINISTIC,
  93. validator_preset=None,
  94. rule_ids=[item.criterion_id for item in context.task.current_spec.acceptance_criteria],
  95. )
  96. class FixedPolicy:
  97. def __init__(self, plan):
  98. self.fixed_plan = plan
  99. def plan(self, context):
  100. return self.fixed_plan
  101. class InvalidBlankPolicy:
  102. def plan(self, context):
  103. plan = ValidationPlan()
  104. object.__setattr__(plan, "validator_preset", " ")
  105. return plan
  106. @pytest.mark.asyncio
  107. async def test_default_policy_and_validation_plan_roundtrip():
  108. plan = DefaultValidationPolicy("careful-validator").plan(make_context())
  109. assert plan.mode == ValidationMode.AGENT
  110. assert plan.validator_preset == "careful-validator"
  111. assert ValidationPlan.from_dict(plan.to_dict()) == plan
  112. deterministic = ValidationPlan(
  113. mode=ValidationMode.DETERMINISTIC,
  114. validator_preset=None,
  115. rule_ids=["schema", "checksum"],
  116. max_evidence_queries=2,
  117. )
  118. assert ValidationPlan.from_dict(deterministic.to_dict()) == deterministic
  119. assert ValidationPlan.from_dict({"mode": "deterministic", "rule_ids": []}).validator_preset is None
  120. with pytest.raises(ValueError, match="cannot contain"):
  121. ValidationPlan(rule_ids=["unexpected"])
  122. with pytest.raises(ValueError, match="cannot be blank"):
  123. ValidationPlan(validator_preset=" ")
  124. for kwargs in (
  125. {"max_evidence_queries": True},
  126. {"max_evidence_queries": 1.5},
  127. {"max_evidence_items_per_query": False},
  128. {"evidence_timeout_seconds": True},
  129. ):
  130. with pytest.raises(ValueError):
  131. ValidationPlan(**kwargs)
  132. with pytest.raises(ValueError, match="cannot select"):
  133. ValidationPlan(mode=ValidationMode.DETERMINISTIC)
  134. with pytest.raises(ValueError, match="unique"):
  135. ValidationPlan(
  136. mode=ValidationMode.DETERMINISTIC,
  137. validator_preset=None,
  138. rule_ids=["same", "same"],
  139. )
  140. @pytest.mark.asyncio
  141. async def test_deterministic_rules_aggregate_failures_and_errors():
  142. context = make_context()
  143. validator = RuleBasedDeterministicValidator(
  144. [
  145. StaticRule("pass", ValidationVerdict.PASSED),
  146. AsyncRule("fail", ValidationVerdict.FAILED),
  147. ErrorRule(),
  148. ]
  149. )
  150. result = await validator.validate(
  151. context,
  152. ValidationPlan(
  153. mode=ValidationMode.DETERMINISTIC,
  154. validator_preset=None,
  155. rule_ids=["pass", "missing", "error", "fail"],
  156. ),
  157. )
  158. assert result.verdict == ValidationVerdict.FAILED
  159. assert len(result.errors) == 2
  160. assert result.to_dict()["verdict"] == "failed"
  161. empty = await validator.validate(
  162. context,
  163. ValidationPlan(mode=ValidationMode.DETERMINISTIC, validator_preset=None),
  164. )
  165. assert empty.verdict == ValidationVerdict.INCONCLUSIVE
  166. with pytest.raises(ValueError, match="deterministic plan"):
  167. await validator.validate(context, ValidationPlan())
  168. with pytest.raises(ValueError, match="Duplicate"):
  169. RuleBasedDeterministicValidator(
  170. [
  171. StaticRule("same", ValidationVerdict.PASSED),
  172. StaticRule("same", ValidationVerdict.PASSED),
  173. ]
  174. )
  175. @pytest.mark.asyncio
  176. async def test_coordinator_freezes_default_agent_plan(tmp_path):
  177. executor = FakeExecutor([ValidationVerdict.PASSED])
  178. coordinator, store, _ = await make_coordinator(tmp_path, executor)
  179. task_id = await create_task(coordinator, "default agent policy")
  180. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  181. report = (await store.load("root")).validations[result.validation_id]
  182. assert executor.validator_calls == 1
  183. assert report.validation_plan.mode == ValidationMode.AGENT
  184. assert report.validation_plan.validator_preset == "validator"
  185. assert ValidationPlan.from_dict(report.validation_plan) == report.validation_plan
  186. @pytest.mark.asyncio
  187. @pytest.mark.parametrize("verdict", [ValidationVerdict.PASSED, ValidationVerdict.FAILED])
  188. async def test_coordinator_executes_deterministic_plan_without_agent_validator(tmp_path, verdict):
  189. executor = FakeExecutor([])
  190. coordinator, store, _ = await make_coordinator(tmp_path, executor)
  191. coordinator.validation_policy = DeterministicPolicy()
  192. coordinator.deterministic_validator = RuleBasedDeterministicValidator([StaticRule("c1", verdict)])
  193. task_id = await create_task(coordinator, "deterministic")
  194. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  195. report = (await store.load("root")).validations[result.validation_id]
  196. assert executor.worker_calls == 1
  197. assert executor.validator_calls == 0
  198. assert report.validation_plan.mode == ValidationMode.DETERMINISTIC
  199. assert report.verdict == verdict
  200. assert report.criterion_results[0].criterion_id == "c1"
  201. @pytest.mark.asyncio
  202. @pytest.mark.parametrize(
  203. ("preflight_verdict", "validator_calls", "final_verdict"),
  204. [
  205. (ValidationVerdict.FAILED, 0, ValidationVerdict.FAILED),
  206. (ValidationVerdict.PASSED, 1, ValidationVerdict.PASSED),
  207. ],
  208. )
  209. async def test_agent_validation_skips_model_on_hard_preflight_failure(
  210. tmp_path, preflight_verdict, validator_calls, final_verdict
  211. ):
  212. executor = FakeExecutor([ValidationVerdict.PASSED])
  213. coordinator, store, _ = await make_coordinator(tmp_path, executor)
  214. coordinator.validation_policy = FixedPolicy(ValidationPlan(preflight_rule_ids=("preflight",)))
  215. coordinator.deterministic_validator = RuleBasedDeterministicValidator([StaticRule("preflight", preflight_verdict)])
  216. task_id = await create_task(coordinator, "hybrid preflight")
  217. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  218. report = (await store.load("root")).validations[result.validation_id]
  219. assert executor.validator_calls == validator_calls
  220. assert report.verdict == final_verdict
  221. if preflight_verdict is ValidationVerdict.FAILED:
  222. assert "Deterministic preflight rejected" in report.summary
  223. assert report.execution_stats.total_tokens == 0
  224. def test_wire_orchestration_preserves_legacy_positional_defaults(tmp_path):
  225. runner = SimpleNamespace(trace_store=None, task_coordinator=None)
  226. config = OrchestrationConfig(max_parallel_tasks=2)
  227. event_sink = object()
  228. coordinator = wire_orchestration(
  229. runner,
  230. FileSystemTaskStore(str(tmp_path)),
  231. FileSystemArtifactStore(str(tmp_path)),
  232. config,
  233. event_sink,
  234. )
  235. assert runner.task_coordinator is coordinator
  236. assert coordinator.config is config
  237. assert coordinator.event_sink is event_sink
  238. assert isinstance(coordinator.validation_policy, DefaultValidationPolicy)
  239. assert coordinator.deterministic_validator is None
  240. assert coordinator.evidence_provider is None
  241. @pytest.mark.asyncio
  242. async def test_wire_orchestration_applies_custom_validation_dependencies(tmp_path):
  243. runner = SimpleNamespace(trace_store=None, task_coordinator=None)
  244. policy = DeterministicPolicy()
  245. validator = RuleBasedDeterministicValidator([StaticRule("c1", ValidationVerdict.PASSED)])
  246. provider = EvidenceProvider()
  247. coordinator = wire_orchestration(
  248. runner,
  249. FileSystemTaskStore(str(tmp_path)),
  250. FileSystemArtifactStore(str(tmp_path)),
  251. validation_policy=policy,
  252. deterministic_validator=validator,
  253. evidence_provider=provider,
  254. )
  255. executor = FakeExecutor([])
  256. executor.coordinator = coordinator
  257. coordinator.set_executor(executor)
  258. await coordinator.ensure_ledger("root", ROOT_TASK_SPEC)
  259. task_id = await create_task(coordinator, "wired deterministic validation")
  260. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  261. report = (await coordinator.task_store.load("root")).validations[result.validation_id]
  262. assert runner.task_coordinator is coordinator
  263. assert coordinator.validation_policy is policy
  264. assert coordinator.deterministic_validator is validator
  265. assert coordinator.evidence_provider is provider
  266. assert executor.validator_calls == 0
  267. assert report.validation_plan.mode == ValidationMode.DETERMINISTIC
  268. assert report.verdict == ValidationVerdict.PASSED
  269. @pytest.mark.asyncio
  270. @pytest.mark.parametrize("rule_ids", [[], ["unknown"]])
  271. async def test_deterministic_plan_must_cover_hard_criteria_without_unknowns(tmp_path, rule_ids):
  272. executor = FakeExecutor([])
  273. coordinator, _, _ = await make_coordinator(tmp_path, executor)
  274. coordinator.validation_policy = FixedPolicy(
  275. ValidationPlan(
  276. mode=ValidationMode.DETERMINISTIC,
  277. validator_preset=None,
  278. rule_ids=rule_ids,
  279. )
  280. )
  281. coordinator.deterministic_validator = RuleBasedDeterministicValidator([])
  282. task_id = await create_task(coordinator, "invalid deterministic mapping")
  283. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  284. assert "criteria" in (result.error or "")
  285. assert executor.validator_calls == 0
  286. @pytest.mark.asyncio
  287. async def test_coordinator_rejects_custom_policy_with_blank_agent_preset(tmp_path):
  288. executor = FakeExecutor([])
  289. coordinator, _, _ = await make_coordinator(tmp_path, executor)
  290. coordinator.validation_policy = InvalidBlankPolicy()
  291. task_id = await create_task(coordinator, "invalid preset")
  292. result = (await coordinator.dispatch_tasks("root", [task_id]))[0]
  293. assert "cannot be blank" in (result.error or "")
  294. assert executor.validator_calls == 0
  295. class EvidencePolicy:
  296. def __init__(self, max_queries=1, timeout=0.1):
  297. self.max_queries = max_queries
  298. self.timeout = timeout
  299. def plan(self, context):
  300. return ValidationPlan(
  301. max_evidence_queries=self.max_queries,
  302. max_evidence_items_per_query=1,
  303. evidence_timeout_seconds=self.timeout,
  304. )
  305. class EvidenceProvider:
  306. def __init__(self, *, delay=0, error=None, item_count=1, items=None):
  307. self.delay = delay
  308. self.error = error
  309. self.item_count = item_count
  310. self.items = items
  311. self.requests = []
  312. async def query(self, request):
  313. self.requests.append(request)
  314. if self.delay:
  315. await asyncio.sleep(self.delay)
  316. if self.error:
  317. raise self.error
  318. return EvidenceProviderResult(
  319. items=(self.items if self.items is not None else [{"index": index} for index in range(self.item_count)]),
  320. evidence_refs=[ArtifactRef(uri="memory://evidence", version="1")],
  321. )
  322. class BlockingValidatorExecutor:
  323. def __init__(self):
  324. self.coordinator = None
  325. self.context_ready = asyncio.Event()
  326. self.context = None
  327. async def run_worker(self, context):
  328. await self.coordinator.submit_attempt(
  329. {
  330. **context,
  331. "role": AgentRole.WORKER.value,
  332. "trace_id": context["worker_trace_id"],
  333. "tool_call_id": f"submit-{context['attempt_id']}",
  334. },
  335. AttemptSubmission("done", [ArtifactRef(uri="memory://work", version="1")]),
  336. )
  337. return WorkerRunResult(context["worker_trace_id"], "completed")
  338. async def run_validator(self, context):
  339. self.context = context
  340. self.context_ready.set()
  341. await asyncio.Event().wait()
  342. async def stop(self, trace_id):
  343. return True
  344. async def running_evidence_validation(tmp_path, provider, *, max_queries=1, timeout=0.1):
  345. executor = BlockingValidatorExecutor()
  346. coordinator, store, _ = await make_coordinator(tmp_path, executor)
  347. coordinator.config = OrchestrationConfig(stop_grace_seconds=0)
  348. coordinator.validation_policy = EvidencePolicy(max_queries, timeout)
  349. coordinator.evidence_provider = provider
  350. task_id = await create_task(coordinator, "evidence")
  351. operation = await coordinator.start_operation("root", "dispatch", task_ids=[task_id])
  352. await asyncio.wait_for(executor.context_ready.wait(), timeout=1)
  353. context = executor.context
  354. actor = {
  355. **context,
  356. "role": AgentRole.VALIDATOR.value,
  357. "trace_id": context["validator_trace_id"],
  358. "tool_call_id": "evidence-1",
  359. }
  360. request = EvidenceQuery(
  361. root_trace_id="root",
  362. task_id=task_id,
  363. attempt_id=context["attempt_id"],
  364. snapshot_id=context["snapshot_id"],
  365. validation_id=context["validation_id"],
  366. query="facts",
  367. limit=100,
  368. )
  369. return coordinator, store, operation, actor, request
  370. @pytest.mark.asyncio
  371. async def test_wire_orchestration_applies_custom_evidence_provider(tmp_path):
  372. runner = SimpleNamespace(trace_store=None, task_coordinator=None)
  373. provider = EvidenceProvider()
  374. policy = EvidencePolicy(max_queries=1, timeout=0.1)
  375. coordinator = wire_orchestration(
  376. runner,
  377. FileSystemTaskStore(str(tmp_path)),
  378. FileSystemArtifactStore(str(tmp_path)),
  379. OrchestrationConfig(stop_grace_seconds=0),
  380. validation_policy=policy,
  381. evidence_provider=provider,
  382. )
  383. executor = BlockingValidatorExecutor()
  384. executor.coordinator = coordinator
  385. coordinator.set_executor(executor)
  386. await coordinator.ensure_ledger("root", ROOT_TASK_SPEC)
  387. task_id = await create_task(coordinator, "wired evidence provider")
  388. operation = await coordinator.start_operation(
  389. "root",
  390. "dispatch",
  391. task_ids=[task_id],
  392. )
  393. try:
  394. await asyncio.wait_for(executor.context_ready.wait(), timeout=1)
  395. context = executor.context
  396. actor = {
  397. **context,
  398. "role": AgentRole.VALIDATOR.value,
  399. "trace_id": context["validator_trace_id"],
  400. "tool_call_id": "wired-evidence-1",
  401. }
  402. request = EvidenceQuery(
  403. root_trace_id="root",
  404. task_id=task_id,
  405. attempt_id=context["attempt_id"],
  406. snapshot_id=context["snapshot_id"],
  407. validation_id=context["validation_id"],
  408. query="wired facts",
  409. limit=100,
  410. )
  411. response = await coordinator.query_evidence(actor, request)
  412. report = (await coordinator.task_store.load("root")).validations[request.validation_id]
  413. assert coordinator.validation_policy is policy
  414. assert coordinator.evidence_provider is provider
  415. assert len(provider.requests) == 1
  416. assert provider.requests[0].limit == 1
  417. assert response.items == [{"index": 0}]
  418. assert report.evidence_queries_used == 1
  419. finally:
  420. await coordinator.stop_operation("root", operation.operation_id)
  421. @pytest.mark.asyncio
  422. async def test_coordinator_evidence_ownership_and_persistent_budget(tmp_path):
  423. provider = EvidenceProvider()
  424. coordinator, store, operation, actor, request = await running_evidence_validation(tmp_path, provider)
  425. response = await coordinator.query_evidence(actor, request)
  426. assert response.queries_used == 1
  427. assert response.queries_remaining == 0
  428. assert provider.requests[0].limit == 1
  429. report = (await store.load("root")).validations[request.validation_id]
  430. assert report.evidence_queries_used == 1
  431. assert next(iter(report.evidence_query_results.values()))["status"] == "completed"
  432. replay = await coordinator.query_evidence(actor, request)
  433. assert replay.queries_used == 1
  434. assert len(provider.requests) == 1
  435. with pytest.raises(EvidenceBudgetExceeded):
  436. await coordinator.query_evidence(
  437. {**actor, "tool_call_id": "evidence-2"},
  438. EvidenceQuery(**{**request.__dict__, "query": "more"}),
  439. )
  440. with pytest.raises(EvidenceOwnershipError):
  441. await coordinator.query_evidence(
  442. {**actor, "tool_call_id": "foreign"},
  443. EvidenceQuery(**{**request.__dict__, "snapshot_id": "foreign"}),
  444. )
  445. with pytest.raises(EvidenceOwnershipError):
  446. await coordinator.query_evidence(
  447. {**actor, "trace_id": "foreign", "tool_call_id": "foreign-trace"},
  448. request,
  449. )
  450. await coordinator.stop_operation("root", operation.operation_id)
  451. @pytest.mark.asyncio
  452. @pytest.mark.parametrize(
  453. ("provider", "message"),
  454. [
  455. (EvidenceProvider(delay=0.05), "timed out"),
  456. (EvidenceProvider(error=RuntimeError("offline")), "offline"),
  457. (EvidenceProvider(item_count=2), "more than"),
  458. (EvidenceProvider(items=[{"bad": object()}]), "non-JSON"),
  459. ],
  460. )
  461. async def test_evidence_provider_failures_are_validation_errors(tmp_path, provider, message):
  462. timeout = 0.001 if provider.delay else 0.1
  463. coordinator, store, operation, actor, request = await running_evidence_validation(
  464. tmp_path,
  465. provider,
  466. timeout=timeout,
  467. )
  468. with pytest.raises(EvidenceProviderError, match=message):
  469. await coordinator.query_evidence(actor, request)
  470. assert (await store.load("root")).validations[request.validation_id].evidence_queries_used == 1
  471. with pytest.raises(EvidenceProviderError, match=message):
  472. await coordinator.query_evidence(actor, request)
  473. assert len(provider.requests) == 1
  474. await coordinator.stop_operation("root", operation.operation_id)
  475. @pytest.mark.asyncio
  476. async def test_concurrent_evidence_replay_calls_provider_once(tmp_path):
  477. provider = EvidenceProvider(delay=0.02)
  478. coordinator, _, operation, actor, request = await running_evidence_validation(
  479. tmp_path,
  480. provider,
  481. )
  482. responses = await asyncio.gather(
  483. coordinator.query_evidence(actor, request),
  484. coordinator.query_evidence(actor, request),
  485. )
  486. assert [item.queries_used for item in responses] == [1, 1]
  487. assert len(provider.requests) == 1
  488. await coordinator.stop_operation("root", operation.operation_id)
  489. def test_evidence_query_rejects_empty_scope_and_limit():
  490. values = {
  491. "root_trace_id": "root",
  492. "task_id": "task",
  493. "attempt_id": "attempt",
  494. "snapshot_id": "snapshot",
  495. "validation_id": "validation",
  496. "query": "facts",
  497. }
  498. with pytest.raises(ValueError, match="query"):
  499. EvidenceQuery(**{**values, "query": " "})
  500. with pytest.raises(ValueError, match="limit"):
  501. EvidenceQuery(**values, limit=0)
  502. with pytest.raises(ValueError, match="limit"):
  503. EvidenceQuery(**values, limit=True)
  504. with pytest.raises(ValueError, match="root_trace_id"):
  505. EvidenceQuery(**{**values, "root_trace_id": 123})