Files
whetstone_DSL/sprint186_plan.md

976 B

Sprint 186 Plan: Execution-Specific Scoring Calibration I

Context

executionSpecificityScore exists but calibration is shallow.

Goals

  1. Build calibration corpus from recent taskitem runs
  2. Measure false-ready and false-blocked rates
  3. Define scoring threshold candidates by gap class

Steps

Step 1969: Calibration corpus loader (10 tests)

Aggregate historical taskitem artifacts into labeled calibration records.

Step 1970: Score-vs-outcome analyzer (10 tests)

Compute score distributions across green vs blocked outcomes.

Step 1971: Threshold recommendation engine (8 tests)

Emit deterministic threshold candidates for strict mode.

Step 1972: Misclassification report export (8 tests)

Write machine-readable false-positive/false-negative reports.

Step 1973: Sprint 186 Integration Summary (8 tests)

Add editor/src/Sprint186IntegrationSummary.h.

Architecture Gate

  • Calibration outputs must be reproducible and artifact-backed.