Add raw structural projector before candidate scoring (sprint 263)

This commit is contained in:
Bill
2026-02-26 16:59:28 -07:00
parent f534d7f0fa
commit fe85f1b515
8 changed files with 249 additions and 6 deletions

View File

@@ -247,3 +247,7 @@ Planning runtime controls (active):
- `WSTONE_NATIVE_RAW_TEMPLATE_CONTROL_PACK` - `WSTONE_NATIVE_RAW_TEMPLATE_CONTROL_PACK`
- `WSTONE_NATIVE_RAW_TEMPLATE_CONTROL_MAX_SIGNALS` - `WSTONE_NATIVE_RAW_TEMPLATE_CONTROL_MAX_SIGNALS`
- `native_raw_template_control_pack` - `native_raw_template_control_pack`
- raw candidate scoring can evaluate deterministic structural projections pre-score:
- `tools/mcp/project_raw_candidate_structure.py`
- `WSTONE_NATIVE_RAW_STRUCTURAL_PROJECTOR`
- `native_raw_structural_projector`

View File

@@ -47,7 +47,7 @@ This is the canonical dated registry for "not production-ready" generator gaps.
| GR-018 | Performance/security/rollout constrained refactor enforcement gap | `docs/gap_hunt_fullstack_multifile_2026-02-26.md`, `logs/taskitem_runs/challenging_fullstack_multifile_20260226_r5/results.jsonl` | `partial` | Hard checks now enforce migration rollback + data-loss policy, security deny-by-default, SLO p95 presence, and rollout staged+abort policy. Enforcement is contract-level; generator capability under these constraints is still weak in C++ AB path. | Constraint-aware generation follow-up | | GR-018 | Performance/security/rollout constrained refactor enforcement gap | `docs/gap_hunt_fullstack_multifile_2026-02-26.md`, `logs/taskitem_runs/challenging_fullstack_multifile_20260226_r5/results.jsonl` | `partial` | Hard checks now enforce migration rollback + data-loss policy, security deny-by-default, SLO p95 presence, and rollout staged+abort policy. Enforcement is contract-level; generator capability under these constraints is still weak in C++ AB path. | Constraint-aware generation follow-up |
| GR-019 | Parity-blocked readiness load (gating without capability closure) | `logs/taskitem_runs/challenging_fullstack_multifile_20260226_r7/summary.json`, `logs/taskitem_runs/challenging_subset_prod_20260226_r7/summary.json`, `docs/sprint225_227_execution_tracker_2026-02-26.md` | `partial` | Sprint 225-227 reduced blocked parity load from `6` to `0` on both tracked hard catalogs while keeping unresolved divergence at `0`. This closes immediate safety debt for current corpora, but robustness is still contingent on pattern-driven repair classes. | Generalize repairs beyond queue-shaped transpile outputs | | GR-019 | Parity-blocked readiness load (gating without capability closure) | `logs/taskitem_runs/challenging_fullstack_multifile_20260226_r7/summary.json`, `logs/taskitem_runs/challenging_subset_prod_20260226_r7/summary.json`, `docs/sprint225_227_execution_tracker_2026-02-26.md` | `partial` | Sprint 225-227 reduced blocked parity load from `6` to `0` on both tracked hard catalogs while keeping unresolved divergence at `0`. This closes immediate safety debt for current corpora, but robustness is still contingent on pattern-driven repair classes. | Generalize repairs beyond queue-shaped transpile outputs |
| GR-020 | Semantic fallback overuse masks weak native decomposition | `logs/taskitem_runs/TEST_ONLY_sprint236_semantic_fallback_audit_20260226/semantic_fallback_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint237_semantic_fallback_gate_fail_20260226/semantic_fallback_budget_gate.json`, `logs/taskitem_runs/TEST_ONLY_sprint238_native_gate_fail_20260226.json`, `logs/taskitem_runs/TEST_ONLY_sprint239_semantic_fallback_audit_20260226/semantic_fallback_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint240_retry_20260226_145631/00_summary.json`, `docs/sprint236_execution_tracker_2026-02-26.md`, `docs/sprint237_execution_tracker_2026-02-26.md`, `docs/sprint238_execution_tracker_2026-02-26.md`, `docs/sprint239_execution_tracker_2026-02-26.md`, `docs/sprint240_execution_tracker_2026-02-26.md` | `partial` | Sprint 236 added deterministic fallback-gap auditing with tool + constraint metadata. Sprint 237 added fallback-budget hard gate (`max-fallback-rate`) and produced expected fail/pass artifacts. Sprint 238 added native decomposition hard gate in pipeline (`min task count`, `min semantic signal count`) so weak native generation can be blocked before fallback masking. Sprint 239 added native reason enrichment and improved semantic signal density (`0 -> 6`). Sprint 240 added native decomposition retry with explicit minimum-task policy; on current sample retry attempted but did not improve depth (`2 -> 2`). | Native decomposition task-depth upgrade (increase native task granularity beyond 2) | | GR-020 | Semantic fallback overuse masks weak native decomposition | `logs/taskitem_runs/TEST_ONLY_sprint236_semantic_fallback_audit_20260226/semantic_fallback_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint237_semantic_fallback_gate_fail_20260226/semantic_fallback_budget_gate.json`, `logs/taskitem_runs/TEST_ONLY_sprint238_native_gate_fail_20260226.json`, `logs/taskitem_runs/TEST_ONLY_sprint239_semantic_fallback_audit_20260226/semantic_fallback_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint240_retry_20260226_145631/00_summary.json`, `docs/sprint236_execution_tracker_2026-02-26.md`, `docs/sprint237_execution_tracker_2026-02-26.md`, `docs/sprint238_execution_tracker_2026-02-26.md`, `docs/sprint239_execution_tracker_2026-02-26.md`, `docs/sprint240_execution_tracker_2026-02-26.md` | `partial` | Sprint 236 added deterministic fallback-gap auditing with tool + constraint metadata. Sprint 237 added fallback-budget hard gate (`max-fallback-rate`) and produced expected fail/pass artifacts. Sprint 238 added native decomposition hard gate in pipeline (`min task count`, `min semantic signal count`) so weak native generation can be blocked before fallback masking. Sprint 239 added native reason enrichment and improved semantic signal density (`0 -> 6`). Sprint 240 added native decomposition retry with explicit minimum-task policy; on current sample retry attempted but did not improve depth (`2 -> 2`). | Native decomposition task-depth upgrade (increase native task granularity beyond 2) |
| GR-021 | Impact-specific native decomposition coverage not enforced uniformly | `docs/native_decomposition_impact_list_2026-02-26.md`, `tools/mcp/profiles/native_decomposition_impact_profiles.json`, `logs/taskitem_runs/TEST_ONLY_sprint241_fullstack_impact_20260226_150416/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint241_native_impact_aggregate_20260226/native_impact_coverage_aggregate.json`, `logs/taskitem_runs/TEST_ONLY_sprint242_impact_remediation_loop_20260226/remediation_loop_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint243_impact_remediation_tasks_loop_20260226_r2/remediation_loop_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint244_autofill_20260226_151651/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint244_autofill_enforce_20260226_151709/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint245_intrinsic_20260226_151835/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint246_multishot_20260226_153033/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint246_multishot_enforce_20260226_153045/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint247_singleshot_20260226_153230/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint247_singleshot_enforce_20260226_153241/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint248_rawsearch_20260226_153903/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint249_rawguard_20260226_154028/02ae_raw_candidate_search.json`, `logs/taskitem_runs/TEST_ONLY_sprint250_closure_ladder_20260226/closure_ladder_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint251_rawvariants_20260226_154355/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint252_closure_ladder_policy_skip2_20260226/closure_ladder_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint253_closure_ladder_batch_20260226/closure_ladder_batch_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint254_closure_ladder_batch_20260226_r2/raw_gap_backlog.json`, `logs/taskitem_runs/TEST_ONLY_sprint255_rawharden_20260226_161924/00_summary.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_162423/00_summary.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_162633/02ae_raw_candidate_search.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_162924/01e_raw_top_gap_requirements_report.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_163148/02af_raw_adaptive_retry_score.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_163556/02ae_raw_signal_targeted_variants.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_163855/01f_raw_intrinsic_prompt_pack_report.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165430/01g_raw_template_control_pack_report.json` | `partial` | Sprint 241 introduced impact profiles/gates; 242-243 remediation loops; 244 first-pass autofill; 245 intrinsic constraints only (no uplift); 246 multishot closure; 247 single-shot shaping closure; 248 raw candidate search no uplift; 249 no-uplift guardrail; 250 closure ladder; 251 richer raw variants no uplift; 252 history-aware ladder routing; 253 batch ladder analytics; 254 raw gap backlog synthesis from `raw_only` attempts identifies top missing raw signals; 255 adds first-pass raw top-gap hardening that closes hard-sample profile coverage (`failing_profile_count 7 -> 0`) by injecting missing ops/contracts/reasons and minimum task depth; 256 adds top-gap weighted candidate selection telemetry and tie-break policy; 257 adds hard fail policy when top-gap uplift is required but absent (`exit 18`); 258 injects backlog-driven top-gap normalized requirements before raw generation; 259 adds adaptive retry with expanded top-gap requirements and deterministic retry scoring; 260 adds signal-targeted variant expansion keyed to missing-signal classes and increases intrinsic search breadth (`available_variants 2 -> 8`); 261 adds intrinsic prompt-pack constraint injection keyed to gap signals; 262 adds explicit output-shape template-control pack injection (schema + example + signal mapping) pre-generation. Measured intrinsic output still shows no uplift on this sample (`best_top_gap_score=0`, `failing_profile_count=1`). | Add deterministic post-generation structural projector for raw candidates before scoring (split/normalize schema to enforce missing ops/contracts/reason keywords without full hardening) | | GR-021 | Impact-specific native decomposition coverage not enforced uniformly | `docs/native_decomposition_impact_list_2026-02-26.md`, `tools/mcp/profiles/native_decomposition_impact_profiles.json`, `logs/taskitem_runs/TEST_ONLY_sprint241_fullstack_impact_20260226_150416/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint241_native_impact_aggregate_20260226/native_impact_coverage_aggregate.json`, `logs/taskitem_runs/TEST_ONLY_sprint242_impact_remediation_loop_20260226/remediation_loop_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint243_impact_remediation_tasks_loop_20260226_r2/remediation_loop_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint244_autofill_20260226_151651/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint244_autofill_enforce_20260226_151709/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint245_intrinsic_20260226_151835/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint246_multishot_20260226_153033/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint246_multishot_enforce_20260226_153045/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint247_singleshot_20260226_153230/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint247_singleshot_enforce_20260226_153241/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint248_rawsearch_20260226_153903/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint249_rawguard_20260226_154028/02ae_raw_candidate_search.json`, `logs/taskitem_runs/TEST_ONLY_sprint250_closure_ladder_20260226/closure_ladder_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint251_rawvariants_20260226_154355/00_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint252_closure_ladder_policy_skip2_20260226/closure_ladder_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint253_closure_ladder_batch_20260226/closure_ladder_batch_summary.json`, `logs/taskitem_runs/TEST_ONLY_sprint254_closure_ladder_batch_20260226_r2/raw_gap_backlog.json`, `logs/taskitem_runs/TEST_ONLY_sprint255_rawharden_20260226_161924/00_summary.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_162423/00_summary.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_162633/02ae_raw_candidate_search.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_162924/01e_raw_top_gap_requirements_report.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_163148/02af_raw_adaptive_retry_score.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_163556/02ae_raw_signal_targeted_variants.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_163855/01f_raw_intrinsic_prompt_pack_report.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165430/01g_raw_template_control_pack_report.json`, `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165746/02ae_candidate_0_projected_report.json` | `partial` | Sprint 241 introduced impact profiles/gates; 242-243 remediation loops; 244 first-pass autofill; 245 intrinsic constraints only (no uplift); 246 multishot closure; 247 single-shot shaping closure; 248 raw candidate search no uplift; 249 no-uplift guardrail; 250 closure ladder; 251 richer raw variants no uplift; 252 history-aware ladder routing; 253 batch ladder analytics; 254 raw gap backlog synthesis from `raw_only` attempts identifies top missing raw signals; 255 adds first-pass raw top-gap hardening that closes hard-sample profile coverage (`failing_profile_count 7 -> 0`) by injecting missing ops/contracts/reasons and minimum task depth; 256 adds top-gap weighted candidate selection telemetry and tie-break policy; 257 adds hard fail policy when top-gap uplift is required but absent (`exit 18`); 258 injects backlog-driven top-gap normalized requirements before raw generation; 259 adds adaptive retry with expanded top-gap requirements and deterministic retry scoring; 260 adds signal-targeted variant expansion; 261 adds intrinsic prompt-pack constraints; 262 adds output-shape template-control pack; 263 adds deterministic structural projector before scoring. On hard sample, raw-score telemetry now uplifts (`best_failing_profile_count 1 -> 0`, `best_top_gap_score 0 -> 88`) but final `native_impact_coverage` still reports `1`, exposing scorer/gate parity mismatch. | Align score-native profile checker semantics with native_impact_coverage checker and gate on parity consistency |
## What Was Covered Today (Sprints 175-184) ## What Was Covered Today (Sprints 175-184)

View File

@@ -524,3 +524,21 @@
- Current measured result on hard sample: - Current measured result on hard sample:
- template control injected (`requirement_count=3`, `selected_signal_count=8`) - template control injected (`requirement_count=3`, `selected_signal_count=8`)
- intrinsic outcome unchanged (`selected_variant=0`, `best_top_gap_score=0`, `failing_profile_count=1`). - intrinsic outcome unchanged (`selected_variant=0`, `best_top_gap_score=0`, `failing_profile_count=1`).
## Sprint 263 Added (Same Day)
- Added deterministic raw structural projector:
- `tools/mcp/project_raw_candidate_structure.py`
- pipeline control:
- `WSTONE_NATIVE_RAW_STRUCTURAL_PROJECTOR`
- summary packet:
- `native_raw_structural_projector`
- Dated A/B artifacts:
- OFF: `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165737/00_summary.json`
- ON: `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165746/00_summary.json`
- Current measured result on hard sample:
- raw search score uplift under projector:
- `best_failing_profile_count 1 -> 0`
- `best_top_gap_score 0 -> 88`
- `best_task_count 2 -> 6`
- but `native_impact_coverage.failing_profile_count` remained `1`, exposing scorer/gate parity mismatch.

View File

@@ -0,0 +1,46 @@
# Sprint 263 Execution Tracker - 2026-02-26
## Scope
- `sprint263_plan.md`
## Implemented
New tool:
- `tools/mcp/project_raw_candidate_structure.py`
- Normalizes raw tasks against top-gap missing-signal classes.
- Fills missing ops/reasons/execution contract fields.
- Expands shallow task sets to gap-indicated minimum count.
Pipeline integration in `tools/mcp/run_sprint_taskitem_pipeline.sh`:
- Added:
- `WSTONE_NATIVE_RAW_STRUCTURAL_PROJECTOR`
- Raw candidate search now optionally projects:
- baseline candidate (`02ae_candidate_0_projected_tasks.json`)
- each generated candidate variant (`02ae_candidate_<n>_projected_tasks.json`)
- adaptive retry candidate when enabled
- Added summary packet:
- `native_raw_structural_projector`
## Validation Artifacts
OFF:
- `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165737/00_summary.json`
ON:
- `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165746/00_summary.json`
- projected artifacts:
- `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165746/02ae_candidate_0_projected_report.json`
- `logs/taskitem_runs/01a_fallback_intake_spec_20260226_165746/02ae_candidate_0_projected_tasks.json`
Observed result on hard sample:
- Raw search score improved sharply under projector:
- `best_failing_profile_count: 1 -> 0`
- `best_top_gap_score: 0 -> 88`
- `best_task_count: 2 -> 6`
- Residual parity gap:
- `native_impact_coverage.failing_profile_count` remained `1`
- indicates score-tool vs coverage-gate semantics are not yet aligned.
## Explicit Completion Signal
- Sprint 263: `DONE` (implemented + validated; uncovered scorer/gate parity gap)

View File

@@ -0,0 +1,6 @@
#pragma once
// Sprint 263 integration summary:
// - Added deterministic raw structural projector for candidate tasks before scoring.
// - Raw candidate scoring path can evaluate projected tasks for baseline, variants, and adaptive retry.
// - Summary now includes native_raw_structural_projector telemetry and projected-variant counts.

11
sprint263_plan.md Normal file
View File

@@ -0,0 +1,11 @@
# Sprint 263 Plan: Raw Structural Projector Before Scoring
## Goal
Add a deterministic structural projector for raw candidate tasks before scoring so intrinsic search evaluates schema-normalized candidates (without full post-hardening stage).
## Steps
- Step 2363: Add raw candidate structural projector tool.
- Step 2364: Apply projector to baseline/candidate/retry raw tasks before scoring.
- Step 2365: Emit structural projector telemetry in summary.
- Step 2366: Validate OFF/ON behavior on hard sample.
- Step 2367: Add `Sprint263IntegrationSummary.h` and execution tracker.

View File

@@ -0,0 +1,101 @@
#!/usr/bin/env python3
import argparse
import json
from pathlib import Path
from typing import Dict, List
def load_json(path: Path):
with path.open("r", encoding="utf-8") as f:
return json.load(f)
def write_json(path: Path, obj) -> None:
with path.open("w", encoding="utf-8") as f:
json.dump(obj, f, indent=2, sort_keys=True)
f.write("\n")
def parse_gap_signals(backlog: Dict):
missing = [str(x.get("missing", "")) for x in (backlog.get("prioritized_missing") or [])]
ops = sorted({m.split(":", 1)[1] for m in missing if m.startswith("missing_prerequisite_op:")})
reasons = sorted({m.split(":", 1)[1] for m in missing if m.startswith("missing_reason_keyword:")})
contracts = sorted({m.split(":", 1)[1] for m in missing if m.startswith("missing_execution_contract:")})
min_count = 0
for m in missing:
if m.startswith("native_task_count<"):
try:
min_count = max(min_count, int(m.split("<", 1)[1]))
except ValueError:
pass
return ops, reasons, contracts, min_count
def normalize_task(task: Dict, ops: List[str], reasons: List[str], contracts: List[str]) -> Dict:
ec = dict(task.get("executionContract") or {})
for f in contracts:
ec[f] = True
ec.setdefault("deterministic", True)
ec.setdefault("rollbackRequired", True)
ec.setdefault("replayValidationRequired", True)
title = str(task.get("title", "Task")).strip() or "Task"
return {
**task,
"title": title,
"prerequisiteOps": sorted(set((task.get("prerequisiteOps") or []) + ops)),
"reasons": sorted(set((task.get("reasons") or []) + reasons + ["raw_structural_projection"])),
"executionContract": ec,
}
def expand_to_min_count(tasks: List[Dict], min_count: int, ops: List[str]) -> List[Dict]:
if min_count <= 0 or len(tasks) >= min_count or not tasks:
return tasks
out = list(tasks)
idx = 0
while len(out) < min_count:
base = dict(tasks[idx % len(tasks)])
tid = str(base.get("taskId", f"task-{idx+1}"))
op = ops[idx % len(ops)] if ops else "whetstone_validate_taskitem"
base["taskId"] = f"{tid}-p{len(out)+1}"
base["title"] = f"{base.get('title','Task')} [{op}]"
base["prerequisiteOps"] = sorted(set((base.get("prerequisiteOps") or []) + [op]))
out.append(base)
idx += 1
return out
def main() -> int:
p = argparse.ArgumentParser(description="Project raw candidate tasks into stronger structural shape before scoring.")
p.add_argument("--tasks", required=True)
p.add_argument("--top-gaps", required=True)
p.add_argument("--out", required=True)
p.add_argument("--out-report", required=True)
args = p.parse_args()
tasks = load_json(Path(args.tasks))
if not isinstance(tasks, list):
raise SystemExit("--tasks must be JSON array")
backlog = load_json(Path(args.top_gaps))
ops, reasons, contracts, min_count = parse_gap_signals(backlog)
projected = [normalize_task(t, ops, reasons, contracts) for t in tasks]
projected = expand_to_min_count(projected, min_count, ops)
report = {
"status": "ok",
"input_task_count": len(tasks),
"output_task_count": len(projected),
"required_ops_count": len(ops),
"required_reason_count": len(reasons),
"required_contract_count": len(contracts),
"target_min_task_count": min_count,
}
write_json(Path(args.out), projected)
write_json(Path(args.out_report), report)
print(json.dumps({"status": "ok", "input_task_count": len(tasks), "output_task_count": len(projected), "out": args.out}, sort_keys=True))
return 0
if __name__ == "__main__":
raise SystemExit(main())

View File

@@ -55,6 +55,7 @@ NATIVE_RAW_CANDIDATE_REQUIRE_UPLIFT="${WSTONE_NATIVE_RAW_CANDIDATE_REQUIRE_UPLIF
NATIVE_RAW_HARDEN_TOP_GAPS="${WSTONE_NATIVE_RAW_HARDEN_TOP_GAPS:-0}" NATIVE_RAW_HARDEN_TOP_GAPS="${WSTONE_NATIVE_RAW_HARDEN_TOP_GAPS:-0}"
NATIVE_RAW_SIGNAL_TARGETED_VARIANTS="${WSTONE_NATIVE_RAW_SIGNAL_TARGETED_VARIANTS:-0}" NATIVE_RAW_SIGNAL_TARGETED_VARIANTS="${WSTONE_NATIVE_RAW_SIGNAL_TARGETED_VARIANTS:-0}"
NATIVE_RAW_SIGNAL_TARGETED_MAX_VARIANTS="${WSTONE_NATIVE_RAW_SIGNAL_TARGETED_MAX_VARIANTS:-6}" NATIVE_RAW_SIGNAL_TARGETED_MAX_VARIANTS="${WSTONE_NATIVE_RAW_SIGNAL_TARGETED_MAX_VARIANTS:-6}"
NATIVE_RAW_STRUCTURAL_PROJECTOR="${WSTONE_NATIVE_RAW_STRUCTURAL_PROJECTOR:-0}"
NATIVE_RAW_TOP_GAP_WEIGHTED_SELECT="${WSTONE_NATIVE_RAW_TOP_GAP_WEIGHTED_SELECT:-0}" NATIVE_RAW_TOP_GAP_WEIGHTED_SELECT="${WSTONE_NATIVE_RAW_TOP_GAP_WEIGHTED_SELECT:-0}"
NATIVE_RAW_TOP_GAP_BACKLOG_FILE="${WSTONE_NATIVE_RAW_TOP_GAP_BACKLOG_FILE:-}" NATIVE_RAW_TOP_GAP_BACKLOG_FILE="${WSTONE_NATIVE_RAW_TOP_GAP_BACKLOG_FILE:-}"
NATIVE_RAW_TOP_GAP_REQUIRE_UPLIFT="${WSTONE_NATIVE_RAW_TOP_GAP_REQUIRE_UPLIFT:-0}" NATIVE_RAW_TOP_GAP_REQUIRE_UPLIFT="${WSTONE_NATIVE_RAW_TOP_GAP_REQUIRE_UPLIFT:-0}"
@@ -130,6 +131,7 @@ NATIVE_MULTISHOT_JSON='{}'
NATIVE_RAW_CANDIDATE_SEARCH_JSON='{}' NATIVE_RAW_CANDIDATE_SEARCH_JSON='{}'
NATIVE_RAW_HARDENING_JSON='{}' NATIVE_RAW_HARDENING_JSON='{}'
NATIVE_RAW_SIGNAL_TARGETED_VARIANTS_JSON='{}' NATIVE_RAW_SIGNAL_TARGETED_VARIANTS_JSON='{}'
NATIVE_RAW_STRUCTURAL_PROJECTOR_JSON='{}'
NATIVE_RAW_TOP_GAP_REQUIREMENTS_JSON='{}' NATIVE_RAW_TOP_GAP_REQUIREMENTS_JSON='{}'
NATIVE_RAW_INTRINSIC_PROMPT_PACK_JSON='{}' NATIVE_RAW_INTRINSIC_PROMPT_PACK_JSON='{}'
NATIVE_RAW_TEMPLATE_CONTROL_PACK_JSON='{}' NATIVE_RAW_TEMPLATE_CONTROL_PACK_JSON='{}'
@@ -460,10 +462,17 @@ fi
if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
top_gap_score_args=() top_gap_score_args=()
use_top_gap_weighted_select=false use_top_gap_weighted_select=false
raw_structural_projector_enabled=false
raw_structural_projector_projected_variants=0
baseline_projected_input_count=0
baseline_projected_output_count=0
if [[ "$NATIVE_RAW_TOP_GAP_WEIGHTED_SELECT" == "1" && -n "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" && -f "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" ]]; then if [[ "$NATIVE_RAW_TOP_GAP_WEIGHTED_SELECT" == "1" && -n "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" && -f "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" ]]; then
top_gap_score_args=(--top-gaps "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE") top_gap_score_args=(--top-gaps "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE")
use_top_gap_weighted_select=true use_top_gap_weighted_select=true
fi fi
if [[ "$NATIVE_RAW_STRUCTURAL_PROJECTOR" == "1" && -n "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" && -f "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" ]]; then
raw_structural_projector_enabled=true
fi
python3 "$ROOT_DIR/tools/mcp/synthesize_raw_candidate_requirement_variants.py" \ python3 "$ROOT_DIR/tools/mcp/synthesize_raw_candidate_requirement_variants.py" \
--spec "$INPUT_FILE" \ --spec "$INPUT_FILE" \
--profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \ --profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \
@@ -490,16 +499,31 @@ if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
fi fi
printf '%s\n' "$TASKS" > "$OUT_DIR/02ae_candidate_0_tasks.json" printf '%s\n' "$TASKS" > "$OUT_DIR/02ae_candidate_0_tasks.json"
baseline_eval_tasks_path="$OUT_DIR/02ae_candidate_0_tasks.json"
baseline_eval_tasks_json="$TASKS"
if [[ "$raw_structural_projector_enabled" == true ]]; then
python3 "$ROOT_DIR/tools/mcp/project_raw_candidate_structure.py" \
--tasks "$OUT_DIR/02ae_candidate_0_tasks.json" \
--top-gaps "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" \
--out "$OUT_DIR/02ae_candidate_0_projected_tasks.json" \
--out-report "$OUT_DIR/02ae_candidate_0_projected_report.json" >/dev/null
baseline_eval_tasks_path="$OUT_DIR/02ae_candidate_0_projected_tasks.json"
baseline_eval_tasks_json="$(cat "$OUT_DIR/02ae_candidate_0_projected_tasks.json")"
baseline_projected_input_count="$(jq '.input_task_count // 0' "$OUT_DIR/02ae_candidate_0_projected_report.json")"
baseline_projected_output_count="$(jq '.output_task_count // 0' "$OUT_DIR/02ae_candidate_0_projected_report.json")"
raw_structural_projector_projected_variants=$((raw_structural_projector_projected_variants + 1))
fi
python3 "$ROOT_DIR/tools/mcp/score_native_tasks_profile_coverage.py" \ python3 "$ROOT_DIR/tools/mcp/score_native_tasks_profile_coverage.py" \
--spec "$INPUT_FILE" \ --spec "$INPUT_FILE" \
--profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \ --profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \
--tasks "$OUT_DIR/02ae_candidate_0_tasks.json" \ --tasks "$baseline_eval_tasks_path" \
"${top_gap_score_args[@]}" \ "${top_gap_score_args[@]}" \
--out "$OUT_DIR/02ae_candidate_0_score.json" >/dev/null --out "$OUT_DIR/02ae_candidate_0_score.json" >/dev/null
best_variant="0" best_variant="0"
best_fail="$(jq '.failing_profile_count // 999' "$OUT_DIR/02ae_candidate_0_score.json")" best_fail="$(jq '.failing_profile_count // 999' "$OUT_DIR/02ae_candidate_0_score.json")"
best_task_count="$(jq '.task_count // 0' "$OUT_DIR/02ae_candidate_0_score.json")" best_task_count="$(jq '.task_count // 0' "$OUT_DIR/02ae_candidate_0_score.json")"
best_top_gap_score="$(jq '.top_gap_score // 0' "$OUT_DIR/02ae_candidate_0_score.json")" best_top_gap_score="$(jq '.top_gap_score // 0' "$OUT_DIR/02ae_candidate_0_score.json")"
TASKS="$baseline_eval_tasks_json"
baseline_fail="$best_fail" baseline_fail="$best_fail"
baseline_task_count="$best_task_count" baseline_task_count="$best_task_count"
baseline_top_gap_score="$best_top_gap_score" baseline_top_gap_score="$best_top_gap_score"
@@ -523,10 +547,22 @@ if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
if [[ "$(printf '%s' "$cand_json" | jq -r '.success // false')" == "true" ]]; then if [[ "$(printf '%s' "$cand_json" | jq -r '.success // false')" == "true" ]]; then
cand_tasks="$(printf '%s' "$cand_json" | jq '.tasks // []')" cand_tasks="$(printf '%s' "$cand_json" | jq '.tasks // []')"
printf '%s\n' "$cand_tasks" > "$OUT_DIR/02ae_candidate_${variant}_tasks.json" printf '%s\n' "$cand_tasks" > "$OUT_DIR/02ae_candidate_${variant}_tasks.json"
cand_eval_tasks_path="$OUT_DIR/02ae_candidate_${variant}_tasks.json"
cand_eval_tasks_json="$cand_tasks"
if [[ "$raw_structural_projector_enabled" == true ]]; then
python3 "$ROOT_DIR/tools/mcp/project_raw_candidate_structure.py" \
--tasks "$OUT_DIR/02ae_candidate_${variant}_tasks.json" \
--top-gaps "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" \
--out "$OUT_DIR/02ae_candidate_${variant}_projected_tasks.json" \
--out-report "$OUT_DIR/02ae_candidate_${variant}_projected_report.json" >/dev/null
cand_eval_tasks_path="$OUT_DIR/02ae_candidate_${variant}_projected_tasks.json"
cand_eval_tasks_json="$(cat "$OUT_DIR/02ae_candidate_${variant}_projected_tasks.json")"
raw_structural_projector_projected_variants=$((raw_structural_projector_projected_variants + 1))
fi
python3 "$ROOT_DIR/tools/mcp/score_native_tasks_profile_coverage.py" \ python3 "$ROOT_DIR/tools/mcp/score_native_tasks_profile_coverage.py" \
--spec "$INPUT_FILE" \ --spec "$INPUT_FILE" \
--profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \ --profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \
--tasks "$OUT_DIR/02ae_candidate_${variant}_tasks.json" \ --tasks "$cand_eval_tasks_path" \
"${top_gap_score_args[@]}" \ "${top_gap_score_args[@]}" \
--out "$OUT_DIR/02ae_candidate_${variant}_score.json" >/dev/null --out "$OUT_DIR/02ae_candidate_${variant}_score.json" >/dev/null
cand_fail="$(jq '.failing_profile_count // 999' "$OUT_DIR/02ae_candidate_${variant}_score.json")" cand_fail="$(jq '.failing_profile_count // 999' "$OUT_DIR/02ae_candidate_${variant}_score.json")"
@@ -549,7 +585,7 @@ if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
best_fail="$cand_fail" best_fail="$cand_fail"
best_task_count="$cand_task_count" best_task_count="$cand_task_count"
best_top_gap_score="$cand_top_gap_score" best_top_gap_score="$cand_top_gap_score"
TASKS="$cand_tasks" TASKS="$cand_eval_tasks_json"
fi fi
successful=$((successful + 1)) successful=$((successful + 1))
fi fi
@@ -580,10 +616,22 @@ if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
retry_success=true retry_success=true
retry_tasks="$(printf '%s' "$retry_json" | jq '.tasks // []')" retry_tasks="$(printf '%s' "$retry_json" | jq '.tasks // []')"
printf '%s\n' "$retry_tasks" > "$OUT_DIR/02af_raw_adaptive_retry_tasks.json" printf '%s\n' "$retry_tasks" > "$OUT_DIR/02af_raw_adaptive_retry_tasks.json"
retry_eval_tasks_path="$OUT_DIR/02af_raw_adaptive_retry_tasks.json"
retry_eval_tasks_json="$retry_tasks"
if [[ "$raw_structural_projector_enabled" == true ]]; then
python3 "$ROOT_DIR/tools/mcp/project_raw_candidate_structure.py" \
--tasks "$OUT_DIR/02af_raw_adaptive_retry_tasks.json" \
--top-gaps "$NATIVE_RAW_TOP_GAP_BACKLOG_FILE" \
--out "$OUT_DIR/02af_raw_adaptive_retry_projected_tasks.json" \
--out-report "$OUT_DIR/02af_raw_adaptive_retry_projected_report.json" >/dev/null
retry_eval_tasks_path="$OUT_DIR/02af_raw_adaptive_retry_projected_tasks.json"
retry_eval_tasks_json="$(cat "$OUT_DIR/02af_raw_adaptive_retry_projected_tasks.json")"
raw_structural_projector_projected_variants=$((raw_structural_projector_projected_variants + 1))
fi
python3 "$ROOT_DIR/tools/mcp/score_native_tasks_profile_coverage.py" \ python3 "$ROOT_DIR/tools/mcp/score_native_tasks_profile_coverage.py" \
--spec "$INPUT_FILE" \ --spec "$INPUT_FILE" \
--profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \ --profiles "$NATIVE_IMPACT_COVERAGE_PROFILES" \
--tasks "$OUT_DIR/02af_raw_adaptive_retry_tasks.json" \ --tasks "$retry_eval_tasks_path" \
"${top_gap_score_args[@]}" \ "${top_gap_score_args[@]}" \
--out "$OUT_DIR/02af_raw_adaptive_retry_score.json" >/dev/null --out "$OUT_DIR/02af_raw_adaptive_retry_score.json" >/dev/null
retry_fail="$(jq '.failing_profile_count // 999' "$OUT_DIR/02af_raw_adaptive_retry_score.json")" retry_fail="$(jq '.failing_profile_count // 999' "$OUT_DIR/02af_raw_adaptive_retry_score.json")"
@@ -594,7 +642,7 @@ if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
best_fail="$retry_fail" best_fail="$retry_fail"
best_task_count="$retry_task_count" best_task_count="$retry_task_count"
best_top_gap_score="$retry_top_gap_score" best_top_gap_score="$retry_top_gap_score"
TASKS="$retry_tasks" TASKS="$retry_eval_tasks_json"
retry_applied=true retry_applied=true
fi fi
fi fi
@@ -611,6 +659,12 @@ if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
else else
NATIVE_RAW_ADAPTIVE_RETRY_JSON='{"enabled":false}' NATIVE_RAW_ADAPTIVE_RETRY_JSON='{"enabled":false}'
fi fi
NATIVE_RAW_STRUCTURAL_PROJECTOR_JSON="$(jq -nc \
--argjson enabled "$raw_structural_projector_enabled" \
--argjson projected_variant_count "$raw_structural_projector_projected_variants" \
--argjson baseline_input_task_count "$baseline_projected_input_count" \
--argjson baseline_output_task_count "$baseline_projected_output_count" \
'{enabled:$enabled, projected_variant_count:$projected_variant_count, baseline_input_task_count:$baseline_input_task_count, baseline_output_task_count:$baseline_output_task_count}')"
NATIVE_RAW_CANDIDATE_SEARCH_JSON="$(jq -nc \ NATIVE_RAW_CANDIDATE_SEARCH_JSON="$(jq -nc \
--argjson enabled true \ --argjson enabled true \
@@ -649,6 +703,7 @@ if [[ "$NATIVE_RAW_CANDIDATE_SEARCH" == "1" ]]; then
else else
NATIVE_RAW_CANDIDATE_SEARCH_JSON='{"enabled":false}' NATIVE_RAW_CANDIDATE_SEARCH_JSON='{"enabled":false}'
NATIVE_RAW_SIGNAL_TARGETED_VARIANTS_JSON='{"enabled":false}' NATIVE_RAW_SIGNAL_TARGETED_VARIANTS_JSON='{"enabled":false}'
NATIVE_RAW_STRUCTURAL_PROJECTOR_JSON='{"enabled":false}'
fi fi
if [[ "$NATIVE_RAW_HARDEN_TOP_GAPS" == "1" ]]; then if [[ "$NATIVE_RAW_HARDEN_TOP_GAPS" == "1" ]]; then
printf '%s\n' "$TASKS" > "$OUT_DIR/02af_raw_hardening_input_tasks.json" printf '%s\n' "$TASKS" > "$OUT_DIR/02af_raw_hardening_input_tasks.json"
@@ -997,6 +1052,7 @@ SUMMARY_JSON="$(jq -nc \
--argjson native_raw_intrinsic_prompt_pack "$NATIVE_RAW_INTRINSIC_PROMPT_PACK_JSON" \ --argjson native_raw_intrinsic_prompt_pack "$NATIVE_RAW_INTRINSIC_PROMPT_PACK_JSON" \
--argjson native_raw_template_control_pack "$NATIVE_RAW_TEMPLATE_CONTROL_PACK_JSON" \ --argjson native_raw_template_control_pack "$NATIVE_RAW_TEMPLATE_CONTROL_PACK_JSON" \
--argjson native_raw_signal_targeted_variants "$NATIVE_RAW_SIGNAL_TARGETED_VARIANTS_JSON" \ --argjson native_raw_signal_targeted_variants "$NATIVE_RAW_SIGNAL_TARGETED_VARIANTS_JSON" \
--argjson native_raw_structural_projector "$NATIVE_RAW_STRUCTURAL_PROJECTOR_JSON" \
--argjson native_raw_candidate_search "$NATIVE_RAW_CANDIDATE_SEARCH_JSON" \ --argjson native_raw_candidate_search "$NATIVE_RAW_CANDIDATE_SEARCH_JSON" \
--argjson native_raw_adaptive_retry "$NATIVE_RAW_ADAPTIVE_RETRY_JSON" \ --argjson native_raw_adaptive_retry "$NATIVE_RAW_ADAPTIVE_RETRY_JSON" \
--argjson native_raw_hardening "$NATIVE_RAW_HARDENING_JSON" \ --argjson native_raw_hardening "$NATIVE_RAW_HARDENING_JSON" \
@@ -1031,6 +1087,7 @@ SUMMARY_JSON="$(jq -nc \
native_raw_intrinsic_prompt_pack: $native_raw_intrinsic_prompt_pack, native_raw_intrinsic_prompt_pack: $native_raw_intrinsic_prompt_pack,
native_raw_template_control_pack: $native_raw_template_control_pack, native_raw_template_control_pack: $native_raw_template_control_pack,
native_raw_signal_targeted_variants: $native_raw_signal_targeted_variants, native_raw_signal_targeted_variants: $native_raw_signal_targeted_variants,
native_raw_structural_projector: $native_raw_structural_projector,
native_raw_candidate_search: $native_raw_candidate_search, native_raw_candidate_search: $native_raw_candidate_search,
native_raw_adaptive_retry: $native_raw_adaptive_retry, native_raw_adaptive_retry: $native_raw_adaptive_retry,
native_raw_hardening: $native_raw_hardening, native_raw_hardening: $native_raw_hardening,