feat(provenance): govern source snapshots and data inputs

This commit is contained in:
Jens
2026-08-01 23:46:17 +02:00
parent cebeb5f3b4
commit 5b3c17b494
96 changed files with 20156 additions and 351 deletions
@@ -6,8 +6,23 @@ from __future__ import annotations
import argparse
import hashlib
import json
import sys
from pathlib import Path
SCRIPT_DIR = Path(__file__).resolve().parent
if str(SCRIPT_DIR) not in sys.path:
sys.path.insert(0, str(SCRIPT_DIR))
from training_dataset_eligibility import ( # noqa: E402
TrainingEligibilityError,
assert_frozen_manifest_training_eligible,
)
from training_release_manifest import ( # noqa: E402
TrainingReleaseError,
assert_yolo_summary_bound_to_embedded_training_release,
create_training_release_manifest,
)
def sha256(path: Path) -> str:
digest = hashlib.sha256()
@@ -31,12 +46,35 @@ def main() -> int:
default=0,
help="Include each train tile outside the expert region this many times.",
)
parser.add_argument(
"--fixture-mode",
action="store_true",
help="Accept only an explicitly fixture-only corpus manifest; never use for operational training data.",
)
parser.add_argument(
"--review-audit",
type=Path,
help="Accepted corpus-audit evidence; mandatory for an operational training release.",
)
args = parser.parse_args()
if args.positive_repeat < 1 or args.negative_repeat < 1 or args.other_region_repeat < 0:
raise SystemExit("regional repeats must be positive and other-region repeat non-negative")
summary = json.loads(args.summary.read_text(encoding="utf-8"))
manifest = json.loads(args.corpus_manifest.read_text(encoding="utf-8"))
try:
assert_frozen_manifest_training_eligible(
args.corpus_manifest,
fixture_mode=args.fixture_mode,
verify_live=True,
)
assert_yolo_summary_bound_to_embedded_training_release(
summary_path=args.summary,
corpus_manifest=args.corpus_manifest,
fixture_mode=args.fixture_mode,
)
except (TrainingEligibilityError, TrainingReleaseError) as exc:
raise SystemExit(str(exc)) from exc
samples = {item["sample_slug"]: item for item in manifest["samples"]}
paths: list[str] = []
selected_samples: set[str] = set()
@@ -69,6 +107,15 @@ def main() -> int:
f"val: {args.summary.parent / 'images' / 'val'}\nnames:\n 0: building\n",
encoding="utf-8",
)
try:
release_paths = create_training_release_manifest(
train_yaml=dataset_yaml,
corpus_manifest=args.corpus_manifest,
review_audit_path=args.review_audit,
fixture_mode=args.fixture_mode,
)
except TrainingReleaseError as exc:
raise SystemExit(str(exc)) from exc
evidence = {
"schema_version": 1,
"status": "ok",
@@ -88,6 +135,11 @@ def main() -> int:
"protected_samples_in_training": [],
"train_list": str(train_list),
"dataset_yaml": str(dataset_yaml),
"training_release_manifest": str(release_paths["release_manifest"]),
"training_release_manifest_sha256": sha256(release_paths["release_manifest"]),
"training_release_freeze": str(release_paths["release_freeze"]),
"training_asset_manifest": str(release_paths["asset_manifest"]),
"fixture_mode": bool(args.fixture_mode),
}
evidence_path = args.output_dir / "regional-expert-dataset.json"
evidence_path.write_text(json.dumps(evidence, indent=2), encoding="utf-8")