feat(provenance): govern source snapshots and data inputs
This commit is contained in:
@@ -6,10 +6,25 @@ from __future__ import annotations
|
||||
import argparse
|
||||
import hashlib
|
||||
import json
|
||||
import sys
|
||||
from collections import Counter
|
||||
from pathlib import Path
|
||||
from typing import Any
|
||||
|
||||
SCRIPT_DIR = Path(__file__).resolve().parent
|
||||
if str(SCRIPT_DIR) not in sys.path:
|
||||
sys.path.insert(0, str(SCRIPT_DIR))
|
||||
|
||||
from training_dataset_eligibility import ( # noqa: E402
|
||||
TrainingEligibilityError,
|
||||
assert_frozen_manifest_training_eligible,
|
||||
)
|
||||
from training_release_manifest import ( # noqa: E402
|
||||
TrainingReleaseError,
|
||||
assert_yolo_summary_bound_to_embedded_training_release,
|
||||
create_training_release_manifest,
|
||||
)
|
||||
|
||||
|
||||
PROTECTED_SPLITS = {"calibration", "test", "background-test"}
|
||||
|
||||
@@ -138,11 +153,34 @@ def main() -> int:
|
||||
parser.add_argument("--priority-context", action="append", default=[])
|
||||
parser.add_argument("--priority-repeat", type=int, default=2)
|
||||
parser.add_argument("--negative-repeat", type=int, default=2)
|
||||
parser.add_argument(
|
||||
"--review-audit",
|
||||
type=Path,
|
||||
help="Accepted corpus-audit evidence; mandatory for an operational training release.",
|
||||
)
|
||||
parser.add_argument(
|
||||
"--fixture-mode",
|
||||
action="store_true",
|
||||
help="Accept only an explicitly fixture-only corpus manifest; never use for operational training data.",
|
||||
)
|
||||
args = parser.parse_args()
|
||||
if args.priority_repeat < 1 or args.negative_repeat < 1:
|
||||
parser.error("repeat counts must be positive")
|
||||
summary = json.loads(args.summary.read_text(encoding="utf-8"))
|
||||
manifest = json.loads(args.corpus_manifest.read_text(encoding="utf-8"))
|
||||
try:
|
||||
assert_frozen_manifest_training_eligible(
|
||||
args.corpus_manifest,
|
||||
fixture_mode=args.fixture_mode,
|
||||
verify_live=True,
|
||||
)
|
||||
assert_yolo_summary_bound_to_embedded_training_release(
|
||||
summary_path=args.summary,
|
||||
corpus_manifest=args.corpus_manifest,
|
||||
fixture_mode=args.fixture_mode,
|
||||
)
|
||||
except (TrainingEligibilityError, TrainingReleaseError) as exc:
|
||||
raise SystemExit(str(exc)) from exc
|
||||
train, val, evidence = build(
|
||||
summary=summary,
|
||||
manifest=manifest,
|
||||
@@ -161,6 +199,15 @@ def main() -> int:
|
||||
f"path: /\ntrain: {train_path}\nval: {val_path}\nnames:\n 0: building\n",
|
||||
encoding="utf-8",
|
||||
)
|
||||
try:
|
||||
release_paths = create_training_release_manifest(
|
||||
train_yaml=yaml_path,
|
||||
corpus_manifest=args.corpus_manifest,
|
||||
review_audit_path=args.review_audit,
|
||||
fixture_mode=args.fixture_mode,
|
||||
)
|
||||
except TrainingReleaseError as exc:
|
||||
raise SystemExit(str(exc)) from exc
|
||||
evidence.update({
|
||||
"source_summary": str(args.summary),
|
||||
"source_summary_sha256": sha256(args.summary),
|
||||
@@ -169,6 +216,11 @@ def main() -> int:
|
||||
"train_sha256": sha256(train_path),
|
||||
"validation_sha256": sha256(val_path),
|
||||
"dataset_yaml": str(yaml_path),
|
||||
"training_release_manifest": str(release_paths["release_manifest"]),
|
||||
"training_release_manifest_sha256": sha256(release_paths["release_manifest"]),
|
||||
"training_release_freeze": str(release_paths["release_freeze"]),
|
||||
"training_asset_manifest": str(release_paths["asset_manifest"]),
|
||||
"fixture_mode": bool(args.fixture_mode),
|
||||
})
|
||||
encoded_evidence = json.dumps(evidence, indent=2)
|
||||
(args.output_dir / "regional-dataset-evidence.json").write_text(encoded_evidence, encoding="utf-8")
|
||||
|
||||
Reference in New Issue
Block a user