{ "case_count": 9, "claim_boundary": "Synthetic deterministic reference cases validate evaluator behavior, not production model accuracy.", "evaluated_task_families": [ "change_detection", "footprint_segmentation", "geospatial_data_validation", "object_detection", "raster_classification", "terrain_interpretation", "vector_comparison" ], "evaluator_version": "2.1.0", "failure_taxonomy": { "claim_boundary": "diagnostic classification; not a release decision", "contexts": { "high_confidence": "false positive meets the highest frozen diagnostic confidence threshold", "out_of_distribution": "case metadata explicitly marks OOD context", "tile_edge": "case metadata explicitly marks tile-edge context" }, "primary_codes": { "D-VALIDATION-FN": "reference anomaly or severity not exactly reported", "D-VALIDATION-FP": "anomaly or severity reported without an exact reference match", "M-AREA-BIAS": "matched footprint has a measurable relative area bias", "M-BOUNDARY": "matched footprint has a measurable boundary deviation", "M-CLASS": "raster class differs from the valid reference class", "M-FN-MISSED": "unmatched reference object or event", "M-FP-CONFUSER": "unmatched object or event prediction", "M-MISCALIBRATED": "confidence diagnostic deviates from observed correctness", "M-OOD": "error observed in an explicitly declared out-of-distribution case", "P-PARTIAL": "required prediction value is unavailable" } }, "full_results_canonical_json_sha256": "55cdba9cce4dcdc88cee0829cd510d7e624a3472feb9d33f7e681621a792eba3", "hash_specification": { "algorithm": "SHA-256", "canonical_json": "UTF-8 JSON produced with sort_keys=true, separators=(',', ':'), ensure_ascii=false and allow_nan=false", "portfolio_canonical_json_sha256_input": "parsed complete portfolio", "portfolio_file_sha256_input": "exact source-file bytes", "results_canonical_json_sha256_input": "complete sample-id-ordered results array" }, "metric_results_canonical_json_sha256": "cdaf2460bf51231d8f547402ab9c464a72fa9226aa69380e313609f9fb2e3b2e", "portfolio_canonical_json_sha256": "1ac1bd77db125db48f9168406d51bfb723522f54a6c81dbe868d600c72f27b17", "portfolio_file_sha256": "c49a9c8d74cae2062552b012d9c275f65156c81d75b3e453860f5b859c1c5473", "portfolio_id": "geointel-p4-reference-harness-v2", "portfolio_kind": "synthetic_contract", "portfolio_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "object_detection": { "case_support": 3, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "protected_policy": { "diagnostic_curves_select_operating_point": false, "operating_point_selection_allowed": false, "test_feedback_allowed": false, "threshold_selection_source": "pre_registered_configuration_only" }, "results": [ { "metadata": { "context": "coastal_hard_negative", "date": "2025-07-01", "difficulty": "hard", "label_review_state": "fixture_reviewed", "municipality": "Oostende", "object_size": "empty", "occlusion": "none", "ood": false, "region": "flanders", "resolution_m": 0.25, "season": "summer", "sensor": "synthetic-rgb", "source": "fixture-orthophoto", "tile_edge": true, "urbanity": "urban", "vegetation": "moderate" }, "metrics": { "ap50": null, "ap50_95": null, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": null, "count": 0, "lower": 0.6, "mean_confidence": null, "upper": 0.8 }, { "accuracy": 0, "count": 1, "lower": 0.8, "mean_confidence": 0.92, "upper": 1.0 } ], "brier": 0.8464, "ece": 0.92, "status": "computed" }, "coverage_risk": [ { "false_negative_count": 0, "false_positive_count": 1, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 1, "retained_prediction_coverage": 1.0, "risk": 1.0, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.0, "total_prediction_count": 1 }, { "false_negative_count": 0, "false_positive_count": 1, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 1, "retained_prediction_coverage": 1.0, "risk": 1.0, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.5, "total_prediction_count": 1 }, { "false_negative_count": 0, "false_positive_count": 1, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 1, "retained_prediction_coverage": 1.0, "risk": 1.0, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.7, "total_prediction_count": 1 }, { "false_negative_count": 0, "false_positive_count": 1, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 1, "retained_prediction_coverage": 1.0, "risk": 1.0, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.9, "total_prediction_count": 1 } ], "f1": null, "false_discovery_rate": 1.0, "false_negative": 0, "false_positive": 1, "map50": null, "map50_95": null, "match_iou": 0.5, "matched_iou": { "count": 0, "max": null, "mean": null, "median": null, "min": null }, "miss_rate": null, "operating_confidence": 0.5, "per_class": { "building": { "ap50": null, "ap50_95": null, "f1": null, "false_discovery_rate": 1.0, "false_negative": 0, "false_positive": 1, "miss_rate": null, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 } }, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "sample_id": "background-test-hard-negative", "task": "object_detection" }, { "metadata": { "context": "pure_background", "date": "2025-02-01", "difficulty": "hard", "label_review_state": "fixture_reviewed", "municipality": "Brussel", "object_size": "empty", "occlusion": "none", "ood": false, "region": "brussels", "resolution_m": 0.25, "season": "winter", "sensor": "synthetic-rgb", "source": "fixture-orthophoto", "tile_edge": false, "urbanity": "urban", "vegetation": "low" }, "metrics": { "ap50": null, "ap50_95": null, "calibration": { "bins": [], "brier": null, "ece": null, "status": "undefined" }, "coverage_risk": [ { "false_negative_count": 0, "false_positive_count": 0, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 0, "retained_prediction_coverage": null, "risk": null, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.0, "total_prediction_count": 0 }, { "false_negative_count": 0, "false_positive_count": 0, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 0, "retained_prediction_coverage": null, "risk": null, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.5, "total_prediction_count": 0 }, { "false_negative_count": 0, "false_positive_count": 0, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 0, "retained_prediction_coverage": null, "risk": null, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.7, "total_prediction_count": 0 }, { "false_negative_count": 0, "false_positive_count": 0, "matched_reference_count": 0, "reference_count": 0, "reference_coverage": null, "retained_prediction_count": 0, "retained_prediction_coverage": null, "risk": null, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.9, "total_prediction_count": 0 } ], "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "map50": null, "map50_95": null, "match_iou": 0.5, "matched_iou": { "count": 0, "max": null, "mean": null, "median": null, "min": null }, "miss_rate": null, "operating_confidence": 0.5, "per_class": { "building": { "ap50": null, "ap50_95": null, "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "miss_rate": null, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 } }, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "sample_id": "background-test-pure-empty", "task": "object_detection" }, { "metadata": { "context": "industrial_change", "date": "2024-05-01/2025-05-01", "difficulty": "hard", "label_review_state": "fixture_reviewed", "municipality": "Liège", "object_size": "mixed", "occlusion": "none", "ood": false, "region": "wallonia", "resolution_m": 0.5, "season": "multi-date", "sensor": "vector", "source": "fixture-picc-temporal", "tile_edge": false, "urbanity": "industrial", "vegetation": "low" }, "metrics": { "event_metrics": { "added": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "removed": { "f1": null, "false_discovery_rate": 1.0, "false_negative": 1, "false_positive": 1, "miss_rate": 1.0, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "recall": 0.0, "recall_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "reference_count": 1, "true_positive": 0 } }, "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "sample_id": "change-test-wallonia-industrial", "task": "change_detection" }, { "metadata": { "context": "dense_urban", "date": "2025-06-15", "difficulty": "hard", "label_review_state": "fixture_reviewed", "municipality": "Antwerpen", "object_size": "mixed", "occlusion": "partial", "ood": false, "region": "flanders", "resolution_m": 0.25, "season": "summer", "sensor": "synthetic-rgb", "source": "fixture-orthophoto", "tile_edge": false, "urbanity": "urban", "vegetation": "moderate" }, "metrics": { "ap50": 1.0, "ap50_95": 0.900990099009901, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 1, "count": 1, "lower": 0.8, "mean_confidence": 0.9, "upper": 1.0 } ], "brier": 0.15333333333333332, "ece": 0.13333333333333325, "status": "computed" }, "coverage_risk": [ { "false_negative_count": 0, "false_positive_count": 2, "matched_reference_count": 2, "reference_count": 2, "reference_coverage": 1.0, "retained_prediction_count": 4, "retained_prediction_coverage": 1.0, "risk": 0.5, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.0, "total_prediction_count": 4 }, { "false_negative_count": 0, "false_positive_count": 1, "matched_reference_count": 2, "reference_count": 2, "reference_coverage": 1.0, "retained_prediction_count": 3, "retained_prediction_coverage": 0.75, "risk": 0.3333333333333333, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.5, "total_prediction_count": 4 }, { "false_negative_count": 0, "false_positive_count": 0, "matched_reference_count": 2, "reference_count": 2, "reference_coverage": 1.0, "retained_prediction_count": 2, "retained_prediction_coverage": 0.5, "risk": 0.0, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.7, "total_prediction_count": 4 }, { "false_negative_count": 1, "false_positive_count": 0, "matched_reference_count": 1, "reference_count": 2, "reference_coverage": 0.5, "retained_prediction_count": 1, "retained_prediction_coverage": 0.25, "risk": 0.5, "risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)", "threshold": 0.9, "total_prediction_count": 4 } ], "f1": 0.8, "false_discovery_rate": 0.3333333333333333, "false_negative": 0, "false_positive": 1, "map50": 1.0, "map50_95": 0.900990099009901, "match_iou": 0.5, "matched_iou": { "count": 2, "max": 1.0, "mean": 0.9355555555555555, "median": 0.9355555555555555, "min": 0.8711111111111111 }, "miss_rate": 0.0, "operating_confidence": 0.5, "per_class": { "building": { "ap50": 1.0, "ap50_95": 0.900990099009901, "f1": 0.8, "false_discovery_rate": 0.3333333333333333, "false_negative": 0, "false_positive": 1, "miss_rate": 0.0, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 } }, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "sample_id": "det-test-flanders-urban", "task": "object_detection" }, { "metadata": { "context": "dense_urban_raster", "date": "2025-10-05", "difficulty": "hard", "label_review_state": "fixture_reviewed", "municipality": "Brussel", "object_size": "not_applicable", "occlusion": "not_applicable", "ood": false, "region": "brussels", "resolution_m": 1, "season": "autumn", "sensor": "synthetic-multispectral", "source": "fixture-thematic-raster", "tile_edge": true, "urbanity": "urban", "vegetation": "moderate" }, "metrics": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "alignment_validated": true, "confusion_matrix": { "0": { "0": 4, "1": 0, "2": 0, "__prediction_nodata__": 0 }, "1": { "0": 0, "1": 4, "2": 1, "__prediction_nodata__": 0 }, "2": { "0": 0, "1": 1, "2": 2, "__prediction_nodata__": 0 } }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "ignored_reference_pixel_count": 0, "macro_f1": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "pixel_count": 12, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_outside_reference_count": 0, "prediction_present_pixel_count": 12 }, "sample_id": "raster-test-brussels-urban", "task": "raster_classification" }, { "metadata": { "context": "rural_buildings", "date": "2025-04-20", "difficulty": "normal", "label_review_state": "fixture_reviewed", "municipality": "Namur", "object_size": "large", "occlusion": "none", "ood": false, "region": "wallonia", "resolution_m": 0.5, "season": "spring", "sensor": "synthetic-rgb", "source": "fixture-picc", "tile_edge": false, "urbanity": "rural", "vegetation": "low" }, "metrics": { "centroid_distance_m": { "count": 1, "max": 0.5, "mean": 0.5, "median": 0.5, "min": 0.5 }, "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "mean_boundary_f1": 1.0, "mean_dice": 0.8881578947368421, "mean_iou": 0.7988165680473372, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "relative_area_error": { "count": 1, "max": -0.1, "mean": -0.1, "median": -0.1, "min": -0.1 }, "spatial_context_validated": true, "topologically_invalid_predictions": 0, "topologically_valid_predictions": 1, "true_positive": 1 }, "sample_id": "seg-test-wallonia-rural", "task": "footprint_segmentation" }, { "metadata": { "context": "terrain_profile", "date": "2023-01-01", "difficulty": "normal", "label_review_state": "fixture_reviewed", "municipality": "Hasselt", "object_size": "not_applicable", "occlusion": "not_applicable", "ood": false, "region": "flanders", "resolution_m": 5, "season": "not_applicable", "sensor": "elevation-raster", "source": "fixture-dhmv", "tile_edge": false, "urbanity": "rural", "vegetation": "moderate" }, "metrics": { "absolute_error_sum": 1.0999999999999996, "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "error_distribution": { "count": 4, "max": 0.40000000000000036, "mean": 0.02499999999999991, "median": 0.0, "min": -0.3000000000000007 }, "error_sum": 0.09999999999999964, "evaluated_count": 4, "mae": 0.2749999999999999, "missing_count": 1, "reference_count": 5, "rmse": 0.2872281323269015, "squared_error_sum": 0.3300000000000001, "units": "m_TAW" }, "sample_id": "terrain-test-flanders-rural", "task": "terrain_interpretation" }, { "metadata": { "context": "data_contract", "date": "2025-01-01", "difficulty": "hard", "label_review_state": "fixture_reviewed", "municipality": "not_applicable", "object_size": "not_applicable", "occlusion": "not_applicable", "ood": false, "region": "national", "resolution_m": null, "season": "not_applicable", "sensor": "mixed", "source": "fixture-contracts", "tile_edge": false, "urbanity": "mixed", "vegetation": "mixed" }, "metrics": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "misses_by_severity": { "blocker": 0, "critical": 1, "informational": 0, "major": 0, "minor": 0 }, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "severity_mismatch_count": 0, "severity_mismatches": [], "true_positive": 2 }, "sample_id": "validation-test-national", "task": "geospatial_data_validation" }, { "metadata": { "context": "suburban_buildings", "date": "2025-01-15", "difficulty": "normal", "label_review_state": "fixture_reviewed", "municipality": "Mol", "object_size": "mixed", "occlusion": "not_applicable", "ood": false, "region": "flanders", "resolution_m": 0.1, "season": "not_applicable", "sensor": "vector", "source": "fixture-grb", "tile_edge": false, "urbanity": "suburban", "vegetation": "low" }, "metrics": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "mean_iou": 1.0, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "spatial_context_validated": true, "topologically_valid": true, "true_positive": 1 }, "sample_id": "vector-test-flanders-suburban", "task": "vector_comparison" } ], "results_canonical_json_sha256": "55cdba9cce4dcdc88cee0829cd510d7e624a3472feb9d33f7e681621a792eba3", "schema_version": 2, "selection_policy": "No data-dependent threshold, model or gate selection is performed from protected cases.", "split_roles": [ "test", "background-test" ], "subgroups": { "dimensions": { "context": { "strata": { "coastal_hard_negative": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": 0.0, "precision_case_support": 1, "recall": null, "recall_case_support": 0, "status": "computed" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": null, "count": 0, "lower": 0.6, "mean_confidence": null, "upper": 0.8 }, { "accuracy": 0, "count": 1, "lower": 0.8, "mean_confidence": 0.92, "upper": 1.0 } ], "brier": 0.8464, "ece": 0.92, "status": "computed" }, "f1": null, "false_discovery_rate": 1.0, "false_negative": 0, "false_positive": 1, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 1, "reference_count": 0 } }, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 1, "predictions": 1, "ranking_predictions": 1, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "data_contract": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] }, "dense_urban": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 1.0, "ap50_95": 0.900990099009901, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 1, "count": 1, "lower": 0.8, "mean_confidence": 0.9, "upper": 1.0 } ], "brier": 0.15333333333333332, "ece": 0.13333333333333325, "status": "computed" }, "f1": 0.8, "false_discovery_rate": 0.3333333333333333, "false_negative": 0, "false_positive": 1, "map50": 1.0, "map50_95": 0.900990099009901, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 1.0, "ap50_95": 0.900990099009901, "prediction_count": 4, "reference_count": 2 } }, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 3, "predictions": 3, "ranking_predictions": 4, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.8 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "dense_urban_raster": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "raster_classification" ] }, "industrial_change": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection" ] }, "pure_background": { "case_support": 1, "failure_count": 0, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": null, "precision_case_support": 0, "recall": null, "recall_case_support": 0, "status": "not_evaluable" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "bins": [], "brier": null, "ece": null, "status": "undefined" }, "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 0, "reference_count": 0 } }, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 0, "predictions": 0, "ranking_predictions": 0, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "rural_buildings": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation" ] }, "suburban_buildings": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "vector_comparison" ] }, "terrain_profile": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "terrain_interpretation" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "date": { "strata": { "2023-01-01": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "terrain_interpretation" ] }, "2024-05-01/2025-05-01": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection" ] }, "2025-01-01": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] }, "2025-01-15": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "vector_comparison" ] }, "2025-02-01": { "case_support": 1, "failure_count": 0, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": null, "precision_case_support": 0, "recall": null, "recall_case_support": 0, "status": "not_evaluable" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "bins": [], "brier": null, "ece": null, "status": "undefined" }, "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 0, "reference_count": 0 } }, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 0, "predictions": 0, "ranking_predictions": 0, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "2025-04-20": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation" ] }, "2025-06-15": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 1.0, "ap50_95": 0.900990099009901, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 1, "count": 1, "lower": 0.8, "mean_confidence": 0.9, "upper": 1.0 } ], "brier": 0.15333333333333332, "ece": 0.13333333333333325, "status": "computed" }, "f1": 0.8, "false_discovery_rate": 0.3333333333333333, "false_negative": 0, "false_positive": 1, "map50": 1.0, "map50_95": 0.900990099009901, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 1.0, "ap50_95": 0.900990099009901, "prediction_count": 4, "reference_count": 2 } }, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 3, "predictions": 3, "ranking_predictions": 4, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.8 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "2025-07-01": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": 0.0, "precision_case_support": 1, "recall": null, "recall_case_support": 0, "status": "computed" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": null, "count": 0, "lower": 0.6, "mean_confidence": null, "upper": 0.8 }, { "accuracy": 0, "count": 1, "lower": 0.8, "mean_confidence": 0.92, "upper": 1.0 } ], "brier": 0.8464, "ece": 0.92, "status": "computed" }, "f1": null, "false_discovery_rate": 1.0, "false_negative": 0, "false_positive": 1, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 1, "reference_count": 0 } }, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 1, "predictions": 1, "ranking_predictions": 1, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "2025-10-05": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "raster_classification" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "difficulty": { "strata": { "hard": { "case_support": 6, "failure_count": 10, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "object_detection": { "case_support": 3, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection", "geospatial_data_validation", "object_detection", "raster_classification" ] }, "normal": { "case_support": 3, "failure_count": 4, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation", "terrain_interpretation", "vector_comparison" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "municipality": { "strata": { "Antwerpen": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 1.0, "ap50_95": 0.900990099009901, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 1, "count": 1, "lower": 0.8, "mean_confidence": 0.9, "upper": 1.0 } ], "brier": 0.15333333333333332, "ece": 0.13333333333333325, "status": "computed" }, "f1": 0.8, "false_discovery_rate": 0.3333333333333333, "false_negative": 0, "false_positive": 1, "map50": 1.0, "map50_95": 0.900990099009901, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 1.0, "ap50_95": 0.900990099009901, "prediction_count": 4, "reference_count": 2 } }, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 3, "predictions": 3, "ranking_predictions": 4, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.8 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "Brussel": { "case_support": 2, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": null, "precision_case_support": 0, "recall": null, "recall_case_support": 0, "status": "not_evaluable" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "bins": [], "brier": null, "ece": null, "status": "undefined" }, "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 0, "reference_count": 0 } }, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 0, "predictions": 0, "ranking_predictions": 0, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection", "raster_classification" ] }, "Hasselt": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "terrain_interpretation" ] }, "Liège": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection" ] }, "Mol": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "vector_comparison" ] }, "Namur": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation" ] }, "Oostende": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": 0.0, "precision_case_support": 1, "recall": null, "recall_case_support": 0, "status": "computed" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": null, "count": 0, "lower": 0.6, "mean_confidence": null, "upper": 0.8 }, { "accuracy": 0, "count": 1, "lower": 0.8, "mean_confidence": 0.92, "upper": 1.0 } ], "brier": 0.8464, "ece": 0.92, "status": "computed" }, "f1": null, "false_discovery_rate": 1.0, "false_negative": 0, "false_positive": 1, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 1, "reference_count": 0 } }, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 1, "predictions": 1, "ranking_predictions": 1, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "not_applicable": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "object_size": { "strata": { "empty": { "case_support": 2, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 2, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": 0.0, "precision_case_support": 1, "recall": null, "recall_case_support": 0, "status": "computed" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": null, "count": 0, "lower": 0.6, "mean_confidence": null, "upper": 0.8 }, { "accuracy": 0, "count": 1, "lower": 0.8, "mean_confidence": 0.92, "upper": 1.0 } ], "brier": 0.8464, "ece": 0.92, "status": "computed" }, "f1": null, "false_discovery_rate": 1.0, "false_negative": 0, "false_positive": 1, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 1, "reference_count": 0 } }, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 1, "predictions": 1, "ranking_predictions": 1, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "large": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation" ] }, "mixed": { "case_support": 3, "failure_count": 6, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "object_detection": { "case_support": 1, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 1.0, "ap50_95": 0.900990099009901, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 1, "count": 1, "lower": 0.8, "mean_confidence": 0.9, "upper": 1.0 } ], "brier": 0.15333333333333332, "ece": 0.13333333333333325, "status": "computed" }, "f1": 0.8, "false_discovery_rate": 0.3333333333333333, "false_negative": 0, "false_positive": 1, "map50": 1.0, "map50_95": 0.900990099009901, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 1.0, "ap50_95": 0.900990099009901, "prediction_count": 4, "reference_count": 2 } }, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 3, "predictions": 3, "ranking_predictions": 4, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.8 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection", "object_detection", "vector_comparison" ] }, "not_applicable": { "case_support": 3, "failure_count": 5, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation", "raster_classification", "terrain_interpretation" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "occlusion": { "strata": { "none": { "case_support": 4, "failure_count": 5, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "object_detection": { "case_support": 2, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": 0.0, "precision_case_support": 1, "recall": null, "recall_case_support": 0, "status": "computed" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": null, "count": 0, "lower": 0.6, "mean_confidence": null, "upper": 0.8 }, { "accuracy": 0, "count": 1, "lower": 0.8, "mean_confidence": 0.92, "upper": 1.0 } ], "brier": 0.8464, "ece": 0.92, "status": "computed" }, "f1": null, "false_discovery_rate": 1.0, "false_negative": 0, "false_positive": 1, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 1, "reference_count": 0 } }, "precision": 0.0, "precision_ci95_wilson": { "lower": 0.0, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 0.7934506856227626 }, "prediction_count": 1, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 1, "predictions": 1, "ranking_predictions": 1, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection", "footprint_segmentation", "object_detection" ] }, "not_applicable": { "case_support": 4, "failure_count": 7, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation", "raster_classification", "terrain_interpretation", "vector_comparison" ] }, "partial": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 1.0, "ap50_95": 0.900990099009901, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 1, "count": 1, "lower": 0.8, "mean_confidence": 0.9, "upper": 1.0 } ], "brier": 0.15333333333333332, "ece": 0.13333333333333325, "status": "computed" }, "f1": 0.8, "false_discovery_rate": 0.3333333333333333, "false_negative": 0, "false_positive": 1, "map50": 1.0, "map50_95": 0.900990099009901, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 1.0, "ap50_95": 0.900990099009901, "prediction_count": 4, "reference_count": 2 } }, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 3, "predictions": 3, "ranking_predictions": 4, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.8 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "region": { "strata": { "brussels": { "case_support": 2, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": null, "precision_case_support": 0, "recall": null, "recall_case_support": 0, "status": "not_evaluable" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "bins": [], "brier": null, "ece": null, "status": "undefined" }, "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 0, "reference_count": 0 } }, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 0, "predictions": 0, "ranking_predictions": 0, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection", "raster_classification" ] }, "flanders": { "case_support": 4, "failure_count": 7, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 2, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection", "terrain_interpretation", "vector_comparison" ] }, "national": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] }, "wallonia": { "case_support": 2, "failure_count": 3, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection", "footprint_segmentation" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "resolution_m": { "strata": { "0.1": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "vector_comparison" ] }, "0.25": { "case_support": 3, "failure_count": 4, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 3, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "0.5": { "case_support": 2, "failure_count": 3, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection", "footprint_segmentation" ] }, "1": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "raster_classification" ] }, "5": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "terrain_interpretation" ] }, "__not_applicable__": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "season": { "strata": { "autumn": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "raster_classification" ] }, "multi-date": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection" ] }, "not_applicable": { "case_support": 3, "failure_count": 5, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation", "terrain_interpretation", "vector_comparison" ] }, "spring": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation" ] }, "summer": { "case_support": 2, "failure_count": 4, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 2, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "winter": { "case_support": 1, "failure_count": 0, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": null, "precision_case_support": 0, "recall": null, "recall_case_support": 0, "status": "not_evaluable" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "bins": [], "brier": null, "ece": null, "status": "undefined" }, "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 0, "reference_count": 0 } }, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 0, "predictions": 0, "ranking_predictions": 0, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "sensor": { "strata": { "elevation-raster": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "terrain_interpretation" ] }, "mixed": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] }, "synthetic-multispectral": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "raster_classification" ] }, "synthetic-rgb": { "case_support": 4, "failure_count": 5, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "object_detection": { "case_support": 3, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation", "object_detection" ] }, "vector": { "case_support": 2, "failure_count": 4, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection", "vector_comparison" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "source": { "strata": { "fixture-contracts": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] }, "fixture-dhmv": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "terrain_interpretation" ] }, "fixture-grb": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "vector_comparison" ] }, "fixture-orthophoto": { "case_support": 3, "failure_count": 4, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 3, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection" ] }, "fixture-picc": { "case_support": 1, "failure_count": 1, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation" ] }, "fixture-picc-temporal": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection" ] }, "fixture-thematic-raster": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "raster_classification" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "urbanity": { "strata": { "industrial": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection" ] }, "mixed": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] }, "rural": { "case_support": 2, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "footprint_segmentation", "terrain_interpretation" ] }, "suburban": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "vector_comparison" ] }, "urban": { "case_support": 4, "failure_count": 6, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 3, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection", "raster_classification" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } }, "vegetation": { "strata": { "low": { "case_support": 4, "failure_count": 5, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "change_detection": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "footprint_segmentation": { "case_support": 1, "macro": { "f1": 1.0, "f1_case_support": 1, "mean_boundary_f1": 1.0, "mean_boundary_f1_case_support": 1, "mean_dice": 0.8881578947368421, "mean_dice_case_support": 1, "mean_iou": 0.7988165680473372, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 1.0, "precision_case_support": 1, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "prediction_count": 1, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.20654931437723745, "method": "Wilson score interval", "status": "computed", "support": 1, "upper": 1.0 }, "reference_count": 1, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 1, "references": 1 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 1.0 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "object_detection": { "case_support": 1, "macro": { "f1": null, "f1_case_support": 0, "method": "unweighted mean across cases with defined values", "precision": null, "precision_case_support": 0, "recall": null, "recall_case_support": 0, "status": "not_evaluable" }, "micro": { "ap50": null, "ap50_95": null, "calibration": { "bins": [], "brier": null, "ece": null, "status": "undefined" }, "f1": null, "false_discovery_rate": null, "false_negative": 0, "false_positive": 0, "map50": null, "map50_95": null, "miss_rate": null, "per_class_ap": { "building": { "ap50": null, "ap50_95": null, "prediction_count": 0, "reference_count": 0 } }, "precision": null, "precision_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "prediction_count": 0, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": null, "recall_ci95_wilson": { "lower": null, "status": "undefined", "support": 0, "upper": null }, "reference_count": 0, "true_positive": 0 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 0, "predictions": 0, "ranking_predictions": 0, "references": 0 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": null }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "vector_comparison": { "case_support": 1, "macro": { "f1": 0.5, "f1_case_support": 1, "mean_iou": 1.0, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.5, "precision_case_support": 1, "recall": 0.5, "recall_case_support": 1, "status": "computed" }, "micro": { "f1": 0.5, "false_discovery_rate": 0.5, "false_negative": 1, "false_positive": 1, "miss_rate": 0.5, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "prediction_count": 2, "recall": 0.5, "recall_ci95_wilson": { "lower": 0.09453120573423074, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 0.9054687942657693 }, "reference_count": 2, "true_positive": 1 }, "minimum_case_support": 5, "observation_support": { "predictions": 2, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.5 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "change_detection", "footprint_segmentation", "object_detection", "vector_comparison" ] }, "mixed": { "case_support": 1, "failure_count": 2, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "geospatial_data_validation": { "case_support": 1, "macro": { "blocker_or_critical_miss_count": 1.0, "blocker_or_critical_miss_count_case_support": 1, "f1": 0.6666666666666666, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.6666666666666666, "precision_case_support": 1, "recall": 0.6666666666666666, "recall_case_support": 1, "status": "computed" }, "micro": { "blocker_or_critical_miss_count": 1, "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "predictions": 3, "references": 3 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "geospatial_data_validation" ] }, "moderate": { "case_support": 4, "failure_count": 7, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "task_metrics": { "object_detection": { "case_support": 2, "macro": { "f1": 0.8, "f1_case_support": 1, "method": "unweighted mean across cases with defined values", "precision": 0.3333333333333333, "precision_case_support": 2, "recall": 1.0, "recall_case_support": 1, "status": "computed" }, "micro": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "calibration": { "binning": "five fixed equal-width bins", "bins": [ { "accuracy": null, "count": 0, "lower": 0.0, "mean_confidence": null, "upper": 0.2 }, { "accuracy": null, "count": 0, "lower": 0.2, "mean_confidence": null, "upper": 0.4 }, { "accuracy": null, "count": 0, "lower": 0.4, "mean_confidence": null, "upper": 0.6 }, { "accuracy": 0.5, "count": 2, "lower": 0.6, "mean_confidence": 0.6499999999999999, "upper": 0.8 }, { "accuracy": 0.5, "count": 2, "lower": 0.8, "mean_confidence": 0.91, "upper": 1.0 } ], "brier": 0.3266, "ece": 0.27999999999999997, "status": "computed" }, "f1": 0.6666666666666666, "false_discovery_rate": 0.5, "false_negative": 0, "false_positive": 2, "map50": 0.6666666666666666, "map50_95": 0.5838283828382838, "miss_rate": 0.0, "per_class_ap": { "building": { "ap50": 0.6666666666666666, "ap50_95": 0.5838283828382838, "prediction_count": 5, "reference_count": 2 } }, "precision": 0.5, "precision_ci95_wilson": { "lower": 0.15003898915214947, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 0.8499610108478506 }, "prediction_count": 4, "ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP", "recall": 1.0, "recall_ci95_wilson": { "lower": 0.34238022750665303, "method": "Wilson score interval", "status": "computed", "support": 2, "upper": 1.0 }, "reference_count": 2, "true_positive": 2 }, "minimum_case_support": 5, "observation_support": { "calibration_predictions": 4, "predictions": 4, "ranking_predictions": 5, "references": 2 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.f1", "value": 0.6666666666666666 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "raster_classification": { "case_support": 1, "macro": { "accuracy": 0.8333333333333334, "accuracy_case_support": 1, "macro_f1": 0.8222222222222223, "macro_f1_case_support": 1, "mean_iou": 0.7222222222222222, "mean_iou_case_support": 1, "method": "unweighted mean across cases with defined values", "status": "computed" }, "micro": { "accuracy": 0.8333333333333334, "accuracy_ci95_wilson": { "lower": 0.5519691377470266, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 0.9530348578161463 }, "correct_pixel_count": 10, "evaluated_reference_pixel_count": 12, "macro_f1_across_classes": 0.8222222222222223, "mean_iou": 0.7222222222222222, "per_class": { "0": { "f1": 1.0, "false_discovery_rate": 0.0, "false_negative": 0, "false_positive": 0, "iou": 1.0, "miss_rate": 0.0, "precision": 1.0, "precision_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "prediction_count": 4, "recall": 1.0, "recall_ci95_wilson": { "lower": 0.5101091635454027, "method": "Wilson score interval", "status": "computed", "support": 4, "upper": 1.0 }, "reference_count": 4, "true_positive": 4 }, "1": { "f1": 0.8000000000000002, "false_discovery_rate": 0.2, "false_negative": 1, "false_positive": 1, "iou": 0.6666666666666666, "miss_rate": 0.2, "precision": 0.8, "precision_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "prediction_count": 5, "recall": 0.8, "recall_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "reference_count": 5, "true_positive": 4 }, "2": { "f1": 0.6666666666666666, "false_discovery_rate": 0.3333333333333333, "false_negative": 1, "false_positive": 1, "iou": 0.5, "miss_rate": 0.3333333333333333, "precision": 0.6666666666666666, "precision_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "prediction_count": 3, "recall": 0.6666666666666666, "recall_ci95_wilson": { "lower": 0.2076596008020477, "method": "Wilson score interval", "status": "computed", "support": 3, "upper": 0.9385080552796037 }, "reference_count": 3, "true_positive": 2 } }, "prediction_coverage": 1.0, "prediction_coverage_ci95_wilson": { "lower": 0.7575059933447592, "method": "Wilson score interval", "status": "computed", "support": 12, "upper": 1.0 }, "prediction_present_pixel_count": 12 }, "minimum_case_support": 5, "observation_support": { "evaluated_pixels": 12 }, "primary_metric": { "direction": "higher_is_better", "name": "micro.mean_iou", "value": 0.7222222222222222 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" }, "terrain_interpretation": { "case_support": 1, "macro": { "bias": 0.02499999999999991, "bias_case_support": 1, "coverage": 0.8, "coverage_case_support": 1, "mae": 0.2749999999999999, "mae_case_support": 1, "method": "unweighted mean across cases with defined values", "rmse": 0.2872281323269015, "rmse_case_support": 1, "status": "computed" }, "micro": { "bias": 0.02499999999999991, "coverage": 0.8, "coverage_ci95_wilson": { "lower": 0.37553462976252533, "method": "Wilson score interval", "status": "computed", "support": 5, "upper": 0.9637758913675698 }, "evaluated_count": 4, "mae": 0.2749999999999999, "reference_count": 5, "rmse": 0.2872281323269015, "status": "computed", "units": "m_TAW" }, "minimum_case_support": 5, "observation_support": { "evaluated": 4, "references": 5 }, "primary_metric": { "direction": "lower_is_better", "name": "micro.rmse", "value": 0.2872281323269015 }, "release_gate_reason": "insufficient_support", "release_gate_status": "not_evaluable", "status": "insufficient_support" } }, "tasks": [ "object_detection", "raster_classification", "terrain_interpretation" ] } }, "worst_stratum_by_task": { "change_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "footprint_segmentation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "geospatial_data_validation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "object_detection": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "raster_classification": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "terrain_interpretation": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" }, "vector_comparison": { "reason": "no stratum meets minimum support with a defined primary metric", "status": "not_evaluable" } } } }, "minimum_case_support": 5, "overall_status": "not_evaluable", "schema_version": 2, "support_unit": "independent benchmark cases; pixel/object counts are reported separately and do not replace case support" }, "task_count": 7, "task_inventory": [ { "capability_id": "model_object_detection", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "synthetic_contract_case_only", "implementation_kind": "model_inference_pipeline", "implementation_paths": [ "backend/app/services/detection_service.py" ], "suitable_metrics": [ "precision", "recall", "F1", "AP50", "AP50-95", "IoU", "ECE", "Brier", "coverage-risk" ], "task": "object_detection" }, { "capability_id": "building_proposal_filtering", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "not_separately_benchmarked", "implementation_kind": "supporting_candidate_classifier", "implementation_paths": [ "scripts/train_building_proposal_classifier.py", "scripts/evaluate_belgium_building_candidate.py" ], "suitable_metrics": [ "candidate precision", "candidate recall", "F1", "calibration" ], "task": "object_detection" }, { "capability_id": "footprint_segmentation", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "synthetic_contract_case_only", "implementation_kind": "model_inference_pipeline", "implementation_paths": [ "backend/app/services/segmentation_service.py", "backend/app/services/segmentation_adapter.py" ], "suitable_metrics": [ "object precision", "object recall", "F1", "IoU", "Dice", "boundary F1", "centroid distance", "area error", "topology" ], "task": "footprint_segmentation" }, { "capability_id": "detection_and_vector_qa", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "synthetic_contract_case_only", "implementation_kind": "deterministic_geospatial_comparison", "implementation_paths": [ "backend/app/services/qa_service.py", "backend/app/services/detection_qa_service.py", "backend/app/services/quality_check_service.py" ], "suitable_metrics": [ "precision", "recall", "F1", "IoU", "topology", "coverage" ], "task": "vector_comparison" }, { "capability_id": "vector_clip_buffer_intersect", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "covered_by_family_not_separately_benchmarked", "implementation_kind": "deterministic_vector_processing", "implementation_paths": [ "backend/app/services/vector_operations_service.py", "backend/app/services/vector_feature_service.py" ], "suitable_metrics": [ "geometry validity", "CRS correctness", "area conservation", "feature counts", "topology" ], "task": "vector_comparison" }, { "capability_id": "temporal_vector_change", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "synthetic_contract_case_only", "implementation_kind": "deterministic_change_detection", "implementation_paths": [ "backend/app/services/change_detection_service.py" ], "suitable_metrics": [ "event precision", "event recall", "event F1", "IoU" ], "task": "change_detection" }, { "capability_id": "thematic_raster_interpretation", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "synthetic_metric_contract_only_no_generic_learned_classifier_claim", "implementation_kind": "deterministic_source_interpretation", "implementation_paths": [ "backend/app/services/thematic_raster_analysis_service.py" ], "suitable_metrics": [ "pixel accuracy", "per-class F1", "per-class IoU", "mean IoU" ], "task": "raster_classification" }, { "capability_id": "raster_clip_reproject_indices", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "covered_by_family_not_separately_benchmarked", "implementation_kind": "deterministic_raster_processing", "implementation_paths": [ "backend/app/services/raster_service.py", "backend/app/services/raster_operations_service.py" ], "suitable_metrics": [ "CRS/transform preservation", "pixel alignment", "nodata", "numeric tolerance" ], "task": "raster_classification" }, { "capability_id": "raster_partition_mosaic", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "not_separately_benchmarked", "implementation_kind": "deterministic_raster_partitioning", "implementation_paths": [ "backend/app/services/raster_partition_analysis_service.py" ], "suitable_metrics": [ "seam equality", "coverage completeness", "resolution consistency" ], "task": "raster_classification" }, { "capability_id": "terrain_height_interpretation", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "synthetic_contract_case_only", "implementation_kind": "deterministic_continuous_raster_analysis", "implementation_paths": [ "backend/app/services/terrain_analysis_service.py", "backend/app/services/spw_terrain_service.py" ], "suitable_metrics": [ "MAE", "RMSE", "bias", "coverage", "unit integrity" ], "task": "terrain_interpretation" }, { "capability_id": "flood_hazard_interpretation", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "covered_by_family_not_separately_benchmarked", "implementation_kind": "deterministic_scenario_raster_analysis", "implementation_paths": [ "backend/app/services/flood_hazard_analysis_service.py" ], "suitable_metrics": [ "depth MAE/RMSE", "hazard-class IoU", "coverage", "scenario identity" ], "task": "terrain_interpretation" }, { "capability_id": "bathymetry_interpretation", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "covered_by_family_not_separately_benchmarked", "implementation_kind": "deterministic_vertical_reference_analysis", "implementation_paths": [ "backend/app/services/bathymetry_raster_analysis_service.py", "backend/app/services/mdk_bathymetry_probe_service.py" ], "suitable_metrics": [ "MAE", "RMSE", "bias", "coverage", "vertical-datum integrity" ], "task": "terrain_interpretation" }, { "capability_id": "data_contract_validation_and_scan", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "synthetic_contract_case_only", "implementation_kind": "deterministic_validation", "implementation_paths": [ "backend/app/services/data_contract_validation.py", "scripts/run_accuracy_phase3_full_data_scan.py" ], "suitable_metrics": [ "anomaly precision", "anomaly recall", "anomaly F1", "critical misses" ], "task": "geospatial_data_validation" }, { "capability_id": "aoi_partition_orchestration", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "not_separately_benchmarked", "implementation_kind": "deterministic_orchestration", "implementation_paths": [ "backend/app/services/aoi_operation_service.py", "backend/app/services/aoi_operation_executor.py", "backend/app/services/aoi_operation_worker.py" ], "suitable_metrics": [ "partition completeness", "overlap/gap", "idempotency", "resume correctness" ], "task": "geospatial_data_validation" }, { "capability_id": "geo_assistant_orchestration", "claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.", "evaluation_status": "no_independent_accuracy_score_underlying_tool_results_are_authoritative", "implementation_kind": "tool_orchestration_interface", "implementation_paths": [ "backend/app/services/geo_assistant_service.py" ], "suitable_metrics": [ "tool-selection correctness", "grounding", "unsupported-claim rate" ], "task": "geospatial_data_validation" } ] }