Files
geointel/artifacts/evidence/accuracy/P4/runs/p4-2.0.1-9677d0ef37db82bcf39b/metric-report.json
T
Jens f41392a415
GeoIntel release gates / Compile, test, contracts and builds (push) Canceled after 0s
GeoIntel release gates / Python and npm vulnerability policy (push) Canceled after 0s
GeoIntel release gates / GIS image, SBOM and container scan (push) Canceled after 0s
docs(accuracy): publish phase 4 benchmark evidence
2026-08-02 05:10:05 +02:00

10636 lines
394 KiB
JSON

{
"case_count": 9,
"claim_boundary": "Synthetic deterministic reference cases validate evaluator behavior, not production model accuracy.",
"evaluated_task_families": [
"change_detection",
"footprint_segmentation",
"geospatial_data_validation",
"object_detection",
"raster_classification",
"terrain_interpretation",
"vector_comparison"
],
"evaluator_version": "2.1.0",
"failure_taxonomy": {
"claim_boundary": "diagnostic classification; not a release decision",
"contexts": {
"high_confidence": "false positive meets the highest frozen diagnostic confidence threshold",
"out_of_distribution": "case metadata explicitly marks OOD context",
"tile_edge": "case metadata explicitly marks tile-edge context"
},
"primary_codes": {
"D-VALIDATION-FN": "reference anomaly or severity not exactly reported",
"D-VALIDATION-FP": "anomaly or severity reported without an exact reference match",
"M-AREA-BIAS": "matched footprint has a measurable relative area bias",
"M-BOUNDARY": "matched footprint has a measurable boundary deviation",
"M-CLASS": "raster class differs from the valid reference class",
"M-FN-MISSED": "unmatched reference object or event",
"M-FP-CONFUSER": "unmatched object or event prediction",
"M-MISCALIBRATED": "confidence diagnostic deviates from observed correctness",
"M-OOD": "error observed in an explicitly declared out-of-distribution case",
"P-PARTIAL": "required prediction value is unavailable"
}
},
"full_results_canonical_json_sha256": "55cdba9cce4dcdc88cee0829cd510d7e624a3472feb9d33f7e681621a792eba3",
"hash_specification": {
"algorithm": "SHA-256",
"canonical_json": "UTF-8 JSON produced with sort_keys=true, separators=(',', ':'), ensure_ascii=false and allow_nan=false",
"portfolio_canonical_json_sha256_input": "parsed complete portfolio",
"portfolio_file_sha256_input": "exact source-file bytes",
"results_canonical_json_sha256_input": "complete sample-id-ordered results array"
},
"metric_results_canonical_json_sha256": "cdaf2460bf51231d8f547402ab9c464a72fa9226aa69380e313609f9fb2e3b2e",
"portfolio_canonical_json_sha256": "1ac1bd77db125db48f9168406d51bfb723522f54a6c81dbe868d600c72f27b17",
"portfolio_file_sha256": "c49a9c8d74cae2062552b012d9c275f65156c81d75b3e453860f5b859c1c5473",
"portfolio_id": "geointel-p4-reference-harness-v2",
"portfolio_kind": "synthetic_contract",
"portfolio_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"object_detection": {
"case_support": 3,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"protected_policy": {
"diagnostic_curves_select_operating_point": false,
"operating_point_selection_allowed": false,
"test_feedback_allowed": false,
"threshold_selection_source": "pre_registered_configuration_only"
},
"results": [
{
"metadata": {
"context": "coastal_hard_negative",
"date": "2025-07-01",
"difficulty": "hard",
"label_review_state": "fixture_reviewed",
"municipality": "Oostende",
"object_size": "empty",
"occlusion": "none",
"ood": false,
"region": "flanders",
"resolution_m": 0.25,
"season": "summer",
"sensor": "synthetic-rgb",
"source": "fixture-orthophoto",
"tile_edge": true,
"urbanity": "urban",
"vegetation": "moderate"
},
"metrics": {
"ap50": null,
"ap50_95": null,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": null,
"count": 0,
"lower": 0.6,
"mean_confidence": null,
"upper": 0.8
},
{
"accuracy": 0,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.92,
"upper": 1.0
}
],
"brier": 0.8464,
"ece": 0.92,
"status": "computed"
},
"coverage_risk": [
{
"false_negative_count": 0,
"false_positive_count": 1,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 1,
"retained_prediction_coverage": 1.0,
"risk": 1.0,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.0,
"total_prediction_count": 1
},
{
"false_negative_count": 0,
"false_positive_count": 1,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 1,
"retained_prediction_coverage": 1.0,
"risk": 1.0,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.5,
"total_prediction_count": 1
},
{
"false_negative_count": 0,
"false_positive_count": 1,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 1,
"retained_prediction_coverage": 1.0,
"risk": 1.0,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.7,
"total_prediction_count": 1
},
{
"false_negative_count": 0,
"false_positive_count": 1,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 1,
"retained_prediction_coverage": 1.0,
"risk": 1.0,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.9,
"total_prediction_count": 1
}
],
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 0,
"false_positive": 1,
"map50": null,
"map50_95": null,
"match_iou": 0.5,
"matched_iou": {
"count": 0,
"max": null,
"mean": null,
"median": null,
"min": null
},
"miss_rate": null,
"operating_confidence": 0.5,
"per_class": {
"building": {
"ap50": null,
"ap50_95": null,
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 0,
"false_positive": 1,
"miss_rate": null,
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
}
},
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"sample_id": "background-test-hard-negative",
"task": "object_detection"
},
{
"metadata": {
"context": "pure_background",
"date": "2025-02-01",
"difficulty": "hard",
"label_review_state": "fixture_reviewed",
"municipality": "Brussel",
"object_size": "empty",
"occlusion": "none",
"ood": false,
"region": "brussels",
"resolution_m": 0.25,
"season": "winter",
"sensor": "synthetic-rgb",
"source": "fixture-orthophoto",
"tile_edge": false,
"urbanity": "urban",
"vegetation": "low"
},
"metrics": {
"ap50": null,
"ap50_95": null,
"calibration": {
"bins": [],
"brier": null,
"ece": null,
"status": "undefined"
},
"coverage_risk": [
{
"false_negative_count": 0,
"false_positive_count": 0,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 0,
"retained_prediction_coverage": null,
"risk": null,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.0,
"total_prediction_count": 0
},
{
"false_negative_count": 0,
"false_positive_count": 0,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 0,
"retained_prediction_coverage": null,
"risk": null,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.5,
"total_prediction_count": 0
},
{
"false_negative_count": 0,
"false_positive_count": 0,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 0,
"retained_prediction_coverage": null,
"risk": null,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.7,
"total_prediction_count": 0
},
{
"false_negative_count": 0,
"false_positive_count": 0,
"matched_reference_count": 0,
"reference_count": 0,
"reference_coverage": null,
"retained_prediction_count": 0,
"retained_prediction_coverage": null,
"risk": null,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.9,
"total_prediction_count": 0
}
],
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"map50": null,
"map50_95": null,
"match_iou": 0.5,
"matched_iou": {
"count": 0,
"max": null,
"mean": null,
"median": null,
"min": null
},
"miss_rate": null,
"operating_confidence": 0.5,
"per_class": {
"building": {
"ap50": null,
"ap50_95": null,
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"miss_rate": null,
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
}
},
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"sample_id": "background-test-pure-empty",
"task": "object_detection"
},
{
"metadata": {
"context": "industrial_change",
"date": "2024-05-01/2025-05-01",
"difficulty": "hard",
"label_review_state": "fixture_reviewed",
"municipality": "Liège",
"object_size": "mixed",
"occlusion": "none",
"ood": false,
"region": "wallonia",
"resolution_m": 0.5,
"season": "multi-date",
"sensor": "vector",
"source": "fixture-picc-temporal",
"tile_edge": false,
"urbanity": "industrial",
"vegetation": "low"
},
"metrics": {
"event_metrics": {
"added": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"removed": {
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 1.0,
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"recall": 0.0,
"recall_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"reference_count": 1,
"true_positive": 0
}
},
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"sample_id": "change-test-wallonia-industrial",
"task": "change_detection"
},
{
"metadata": {
"context": "dense_urban",
"date": "2025-06-15",
"difficulty": "hard",
"label_review_state": "fixture_reviewed",
"municipality": "Antwerpen",
"object_size": "mixed",
"occlusion": "partial",
"ood": false,
"region": "flanders",
"resolution_m": 0.25,
"season": "summer",
"sensor": "synthetic-rgb",
"source": "fixture-orthophoto",
"tile_edge": false,
"urbanity": "urban",
"vegetation": "moderate"
},
"metrics": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 1,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.9,
"upper": 1.0
}
],
"brier": 0.15333333333333332,
"ece": 0.13333333333333325,
"status": "computed"
},
"coverage_risk": [
{
"false_negative_count": 0,
"false_positive_count": 2,
"matched_reference_count": 2,
"reference_count": 2,
"reference_coverage": 1.0,
"retained_prediction_count": 4,
"retained_prediction_coverage": 1.0,
"risk": 0.5,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.0,
"total_prediction_count": 4
},
{
"false_negative_count": 0,
"false_positive_count": 1,
"matched_reference_count": 2,
"reference_count": 2,
"reference_coverage": 1.0,
"retained_prediction_count": 3,
"retained_prediction_coverage": 0.75,
"risk": 0.3333333333333333,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.5,
"total_prediction_count": 4
},
{
"false_negative_count": 0,
"false_positive_count": 0,
"matched_reference_count": 2,
"reference_count": 2,
"reference_coverage": 1.0,
"retained_prediction_count": 2,
"retained_prediction_coverage": 0.5,
"risk": 0.0,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.7,
"total_prediction_count": 4
},
{
"false_negative_count": 1,
"false_positive_count": 0,
"matched_reference_count": 1,
"reference_count": 2,
"reference_coverage": 0.5,
"retained_prediction_count": 1,
"retained_prediction_coverage": 0.25,
"risk": 0.5,
"risk_definition": "(false_positive + false_negative) / (true_positive + false_positive + false_negative)",
"threshold": 0.9,
"total_prediction_count": 4
}
],
"f1": 0.8,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 0,
"false_positive": 1,
"map50": 1.0,
"map50_95": 0.900990099009901,
"match_iou": 0.5,
"matched_iou": {
"count": 2,
"max": 1.0,
"mean": 0.9355555555555555,
"median": 0.9355555555555555,
"min": 0.8711111111111111
},
"miss_rate": 0.0,
"operating_confidence": 0.5,
"per_class": {
"building": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"f1": 0.8,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 0,
"false_positive": 1,
"miss_rate": 0.0,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
}
},
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"sample_id": "det-test-flanders-urban",
"task": "object_detection"
},
{
"metadata": {
"context": "dense_urban_raster",
"date": "2025-10-05",
"difficulty": "hard",
"label_review_state": "fixture_reviewed",
"municipality": "Brussel",
"object_size": "not_applicable",
"occlusion": "not_applicable",
"ood": false,
"region": "brussels",
"resolution_m": 1,
"season": "autumn",
"sensor": "synthetic-multispectral",
"source": "fixture-thematic-raster",
"tile_edge": true,
"urbanity": "urban",
"vegetation": "moderate"
},
"metrics": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"alignment_validated": true,
"confusion_matrix": {
"0": {
"0": 4,
"1": 0,
"2": 0,
"__prediction_nodata__": 0
},
"1": {
"0": 0,
"1": 4,
"2": 1,
"__prediction_nodata__": 0
},
"2": {
"0": 0,
"1": 1,
"2": 2,
"__prediction_nodata__": 0
}
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"ignored_reference_pixel_count": 0,
"macro_f1": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"pixel_count": 12,
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_outside_reference_count": 0,
"prediction_present_pixel_count": 12
},
"sample_id": "raster-test-brussels-urban",
"task": "raster_classification"
},
{
"metadata": {
"context": "rural_buildings",
"date": "2025-04-20",
"difficulty": "normal",
"label_review_state": "fixture_reviewed",
"municipality": "Namur",
"object_size": "large",
"occlusion": "none",
"ood": false,
"region": "wallonia",
"resolution_m": 0.5,
"season": "spring",
"sensor": "synthetic-rgb",
"source": "fixture-picc",
"tile_edge": false,
"urbanity": "rural",
"vegetation": "low"
},
"metrics": {
"centroid_distance_m": {
"count": 1,
"max": 0.5,
"mean": 0.5,
"median": 0.5,
"min": 0.5
},
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"mean_boundary_f1": 1.0,
"mean_dice": 0.8881578947368421,
"mean_iou": 0.7988165680473372,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"relative_area_error": {
"count": 1,
"max": -0.1,
"mean": -0.1,
"median": -0.1,
"min": -0.1
},
"spatial_context_validated": true,
"topologically_invalid_predictions": 0,
"topologically_valid_predictions": 1,
"true_positive": 1
},
"sample_id": "seg-test-wallonia-rural",
"task": "footprint_segmentation"
},
{
"metadata": {
"context": "terrain_profile",
"date": "2023-01-01",
"difficulty": "normal",
"label_review_state": "fixture_reviewed",
"municipality": "Hasselt",
"object_size": "not_applicable",
"occlusion": "not_applicable",
"ood": false,
"region": "flanders",
"resolution_m": 5,
"season": "not_applicable",
"sensor": "elevation-raster",
"source": "fixture-dhmv",
"tile_edge": false,
"urbanity": "rural",
"vegetation": "moderate"
},
"metrics": {
"absolute_error_sum": 1.0999999999999996,
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"error_distribution": {
"count": 4,
"max": 0.40000000000000036,
"mean": 0.02499999999999991,
"median": 0.0,
"min": -0.3000000000000007
},
"error_sum": 0.09999999999999964,
"evaluated_count": 4,
"mae": 0.2749999999999999,
"missing_count": 1,
"reference_count": 5,
"rmse": 0.2872281323269015,
"squared_error_sum": 0.3300000000000001,
"units": "m_TAW"
},
"sample_id": "terrain-test-flanders-rural",
"task": "terrain_interpretation"
},
{
"metadata": {
"context": "data_contract",
"date": "2025-01-01",
"difficulty": "hard",
"label_review_state": "fixture_reviewed",
"municipality": "not_applicable",
"object_size": "not_applicable",
"occlusion": "not_applicable",
"ood": false,
"region": "national",
"resolution_m": null,
"season": "not_applicable",
"sensor": "mixed",
"source": "fixture-contracts",
"tile_edge": false,
"urbanity": "mixed",
"vegetation": "mixed"
},
"metrics": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"misses_by_severity": {
"blocker": 0,
"critical": 1,
"informational": 0,
"major": 0,
"minor": 0
},
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"severity_mismatch_count": 0,
"severity_mismatches": [],
"true_positive": 2
},
"sample_id": "validation-test-national",
"task": "geospatial_data_validation"
},
{
"metadata": {
"context": "suburban_buildings",
"date": "2025-01-15",
"difficulty": "normal",
"label_review_state": "fixture_reviewed",
"municipality": "Mol",
"object_size": "mixed",
"occlusion": "not_applicable",
"ood": false,
"region": "flanders",
"resolution_m": 0.1,
"season": "not_applicable",
"sensor": "vector",
"source": "fixture-grb",
"tile_edge": false,
"urbanity": "suburban",
"vegetation": "low"
},
"metrics": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"mean_iou": 1.0,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"spatial_context_validated": true,
"topologically_valid": true,
"true_positive": 1
},
"sample_id": "vector-test-flanders-suburban",
"task": "vector_comparison"
}
],
"results_canonical_json_sha256": "55cdba9cce4dcdc88cee0829cd510d7e624a3472feb9d33f7e681621a792eba3",
"schema_version": 2,
"selection_policy": "No data-dependent threshold, model or gate selection is performed from protected cases.",
"split_roles": [
"test",
"background-test"
],
"subgroups": {
"dimensions": {
"context": {
"strata": {
"coastal_hard_negative": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": 0.0,
"precision_case_support": 1,
"recall": null,
"recall_case_support": 0,
"status": "computed"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": null,
"count": 0,
"lower": 0.6,
"mean_confidence": null,
"upper": 0.8
},
{
"accuracy": 0,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.92,
"upper": 1.0
}
],
"brier": 0.8464,
"ece": 0.92,
"status": "computed"
},
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 0,
"false_positive": 1,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 1,
"reference_count": 0
}
},
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 1,
"predictions": 1,
"ranking_predictions": 1,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"data_contract": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
},
"dense_urban": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 1,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.9,
"upper": 1.0
}
],
"brier": 0.15333333333333332,
"ece": 0.13333333333333325,
"status": "computed"
},
"f1": 0.8,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 0,
"false_positive": 1,
"map50": 1.0,
"map50_95": 0.900990099009901,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"prediction_count": 4,
"reference_count": 2
}
},
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 3,
"predictions": 3,
"ranking_predictions": 4,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.8
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"dense_urban_raster": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"raster_classification"
]
},
"industrial_change": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection"
]
},
"pure_background": {
"case_support": 1,
"failure_count": 0,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": null,
"precision_case_support": 0,
"recall": null,
"recall_case_support": 0,
"status": "not_evaluable"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"bins": [],
"brier": null,
"ece": null,
"status": "undefined"
},
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 0,
"reference_count": 0
}
},
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 0,
"predictions": 0,
"ranking_predictions": 0,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"rural_buildings": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation"
]
},
"suburban_buildings": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"vector_comparison"
]
},
"terrain_profile": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"terrain_interpretation"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"date": {
"strata": {
"2023-01-01": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"terrain_interpretation"
]
},
"2024-05-01/2025-05-01": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection"
]
},
"2025-01-01": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
},
"2025-01-15": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"vector_comparison"
]
},
"2025-02-01": {
"case_support": 1,
"failure_count": 0,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": null,
"precision_case_support": 0,
"recall": null,
"recall_case_support": 0,
"status": "not_evaluable"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"bins": [],
"brier": null,
"ece": null,
"status": "undefined"
},
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 0,
"reference_count": 0
}
},
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 0,
"predictions": 0,
"ranking_predictions": 0,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"2025-04-20": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation"
]
},
"2025-06-15": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 1,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.9,
"upper": 1.0
}
],
"brier": 0.15333333333333332,
"ece": 0.13333333333333325,
"status": "computed"
},
"f1": 0.8,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 0,
"false_positive": 1,
"map50": 1.0,
"map50_95": 0.900990099009901,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"prediction_count": 4,
"reference_count": 2
}
},
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 3,
"predictions": 3,
"ranking_predictions": 4,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.8
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"2025-07-01": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": 0.0,
"precision_case_support": 1,
"recall": null,
"recall_case_support": 0,
"status": "computed"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": null,
"count": 0,
"lower": 0.6,
"mean_confidence": null,
"upper": 0.8
},
{
"accuracy": 0,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.92,
"upper": 1.0
}
],
"brier": 0.8464,
"ece": 0.92,
"status": "computed"
},
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 0,
"false_positive": 1,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 1,
"reference_count": 0
}
},
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 1,
"predictions": 1,
"ranking_predictions": 1,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"2025-10-05": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"raster_classification"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"difficulty": {
"strata": {
"hard": {
"case_support": 6,
"failure_count": 10,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"object_detection": {
"case_support": 3,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection",
"geospatial_data_validation",
"object_detection",
"raster_classification"
]
},
"normal": {
"case_support": 3,
"failure_count": 4,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation",
"terrain_interpretation",
"vector_comparison"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"municipality": {
"strata": {
"Antwerpen": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 1,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.9,
"upper": 1.0
}
],
"brier": 0.15333333333333332,
"ece": 0.13333333333333325,
"status": "computed"
},
"f1": 0.8,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 0,
"false_positive": 1,
"map50": 1.0,
"map50_95": 0.900990099009901,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"prediction_count": 4,
"reference_count": 2
}
},
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 3,
"predictions": 3,
"ranking_predictions": 4,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.8
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"Brussel": {
"case_support": 2,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": null,
"precision_case_support": 0,
"recall": null,
"recall_case_support": 0,
"status": "not_evaluable"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"bins": [],
"brier": null,
"ece": null,
"status": "undefined"
},
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 0,
"reference_count": 0
}
},
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 0,
"predictions": 0,
"ranking_predictions": 0,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection",
"raster_classification"
]
},
"Hasselt": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"terrain_interpretation"
]
},
"Liège": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection"
]
},
"Mol": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"vector_comparison"
]
},
"Namur": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation"
]
},
"Oostende": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": 0.0,
"precision_case_support": 1,
"recall": null,
"recall_case_support": 0,
"status": "computed"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": null,
"count": 0,
"lower": 0.6,
"mean_confidence": null,
"upper": 0.8
},
{
"accuracy": 0,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.92,
"upper": 1.0
}
],
"brier": 0.8464,
"ece": 0.92,
"status": "computed"
},
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 0,
"false_positive": 1,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 1,
"reference_count": 0
}
},
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 1,
"predictions": 1,
"ranking_predictions": 1,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"not_applicable": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"object_size": {
"strata": {
"empty": {
"case_support": 2,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 2,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": 0.0,
"precision_case_support": 1,
"recall": null,
"recall_case_support": 0,
"status": "computed"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": null,
"count": 0,
"lower": 0.6,
"mean_confidence": null,
"upper": 0.8
},
{
"accuracy": 0,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.92,
"upper": 1.0
}
],
"brier": 0.8464,
"ece": 0.92,
"status": "computed"
},
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 0,
"false_positive": 1,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 1,
"reference_count": 0
}
},
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 1,
"predictions": 1,
"ranking_predictions": 1,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"large": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation"
]
},
"mixed": {
"case_support": 3,
"failure_count": 6,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"object_detection": {
"case_support": 1,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 1,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.9,
"upper": 1.0
}
],
"brier": 0.15333333333333332,
"ece": 0.13333333333333325,
"status": "computed"
},
"f1": 0.8,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 0,
"false_positive": 1,
"map50": 1.0,
"map50_95": 0.900990099009901,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"prediction_count": 4,
"reference_count": 2
}
},
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 3,
"predictions": 3,
"ranking_predictions": 4,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.8
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection",
"object_detection",
"vector_comparison"
]
},
"not_applicable": {
"case_support": 3,
"failure_count": 5,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation",
"raster_classification",
"terrain_interpretation"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"occlusion": {
"strata": {
"none": {
"case_support": 4,
"failure_count": 5,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"object_detection": {
"case_support": 2,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": 0.0,
"precision_case_support": 1,
"recall": null,
"recall_case_support": 0,
"status": "computed"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": null,
"count": 0,
"lower": 0.6,
"mean_confidence": null,
"upper": 0.8
},
{
"accuracy": 0,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.92,
"upper": 1.0
}
],
"brier": 0.8464,
"ece": 0.92,
"status": "computed"
},
"f1": null,
"false_discovery_rate": 1.0,
"false_negative": 0,
"false_positive": 1,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 1,
"reference_count": 0
}
},
"precision": 0.0,
"precision_ci95_wilson": {
"lower": 0.0,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 0.7934506856227626
},
"prediction_count": 1,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 1,
"predictions": 1,
"ranking_predictions": 1,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection",
"footprint_segmentation",
"object_detection"
]
},
"not_applicable": {
"case_support": 4,
"failure_count": 7,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation",
"raster_classification",
"terrain_interpretation",
"vector_comparison"
]
},
"partial": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 1,
"count": 1,
"lower": 0.8,
"mean_confidence": 0.9,
"upper": 1.0
}
],
"brier": 0.15333333333333332,
"ece": 0.13333333333333325,
"status": "computed"
},
"f1": 0.8,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 0,
"false_positive": 1,
"map50": 1.0,
"map50_95": 0.900990099009901,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 1.0,
"ap50_95": 0.900990099009901,
"prediction_count": 4,
"reference_count": 2
}
},
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 3,
"predictions": 3,
"ranking_predictions": 4,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.8
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"region": {
"strata": {
"brussels": {
"case_support": 2,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": null,
"precision_case_support": 0,
"recall": null,
"recall_case_support": 0,
"status": "not_evaluable"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"bins": [],
"brier": null,
"ece": null,
"status": "undefined"
},
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 0,
"reference_count": 0
}
},
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 0,
"predictions": 0,
"ranking_predictions": 0,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection",
"raster_classification"
]
},
"flanders": {
"case_support": 4,
"failure_count": 7,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 2,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection",
"terrain_interpretation",
"vector_comparison"
]
},
"national": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
},
"wallonia": {
"case_support": 2,
"failure_count": 3,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection",
"footprint_segmentation"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"resolution_m": {
"strata": {
"0.1": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"vector_comparison"
]
},
"0.25": {
"case_support": 3,
"failure_count": 4,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 3,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"0.5": {
"case_support": 2,
"failure_count": 3,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection",
"footprint_segmentation"
]
},
"1": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"raster_classification"
]
},
"5": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"terrain_interpretation"
]
},
"__not_applicable__": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"season": {
"strata": {
"autumn": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"raster_classification"
]
},
"multi-date": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection"
]
},
"not_applicable": {
"case_support": 3,
"failure_count": 5,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation",
"terrain_interpretation",
"vector_comparison"
]
},
"spring": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation"
]
},
"summer": {
"case_support": 2,
"failure_count": 4,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 2,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"winter": {
"case_support": 1,
"failure_count": 0,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": null,
"precision_case_support": 0,
"recall": null,
"recall_case_support": 0,
"status": "not_evaluable"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"bins": [],
"brier": null,
"ece": null,
"status": "undefined"
},
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 0,
"reference_count": 0
}
},
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 0,
"predictions": 0,
"ranking_predictions": 0,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"sensor": {
"strata": {
"elevation-raster": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"terrain_interpretation"
]
},
"mixed": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
},
"synthetic-multispectral": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"raster_classification"
]
},
"synthetic-rgb": {
"case_support": 4,
"failure_count": 5,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"object_detection": {
"case_support": 3,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation",
"object_detection"
]
},
"vector": {
"case_support": 2,
"failure_count": 4,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection",
"vector_comparison"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"source": {
"strata": {
"fixture-contracts": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
},
"fixture-dhmv": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"terrain_interpretation"
]
},
"fixture-grb": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"vector_comparison"
]
},
"fixture-orthophoto": {
"case_support": 3,
"failure_count": 4,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 3,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection"
]
},
"fixture-picc": {
"case_support": 1,
"failure_count": 1,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation"
]
},
"fixture-picc-temporal": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection"
]
},
"fixture-thematic-raster": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"raster_classification"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"urbanity": {
"strata": {
"industrial": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection"
]
},
"mixed": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
},
"rural": {
"case_support": 2,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"footprint_segmentation",
"terrain_interpretation"
]
},
"suburban": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"vector_comparison"
]
},
"urban": {
"case_support": 4,
"failure_count": 6,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 3,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection",
"raster_classification"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
},
"vegetation": {
"strata": {
"low": {
"case_support": 4,
"failure_count": 5,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"change_detection": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"footprint_segmentation": {
"case_support": 1,
"macro": {
"f1": 1.0,
"f1_case_support": 1,
"mean_boundary_f1": 1.0,
"mean_boundary_f1_case_support": 1,
"mean_dice": 0.8881578947368421,
"mean_dice_case_support": 1,
"mean_iou": 0.7988165680473372,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 1.0,
"precision_case_support": 1,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"prediction_count": 1,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.20654931437723745,
"method": "Wilson score interval",
"status": "computed",
"support": 1,
"upper": 1.0
},
"reference_count": 1,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 1,
"references": 1
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 1.0
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"object_detection": {
"case_support": 1,
"macro": {
"f1": null,
"f1_case_support": 0,
"method": "unweighted mean across cases with defined values",
"precision": null,
"precision_case_support": 0,
"recall": null,
"recall_case_support": 0,
"status": "not_evaluable"
},
"micro": {
"ap50": null,
"ap50_95": null,
"calibration": {
"bins": [],
"brier": null,
"ece": null,
"status": "undefined"
},
"f1": null,
"false_discovery_rate": null,
"false_negative": 0,
"false_positive": 0,
"map50": null,
"map50_95": null,
"miss_rate": null,
"per_class_ap": {
"building": {
"ap50": null,
"ap50_95": null,
"prediction_count": 0,
"reference_count": 0
}
},
"precision": null,
"precision_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"prediction_count": 0,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": null,
"recall_ci95_wilson": {
"lower": null,
"status": "undefined",
"support": 0,
"upper": null
},
"reference_count": 0,
"true_positive": 0
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 0,
"predictions": 0,
"ranking_predictions": 0,
"references": 0
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": null
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"vector_comparison": {
"case_support": 1,
"macro": {
"f1": 0.5,
"f1_case_support": 1,
"mean_iou": 1.0,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.5,
"precision_case_support": 1,
"recall": 0.5,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"f1": 0.5,
"false_discovery_rate": 0.5,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.5,
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"prediction_count": 2,
"recall": 0.5,
"recall_ci95_wilson": {
"lower": 0.09453120573423074,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 0.9054687942657693
},
"reference_count": 2,
"true_positive": 1
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 2,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.5
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"change_detection",
"footprint_segmentation",
"object_detection",
"vector_comparison"
]
},
"mixed": {
"case_support": 1,
"failure_count": 2,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"geospatial_data_validation": {
"case_support": 1,
"macro": {
"blocker_or_critical_miss_count": 1.0,
"blocker_or_critical_miss_count_case_support": 1,
"f1": 0.6666666666666666,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.6666666666666666,
"precision_case_support": 1,
"recall": 0.6666666666666666,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"blocker_or_critical_miss_count": 1,
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"predictions": 3,
"references": 3
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"geospatial_data_validation"
]
},
"moderate": {
"case_support": 4,
"failure_count": 7,
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"task_metrics": {
"object_detection": {
"case_support": 2,
"macro": {
"f1": 0.8,
"f1_case_support": 1,
"method": "unweighted mean across cases with defined values",
"precision": 0.3333333333333333,
"precision_case_support": 2,
"recall": 1.0,
"recall_case_support": 1,
"status": "computed"
},
"micro": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"calibration": {
"binning": "five fixed equal-width bins",
"bins": [
{
"accuracy": null,
"count": 0,
"lower": 0.0,
"mean_confidence": null,
"upper": 0.2
},
{
"accuracy": null,
"count": 0,
"lower": 0.2,
"mean_confidence": null,
"upper": 0.4
},
{
"accuracy": null,
"count": 0,
"lower": 0.4,
"mean_confidence": null,
"upper": 0.6
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.6,
"mean_confidence": 0.6499999999999999,
"upper": 0.8
},
{
"accuracy": 0.5,
"count": 2,
"lower": 0.8,
"mean_confidence": 0.91,
"upper": 1.0
}
],
"brier": 0.3266,
"ece": 0.27999999999999997,
"status": "computed"
},
"f1": 0.6666666666666666,
"false_discovery_rate": 0.5,
"false_negative": 0,
"false_positive": 2,
"map50": 0.6666666666666666,
"map50_95": 0.5838283828382838,
"miss_rate": 0.0,
"per_class_ap": {
"building": {
"ap50": 0.6666666666666666,
"ap50_95": 0.5838283828382838,
"prediction_count": 5,
"reference_count": 2
}
},
"precision": 0.5,
"precision_ci95_wilson": {
"lower": 0.15003898915214947,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 0.8499610108478506
},
"prediction_count": 4,
"ranking_scope": "predictions pooled across cases; class- and sample-aware matching; no averaging of per-case AP",
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.34238022750665303,
"method": "Wilson score interval",
"status": "computed",
"support": 2,
"upper": 1.0
},
"reference_count": 2,
"true_positive": 2
},
"minimum_case_support": 5,
"observation_support": {
"calibration_predictions": 4,
"predictions": 4,
"ranking_predictions": 5,
"references": 2
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.f1",
"value": 0.6666666666666666
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"raster_classification": {
"case_support": 1,
"macro": {
"accuracy": 0.8333333333333334,
"accuracy_case_support": 1,
"macro_f1": 0.8222222222222223,
"macro_f1_case_support": 1,
"mean_iou": 0.7222222222222222,
"mean_iou_case_support": 1,
"method": "unweighted mean across cases with defined values",
"status": "computed"
},
"micro": {
"accuracy": 0.8333333333333334,
"accuracy_ci95_wilson": {
"lower": 0.5519691377470266,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 0.9530348578161463
},
"correct_pixel_count": 10,
"evaluated_reference_pixel_count": 12,
"macro_f1_across_classes": 0.8222222222222223,
"mean_iou": 0.7222222222222222,
"per_class": {
"0": {
"f1": 1.0,
"false_discovery_rate": 0.0,
"false_negative": 0,
"false_positive": 0,
"iou": 1.0,
"miss_rate": 0.0,
"precision": 1.0,
"precision_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"prediction_count": 4,
"recall": 1.0,
"recall_ci95_wilson": {
"lower": 0.5101091635454027,
"method": "Wilson score interval",
"status": "computed",
"support": 4,
"upper": 1.0
},
"reference_count": 4,
"true_positive": 4
},
"1": {
"f1": 0.8000000000000002,
"false_discovery_rate": 0.2,
"false_negative": 1,
"false_positive": 1,
"iou": 0.6666666666666666,
"miss_rate": 0.2,
"precision": 0.8,
"precision_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"prediction_count": 5,
"recall": 0.8,
"recall_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"reference_count": 5,
"true_positive": 4
},
"2": {
"f1": 0.6666666666666666,
"false_discovery_rate": 0.3333333333333333,
"false_negative": 1,
"false_positive": 1,
"iou": 0.5,
"miss_rate": 0.3333333333333333,
"precision": 0.6666666666666666,
"precision_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"prediction_count": 3,
"recall": 0.6666666666666666,
"recall_ci95_wilson": {
"lower": 0.2076596008020477,
"method": "Wilson score interval",
"status": "computed",
"support": 3,
"upper": 0.9385080552796037
},
"reference_count": 3,
"true_positive": 2
}
},
"prediction_coverage": 1.0,
"prediction_coverage_ci95_wilson": {
"lower": 0.7575059933447592,
"method": "Wilson score interval",
"status": "computed",
"support": 12,
"upper": 1.0
},
"prediction_present_pixel_count": 12
},
"minimum_case_support": 5,
"observation_support": {
"evaluated_pixels": 12
},
"primary_metric": {
"direction": "higher_is_better",
"name": "micro.mean_iou",
"value": 0.7222222222222222
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
},
"terrain_interpretation": {
"case_support": 1,
"macro": {
"bias": 0.02499999999999991,
"bias_case_support": 1,
"coverage": 0.8,
"coverage_case_support": 1,
"mae": 0.2749999999999999,
"mae_case_support": 1,
"method": "unweighted mean across cases with defined values",
"rmse": 0.2872281323269015,
"rmse_case_support": 1,
"status": "computed"
},
"micro": {
"bias": 0.02499999999999991,
"coverage": 0.8,
"coverage_ci95_wilson": {
"lower": 0.37553462976252533,
"method": "Wilson score interval",
"status": "computed",
"support": 5,
"upper": 0.9637758913675698
},
"evaluated_count": 4,
"mae": 0.2749999999999999,
"reference_count": 5,
"rmse": 0.2872281323269015,
"status": "computed",
"units": "m_TAW"
},
"minimum_case_support": 5,
"observation_support": {
"evaluated": 4,
"references": 5
},
"primary_metric": {
"direction": "lower_is_better",
"name": "micro.rmse",
"value": 0.2872281323269015
},
"release_gate_reason": "insufficient_support",
"release_gate_status": "not_evaluable",
"status": "insufficient_support"
}
},
"tasks": [
"object_detection",
"raster_classification",
"terrain_interpretation"
]
}
},
"worst_stratum_by_task": {
"change_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"footprint_segmentation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"geospatial_data_validation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"object_detection": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"raster_classification": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"terrain_interpretation": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
},
"vector_comparison": {
"reason": "no stratum meets minimum support with a defined primary metric",
"status": "not_evaluable"
}
}
}
},
"minimum_case_support": 5,
"overall_status": "not_evaluable",
"schema_version": 2,
"support_unit": "independent benchmark cases; pixel/object counts are reported separately and do not replace case support"
},
"task_count": 7,
"task_inventory": [
{
"capability_id": "model_object_detection",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "synthetic_contract_case_only",
"implementation_kind": "model_inference_pipeline",
"implementation_paths": [
"backend/app/services/detection_service.py"
],
"suitable_metrics": [
"precision",
"recall",
"F1",
"AP50",
"AP50-95",
"IoU",
"ECE",
"Brier",
"coverage-risk"
],
"task": "object_detection"
},
{
"capability_id": "building_proposal_filtering",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "not_separately_benchmarked",
"implementation_kind": "supporting_candidate_classifier",
"implementation_paths": [
"scripts/train_building_proposal_classifier.py",
"scripts/evaluate_belgium_building_candidate.py"
],
"suitable_metrics": [
"candidate precision",
"candidate recall",
"F1",
"calibration"
],
"task": "object_detection"
},
{
"capability_id": "footprint_segmentation",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "synthetic_contract_case_only",
"implementation_kind": "model_inference_pipeline",
"implementation_paths": [
"backend/app/services/segmentation_service.py",
"backend/app/services/segmentation_adapter.py"
],
"suitable_metrics": [
"object precision",
"object recall",
"F1",
"IoU",
"Dice",
"boundary F1",
"centroid distance",
"area error",
"topology"
],
"task": "footprint_segmentation"
},
{
"capability_id": "detection_and_vector_qa",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "synthetic_contract_case_only",
"implementation_kind": "deterministic_geospatial_comparison",
"implementation_paths": [
"backend/app/services/qa_service.py",
"backend/app/services/detection_qa_service.py",
"backend/app/services/quality_check_service.py"
],
"suitable_metrics": [
"precision",
"recall",
"F1",
"IoU",
"topology",
"coverage"
],
"task": "vector_comparison"
},
{
"capability_id": "vector_clip_buffer_intersect",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "covered_by_family_not_separately_benchmarked",
"implementation_kind": "deterministic_vector_processing",
"implementation_paths": [
"backend/app/services/vector_operations_service.py",
"backend/app/services/vector_feature_service.py"
],
"suitable_metrics": [
"geometry validity",
"CRS correctness",
"area conservation",
"feature counts",
"topology"
],
"task": "vector_comparison"
},
{
"capability_id": "temporal_vector_change",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "synthetic_contract_case_only",
"implementation_kind": "deterministic_change_detection",
"implementation_paths": [
"backend/app/services/change_detection_service.py"
],
"suitable_metrics": [
"event precision",
"event recall",
"event F1",
"IoU"
],
"task": "change_detection"
},
{
"capability_id": "thematic_raster_interpretation",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "synthetic_metric_contract_only_no_generic_learned_classifier_claim",
"implementation_kind": "deterministic_source_interpretation",
"implementation_paths": [
"backend/app/services/thematic_raster_analysis_service.py"
],
"suitable_metrics": [
"pixel accuracy",
"per-class F1",
"per-class IoU",
"mean IoU"
],
"task": "raster_classification"
},
{
"capability_id": "raster_clip_reproject_indices",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "covered_by_family_not_separately_benchmarked",
"implementation_kind": "deterministic_raster_processing",
"implementation_paths": [
"backend/app/services/raster_service.py",
"backend/app/services/raster_operations_service.py"
],
"suitable_metrics": [
"CRS/transform preservation",
"pixel alignment",
"nodata",
"numeric tolerance"
],
"task": "raster_classification"
},
{
"capability_id": "raster_partition_mosaic",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "not_separately_benchmarked",
"implementation_kind": "deterministic_raster_partitioning",
"implementation_paths": [
"backend/app/services/raster_partition_analysis_service.py"
],
"suitable_metrics": [
"seam equality",
"coverage completeness",
"resolution consistency"
],
"task": "raster_classification"
},
{
"capability_id": "terrain_height_interpretation",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "synthetic_contract_case_only",
"implementation_kind": "deterministic_continuous_raster_analysis",
"implementation_paths": [
"backend/app/services/terrain_analysis_service.py",
"backend/app/services/spw_terrain_service.py"
],
"suitable_metrics": [
"MAE",
"RMSE",
"bias",
"coverage",
"unit integrity"
],
"task": "terrain_interpretation"
},
{
"capability_id": "flood_hazard_interpretation",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "covered_by_family_not_separately_benchmarked",
"implementation_kind": "deterministic_scenario_raster_analysis",
"implementation_paths": [
"backend/app/services/flood_hazard_analysis_service.py"
],
"suitable_metrics": [
"depth MAE/RMSE",
"hazard-class IoU",
"coverage",
"scenario identity"
],
"task": "terrain_interpretation"
},
{
"capability_id": "bathymetry_interpretation",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "covered_by_family_not_separately_benchmarked",
"implementation_kind": "deterministic_vertical_reference_analysis",
"implementation_paths": [
"backend/app/services/bathymetry_raster_analysis_service.py",
"backend/app/services/mdk_bathymetry_probe_service.py"
],
"suitable_metrics": [
"MAE",
"RMSE",
"bias",
"coverage",
"vertical-datum integrity"
],
"task": "terrain_interpretation"
},
{
"capability_id": "data_contract_validation_and_scan",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "synthetic_contract_case_only",
"implementation_kind": "deterministic_validation",
"implementation_paths": [
"backend/app/services/data_contract_validation.py",
"scripts/run_accuracy_phase3_full_data_scan.py"
],
"suitable_metrics": [
"anomaly precision",
"anomaly recall",
"anomaly F1",
"critical misses"
],
"task": "geospatial_data_validation"
},
{
"capability_id": "aoi_partition_orchestration",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "not_separately_benchmarked",
"implementation_kind": "deterministic_orchestration",
"implementation_paths": [
"backend/app/services/aoi_operation_service.py",
"backend/app/services/aoi_operation_executor.py",
"backend/app/services/aoi_operation_worker.py"
],
"suitable_metrics": [
"partition completeness",
"overlap/gap",
"idempotency",
"resume correctness"
],
"task": "geospatial_data_validation"
},
{
"capability_id": "geo_assistant_orchestration",
"claim_boundary": "A family mapping is not evidence that this capability has a separate representative product benchmark.",
"evaluation_status": "no_independent_accuracy_score_underlying_tool_results_are_authoritative",
"implementation_kind": "tool_orchestration_interface",
"implementation_paths": [
"backend/app/services/geo_assistant_service.py"
],
"suitable_metrics": [
"tool-selection correctness",
"grounding",
"unsupported-claim rate"
],
"task": "geospatial_data_validation"
}
]
}