Files
geointel/backend/app/services/quality_evidence_service.py
T
Codex d22abe8e7b
GeoIntel CI / docs-smoke (push) Canceled after 0s
GeoIntel CI / contract-smoke (push) Canceled after 0s
feat: add measured detection review loop
2026-07-15 03:00:08 +02:00

330 lines
15 KiB
Python

from __future__ import annotations
from typing import Any
from uuid import UUID
from geoalchemy2.shape import to_shape
from shapely.geometry import mapping
from sqlalchemy import or_
from sqlalchemy.orm import Session
from app.core.errors import AppError
from app.models import Detection, DetectionReview, QualityCheck, Segmentation, VectorFeature
class QualityEvidenceService:
@staticmethod
def evidence_geojson(db: Session, *, project_id: UUID, quality_check_id: UUID) -> dict[str, Any]:
quality_check = db.get(QualityCheck, quality_check_id)
if not quality_check or quality_check.project_id != project_id:
raise AppError(code="QUALITY_CHECK_NOT_FOUND", message="Quality check not found", status_code=404)
findings = quality_check.findings_json or {}
features: list[dict[str, Any]] = []
warnings: list[str] = []
candidate_ids, reference_ids = QualityEvidenceService._evidence_identifiers(findings)
candidate_index = QualityEvidenceService._candidate_feature_index(db, quality_check, candidate_ids)
reference_index = QualityEvidenceService._reference_feature_index(db, quality_check, reference_ids)
for evidence in QualityEvidenceService._evidence_items(findings.get("match_evidence")):
candidate_id = QualityEvidenceService._string_value(evidence.get("candidate_feature_id"))
reference_id = QualityEvidenceService._string_value(evidence.get("reference_feature_id"))
iou = evidence.get("iou")
if candidate_id:
row = candidate_index.get(candidate_id)
if row is not None:
features.append(
QualityEvidenceService._row_to_feature(
row,
role="match_candidate",
quality_check=quality_check,
evidence=evidence,
)
)
else:
warnings.append(f"Candidate evidence feature not found: {candidate_id}")
if reference_id:
row = reference_index.get(reference_id)
if row is not None:
features.append(
QualityEvidenceService._row_to_feature(
row,
role="match_reference",
quality_check=quality_check,
evidence={"candidate_feature_id": candidate_id, "reference_feature_id": reference_id, "iou": iou},
)
)
else:
warnings.append(f"Reference evidence feature not found: {reference_id}")
for evidence in QualityEvidenceService._evidence_items(findings.get("false_positive_evidence")):
candidate_id = QualityEvidenceService._string_value(evidence.get("candidate_feature_id"))
if not candidate_id:
continue
row = candidate_index.get(candidate_id)
if row is not None:
features.append(
QualityEvidenceService._row_to_feature(
row,
role="false_positive",
quality_check=quality_check,
evidence=evidence,
)
)
else:
warnings.append(f"False-positive evidence feature not found: {candidate_id}")
for evidence in QualityEvidenceService._evidence_items(findings.get("false_negative_evidence")):
reference_id = QualityEvidenceService._string_value(evidence.get("reference_feature_id"))
if not reference_id:
continue
row = reference_index.get(reference_id)
if row is not None:
features.append(
QualityEvidenceService._row_to_feature(
row,
role="false_negative",
quality_check=quality_check,
evidence=evidence,
)
)
else:
warnings.append(f"False-negative evidence feature not found: {reference_id}")
QualityEvidenceService._annotate_reviews(db, quality_check, features)
return {
"quality_check_id": str(quality_check.id),
"project_id": str(quality_check.project_id),
"candidate_dataset_id": str(quality_check.candidate_dataset_id) if quality_check.candidate_dataset_id else None,
"reference_dataset_id": str(quality_check.reference_dataset_id),
"analysis_run_id": str(quality_check.analysis_run_id) if quality_check.analysis_run_id else None,
"feature_count": len(features),
"warnings": warnings,
"geojson": {
"type": "FeatureCollection",
"features": features,
},
}
@staticmethod
def _evidence_items(value: Any) -> list[dict[str, Any]]:
if not isinstance(value, list):
return []
return [item for item in value if isinstance(item, dict)]
@staticmethod
def _string_value(value: Any) -> str | None:
if value is None:
return None
text = str(value).strip()
return text or None
@staticmethod
def _evidence_identifiers(findings: dict[str, Any]) -> tuple[set[str], set[str]]:
candidate_ids: set[str] = set()
reference_ids: set[str] = set()
for evidence in QualityEvidenceService._evidence_items(findings.get("match_evidence")):
candidate_id = QualityEvidenceService._string_value(evidence.get("candidate_feature_id"))
reference_id = QualityEvidenceService._string_value(evidence.get("reference_feature_id"))
if candidate_id:
candidate_ids.add(candidate_id)
if reference_id:
reference_ids.add(reference_id)
for evidence in QualityEvidenceService._evidence_items(findings.get("false_positive_evidence")):
candidate_id = QualityEvidenceService._string_value(evidence.get("candidate_feature_id"))
if candidate_id:
candidate_ids.add(candidate_id)
for evidence in QualityEvidenceService._evidence_items(findings.get("false_negative_evidence")):
reference_id = QualityEvidenceService._string_value(evidence.get("reference_feature_id"))
if reference_id:
reference_ids.add(reference_id)
return candidate_ids, reference_ids
@staticmethod
def _uuid_identifiers(identifiers: set[str]) -> list[UUID]:
values: list[UUID] = []
for identifier in identifiers:
try:
values.append(UUID(identifier))
except (TypeError, ValueError):
continue
return values
@staticmethod
def _vector_feature_rows(db: Session, dataset_id: UUID, identifiers: set[str]) -> list[VectorFeature]:
if not identifiers:
return []
conditions = [VectorFeature.source_feature_id.in_(identifiers)]
uuid_identifiers = QualityEvidenceService._uuid_identifiers(identifiers)
if uuid_identifiers:
conditions.append(VectorFeature.id.in_(uuid_identifiers))
return (
db.query(VectorFeature)
.filter(VectorFeature.dataset_id == dataset_id, or_(*conditions))
.all()
)
@staticmethod
def _candidate_feature_index(
db: Session,
quality_check: QualityCheck,
identifiers: set[str],
) -> dict[str, Any]:
index: dict[str, Any] = {}
if not identifiers:
return index
uuid_identifiers = QualityEvidenceService._uuid_identifiers(identifiers)
if quality_check.candidate_dataset_id:
for row in QualityEvidenceService._vector_feature_rows(db, quality_check.candidate_dataset_id, identifiers):
QualityEvidenceService._add_index_keys(index, row)
if uuid_identifiers:
for row in db.query(Detection).filter(
Detection.dataset_id == quality_check.candidate_dataset_id,
Detection.id.in_(uuid_identifiers),
).all():
QualityEvidenceService._add_index_keys(index, row)
for row in db.query(Segmentation).filter(
Segmentation.dataset_id == quality_check.candidate_dataset_id,
Segmentation.id.in_(uuid_identifiers),
).all():
QualityEvidenceService._add_index_keys(index, row)
if quality_check.analysis_run_id and uuid_identifiers:
for row in db.query(Detection).filter(
Detection.analysis_run_id == quality_check.analysis_run_id,
Detection.id.in_(uuid_identifiers),
).all():
QualityEvidenceService._add_index_keys(index, row)
for row in db.query(Segmentation).filter(
Segmentation.analysis_run_id == quality_check.analysis_run_id,
Segmentation.id.in_(uuid_identifiers),
).all():
QualityEvidenceService._add_index_keys(index, row)
return index
@staticmethod
def _reference_feature_index(
db: Session,
quality_check: QualityCheck,
identifiers: set[str],
) -> dict[str, Any]:
index: dict[str, Any] = {}
for row in QualityEvidenceService._vector_feature_rows(db, quality_check.reference_dataset_id, identifiers):
QualityEvidenceService._add_index_keys(index, row)
return index
@staticmethod
def _annotate_reviews(
db: Session,
quality_check: QualityCheck,
features: list[dict[str, Any]],
) -> None:
if quality_check.check_type != "detections_vs_reference":
return
reviews = db.query(DetectionReview).filter(DetectionReview.quality_check_id == quality_check.id).all()
review_index = {(row.evidence_role, row.evidence_feature_id): row for row in reviews}
for feature in features:
properties = feature.get("properties")
if not isinstance(properties, dict):
continue
role = QualityEvidenceService._string_value(properties.get("qa_evidence_role"))
if role == "false_positive":
evidence_id = QualityEvidenceService._string_value(properties.get("candidate_feature_id"))
elif role == "false_negative":
evidence_id = QualityEvidenceService._string_value(properties.get("reference_feature_id"))
else:
continue
review = review_index.get((role, evidence_id or ""))
properties.update(
{
"review_decision": review.decision if review else "unreviewed",
"review_notes": review.notes if review else None,
"reviewed_by": review.reviewed_by if review else None,
"reviewed_at": review.updated_at.isoformat() if review and review.updated_at else None,
}
)
@staticmethod
def _add_index_keys(index: dict[str, Any], row: Any) -> None:
for key in QualityEvidenceService._row_identifiers(row):
index.setdefault(key, row)
@staticmethod
def _row_identifiers(row: Any) -> set[str]:
identifiers = {str(row.id)}
source_feature_id = getattr(row, "source_feature_id", None)
if source_feature_id:
identifiers.add(str(source_feature_id))
properties = getattr(row, "properties_json", None) or {}
if isinstance(properties, dict):
for property_key in ("vector_feature_id", "source_feature_id", "detection_id", "segmentation_id", "id", "name"):
value = properties.get(property_key)
if value is not None:
identifiers.add(str(value))
return identifiers
@staticmethod
def _row_to_feature(row: Any, *, role: str, quality_check: QualityCheck, evidence: dict[str, Any]) -> dict[str, Any]:
try:
geometry = to_shape(row.geometry)
except Exception as exc:
raise AppError(
code="INVALID_QA_EVIDENCE_GEOMETRY",
message="Persisted QA evidence geometry could not be converted to GeoJSON",
details={"feature_id": str(getattr(row, "id", ""))},
status_code=500,
) from exc
properties = dict(getattr(row, "properties_json", None) or {})
properties.update(
{
"qa_evidence_role": role,
"quality_check_id": str(quality_check.id),
"project_id": str(quality_check.project_id),
"candidate_dataset_id": str(quality_check.candidate_dataset_id) if quality_check.candidate_dataset_id else None,
"reference_dataset_id": str(quality_check.reference_dataset_id),
"analysis_run_id": str(quality_check.analysis_run_id) if quality_check.analysis_run_id else None,
"feature_id": str(row.id),
"dataset_id": str(getattr(row, "dataset_id", "")) if getattr(row, "dataset_id", None) else None,
"source_feature_id": getattr(row, "source_feature_id", None),
"feature_class": getattr(row, "feature_class", None) or getattr(row, "class_name", None),
"candidate_feature_id": QualityEvidenceService._string_value(evidence.get("candidate_feature_id")),
"reference_feature_id": QualityEvidenceService._string_value(evidence.get("reference_feature_id")),
"iou": evidence.get("iou"),
}
)
properties.update(QualityEvidenceService._row_provenance(row))
return {
"type": "Feature",
"id": f"{role}:{row.id}",
"geometry": mapping(geometry),
"properties": properties,
}
@staticmethod
def _row_provenance(row: Any) -> dict[str, Any]:
if isinstance(row, Detection):
return {
"detection_id": str(row.id),
"job_id": str(row.job_id) if row.job_id else None,
"confidence": row.confidence,
"model_name": row.model_name,
"model_version": row.model_version,
"source_tile_path": row.source_tile_path,
"bbox_json": row.bbox_json,
}
if isinstance(row, Segmentation):
return {
"segmentation_id": str(row.id),
"job_id": str(row.job_id) if row.job_id else None,
"confidence": row.confidence,
"model_name": row.model_name,
"model_version": row.model_version,
"source_tile_path": row.source_tile_path,
"bbox_json": row.bbox_json,
"mask_path": row.mask_path,
"area_m2": row.area_m2,
}
return {}