make building results authority-first after V74 evaluation
This commit is contained in:
@@ -0,0 +1,71 @@
|
||||
# V74 foutoorzaak en authority-first resultaten
|
||||
|
||||
## Uitkomst
|
||||
|
||||
V74 heeft geen nieuw productiemodel opgeleverd. De actieve checkpoint blijft
|
||||
ongewijzigd omdat zowel de experimentele proposal-filter als twee
|
||||
rehearsal-kandidaten op de bevroren V72-calibratie slechter presteren. GeoIntel
|
||||
presenteert de automatische gebouwanalyse daarom niet langer als één uniforme
|
||||
resultaatlaag: de GRB-vergelijking maakt voortaan zichtbaar welke AI-kandidaten
|
||||
officieel bevestigd zijn, welke alleen modelvoorstellen zijn en welke
|
||||
GRB-gebouwen door AI gemist zijn.
|
||||
|
||||
## Visuele foutanalyse
|
||||
|
||||
De volledige V72-portfolio van 24 onafhankelijke tegels is met het actieve model
|
||||
op confidence 0,30 gerenderd. De contact sheet toont terugkerende foutpositieven
|
||||
op spoorlijnen, voertuigen, bomen, schaduwen en andere contrastrijke structuren.
|
||||
Daarnaast ontbreken veel gebouwen. Dit ondersteunt de conclusie dat extra
|
||||
epochs op alleen de nieuwe Vlaamse shard de hoofdoorzaak niet oplossen.
|
||||
|
||||
De review is AI-assisted en niet menselijk. Het bewijs mag dus geen menselijke
|
||||
acceptatie of promotiegate vervangen.
|
||||
|
||||
## Afgewezen proposal-filter
|
||||
|
||||
Een experimentele ResNet18-filter werd op afzonderlijke V73-AOI's getraind om
|
||||
building proposals van moeilijke negatieve patches te onderscheiden. De interne
|
||||
V73-validatie behaalde F1 0,8068, maar die score generaliseerde niet naar V72.
|
||||
De beste globale V72-combinatie behaalde precision 0,2161, recall 0,2241 en F1
|
||||
0,2200. Het actieve model zonder filter behaalt op confidence 0,30 F1 0,2504.
|
||||
De filter kan precision verhogen bij een vaste detectordrempel, maar halveert
|
||||
dan de recall. Hij blijft daarom experimenteel en wordt niet geladen in
|
||||
productie.
|
||||
|
||||
## Afgewezen rehearsal-training
|
||||
|
||||
De trainingsset combineert 180 historische trainingstegels met de 48 nieuwe
|
||||
V73-tegels, waarbij V73 tweemaal voorkomt. V72 is alleen evaluatie en komt niet
|
||||
in de fitdata voor.
|
||||
|
||||
| Model | Precision | Recall | mAP50 | mAP50-95 | Besluit |
|
||||
|---|---:|---:|---:|---:|---|
|
||||
| Actief | 0,1577 | 0,1178 | 0,0568 | 0,0218 | behouden |
|
||||
| Rehearsal, optimizer auto, 10 epochs | 0,0710 | 0,0776 | 0,0262 | 0,0098 | afgewezen |
|
||||
| Rehearsal, AdamW 0,0001, 6 epochs | 0,0839 | 0,1034 | 0,0349 | 0,0136 | afgewezen |
|
||||
|
||||
De eerste run bracht bovendien een reproduceerbaarheidsfout aan het licht:
|
||||
Ultralytics `optimizer=auto` negeerde de gevraagde learning rate en koos AdamW
|
||||
0,002. De wrapper bindt daarom nu expliciet `optimizer=AdamW` en legt dit vast
|
||||
in het trainingsmanifest. De gecorrigeerde low-learning-rate-run bleef eveneens
|
||||
onder de actieve baseline.
|
||||
|
||||
## Productcorrectheid
|
||||
|
||||
Voor actuele gebouwvalidatie in Vlaanderen is GRB de gezagsbron binnen de
|
||||
beschikbare editie en dekking. De kaartwerkstroom laadt na detectie automatisch
|
||||
het bewaarde QA-bewijs en toont afzonderlijk:
|
||||
|
||||
- GRB-bevestigde AI-kandidaten;
|
||||
- AI-only, onbevestigde onderzoeksvoorstellen;
|
||||
- officiële GRB-gebouwen die het model miste.
|
||||
|
||||
AI-only voorstellen worden niet als officiële gebouwen voorgesteld. Dit maakt
|
||||
de productuitvoer aantoonbaar correcter zonder de zwakke modelscore te verbergen
|
||||
of een niet-bewezen nauwkeurigheidsclaim te maken.
|
||||
|
||||
## Evidence
|
||||
|
||||
Alle ruwe contact sheets, foutmanifesten, filtermatrices, trainingssamenvattingen
|
||||
en modelhashes staan onder
|
||||
`artifacts/evidence/accuracy/model-training/20260810-v74-root-cause/`.
|
||||
Reference in New Issue
Block a user