72 lines
3.2 KiB
Markdown
72 lines
3.2 KiB
Markdown
# V74 foutoorzaak en authority-first resultaten
|
|
|
|
## Uitkomst
|
|
|
|
V74 heeft geen nieuw productiemodel opgeleverd. De actieve checkpoint blijft
|
|
ongewijzigd omdat zowel de experimentele proposal-filter als twee
|
|
rehearsal-kandidaten op de bevroren V72-calibratie slechter presteren. GeoIntel
|
|
presenteert de automatische gebouwanalyse daarom niet langer als één uniforme
|
|
resultaatlaag: de GRB-vergelijking maakt voortaan zichtbaar welke AI-kandidaten
|
|
officieel bevestigd zijn, welke alleen modelvoorstellen zijn en welke
|
|
GRB-gebouwen door AI gemist zijn.
|
|
|
|
## Visuele foutanalyse
|
|
|
|
De volledige V72-portfolio van 24 onafhankelijke tegels is met het actieve model
|
|
op confidence 0,30 gerenderd. De contact sheet toont terugkerende foutpositieven
|
|
op spoorlijnen, voertuigen, bomen, schaduwen en andere contrastrijke structuren.
|
|
Daarnaast ontbreken veel gebouwen. Dit ondersteunt de conclusie dat extra
|
|
epochs op alleen de nieuwe Vlaamse shard de hoofdoorzaak niet oplossen.
|
|
|
|
De review is AI-assisted en niet menselijk. Het bewijs mag dus geen menselijke
|
|
acceptatie of promotiegate vervangen.
|
|
|
|
## Afgewezen proposal-filter
|
|
|
|
Een experimentele ResNet18-filter werd op afzonderlijke V73-AOI's getraind om
|
|
building proposals van moeilijke negatieve patches te onderscheiden. De interne
|
|
V73-validatie behaalde F1 0,8068, maar die score generaliseerde niet naar V72.
|
|
De beste globale V72-combinatie behaalde precision 0,2161, recall 0,2241 en F1
|
|
0,2200. Het actieve model zonder filter behaalt op confidence 0,30 F1 0,2504.
|
|
De filter kan precision verhogen bij een vaste detectordrempel, maar halveert
|
|
dan de recall. Hij blijft daarom experimenteel en wordt niet geladen in
|
|
productie.
|
|
|
|
## Afgewezen rehearsal-training
|
|
|
|
De trainingsset combineert 180 historische trainingstegels met de 48 nieuwe
|
|
V73-tegels, waarbij V73 tweemaal voorkomt. V72 is alleen evaluatie en komt niet
|
|
in de fitdata voor.
|
|
|
|
| Model | Precision | Recall | mAP50 | mAP50-95 | Besluit |
|
|
|---|---:|---:|---:|---:|---|
|
|
| Actief | 0,1577 | 0,1178 | 0,0568 | 0,0218 | behouden |
|
|
| Rehearsal, optimizer auto, 10 epochs | 0,0710 | 0,0776 | 0,0262 | 0,0098 | afgewezen |
|
|
| Rehearsal, AdamW 0,0001, 6 epochs | 0,0839 | 0,1034 | 0,0349 | 0,0136 | afgewezen |
|
|
|
|
De eerste run bracht bovendien een reproduceerbaarheidsfout aan het licht:
|
|
Ultralytics `optimizer=auto` negeerde de gevraagde learning rate en koos AdamW
|
|
0,002. De wrapper bindt daarom nu expliciet `optimizer=AdamW` en legt dit vast
|
|
in het trainingsmanifest. De gecorrigeerde low-learning-rate-run bleef eveneens
|
|
onder de actieve baseline.
|
|
|
|
## Productcorrectheid
|
|
|
|
Voor actuele gebouwvalidatie in Vlaanderen is GRB de gezagsbron binnen de
|
|
beschikbare editie en dekking. De kaartwerkstroom laadt na detectie automatisch
|
|
het bewaarde QA-bewijs en toont afzonderlijk:
|
|
|
|
- GRB-bevestigde AI-kandidaten;
|
|
- AI-only, onbevestigde onderzoeksvoorstellen;
|
|
- officiële GRB-gebouwen die het model miste.
|
|
|
|
AI-only voorstellen worden niet als officiële gebouwen voorgesteld. Dit maakt
|
|
de productuitvoer aantoonbaar correcter zonder de zwakke modelscore te verbergen
|
|
of een niet-bewezen nauwkeurigheidsclaim te maken.
|
|
|
|
## Evidence
|
|
|
|
Alle ruwe contact sheets, foutmanifesten, filtermatrices, trainingssamenvattingen
|
|
en modelhashes staan onder
|
|
`artifacts/evidence/accuracy/model-training/20260810-v74-root-cause/`.
|