Hervatbare Landendata-Cleaner met De-duplicatie

Datacleaning-pijplijn met strikte landvalidatie en hervattingsmogelijkheden

Hervatbare Landendata-Cleaner met De-duplicatie image 1

Dit project biedt een robuuste CSV-cleaning pijplijn die landvelden normaliseert en valideert, met ingebouwde strikte de-duplicatie. Het systeem is geoptimaliseerd voor grootschalige datasets waar betrouwbaarheid en hervatbaarheid essentieel zijn.

Belangrijkste functies:

  • Pass 1: Analyseert inputdata, detecteert ongeldige of niet-canonieke landnamen, en exporteert deze voor controle.

    • De-dupliqueert op id tegen eerdere runs én binnen dezelfde sessie.

    • Logt duidelijke redenen voor ongeldig verklaarde entries.

  • Pass 2: Probeert ongeldige landen automatisch te corrigeren via reverse-geocoding (Nominatim/OSM).

    • Zorgt voor directe de-duplicatie in de output.

    • Past canonieke land- en regiobenamingen toe waar beschikbaar.

  • Pass 3 (optioneel): Genereert een volledig opgeschoond CSV-bestand met consistente landen, gevalideerde regio’s en alle correcties.

  • Hervatbaarheid: Kan veilig opnieuw gestart worden zonder voortgang te verliezen.

  • Strictheid-opties: Handhaaf ISO-regio’s (--strict-region) of sta conservatieve typefouten toe (--allow-fuzzy).

Deze cleaner garandeert een betrouwbare, gededupliceerde dataset, zelfs bij miljoenen records.

Ook een idee dat moet gaan werken?

Bespreek de volgende praktische stap met De Wilde ICT Solutions.

Neem contact op