Jullie IT- of datateam heeft validatie ingericht, maar toch klopt de masterdata niet. Dat ligt zelden aan de pipeline.
Een ETL-proces is het mechanisme dat data ophaalt, valideert en doorzet. Masterdata is het resultaat: één gevalideerde set die je andere systemen voedt.
Die set wordt pas continu betrouwbaar onder twee voorwaarden: de validatie moet terugmelden aan de bron en de cyclus moet vaak genoeg draaien.
Hieronder staat wat dat betekent, met cijfers uit ons ETL-project bij AkzoNobel.
In dit artikel
- Wat masterdata is en wat een ETL proces daarin doet
- Voorwaarde 1: validatie die terugmeldt aan de bron
- Voorwaarde 2: een cyclus die snel genoeg draait
- Audit en ETL: één aantoonbare bron
- Veelgestelde vragen
Wat masterdata is en wat een ETL proces daarin doet
Masterdata is de gedeelde brondata die overal in je organisatie terugkomt: producten, klanten, locaties en leveranciers. DAMA International behandelt master data management (MDM) in de DMBOK als een eigen kennisgebied, met als doel één gezaghebbende bron voor die kerngegevens.
Extract-Transform-Load (ETL) werkt echter anders. Het ETL-proces is het mechanisme dat masterdata oplevert. Extract haalt de data op uit bronsystemen. Transform schoont het op en harmoniseert. Load zet de data vervolgens door.
Dus twee dingen om te onthouden. Een ETL-proces verzamelt data uit bronsystemen. Masterdata vormt de bron van waarheid voor de systemen die daarmee werken. Het eerste is een proces, het tweede een dataset.
Voorwaarde 1: validatie die terugmeldt aan de bron
Strenger valideren maakt je brondata niet beter. Want zolang niemand fouten of slordigheden in het bronsysteem corrigeert, zie je ze bij de volgende run gewoon terugkomen.
Dat ga je tegen met een controlerapport. Bij AkzoNobel bouwden we een regelengine die elk record toetst op volledigheid en consistentie. Records die zakken voor de validatie, worden gesignaleerd in een rapport. Daarin staan het specifieke veld en de oorzaak genoemd, zodat de beheerder de fout gericht kan herstellen. Dus een regelengine valideert records op volledigheid en consistentie, maar een controlerapport meldt afwijkingen terug aan de databeheerder.
In de QA kennen we dit als de 1-10-100-regel, in 1992 opgesteld door Labovitz en Chang: het voorkomen van een fout kost wat, maar het corrigeren van een fout kost je 10x meer en zelfs 100x meer als de fout de eindgebruiker bereikt. De verhouding is wel een vuistregel, geen harde meetwaarde.
Benieuwd hoe ETL bij AkzoNobel werkt? Lees de casestudy.
Voorwaarde 2: een cyclus die snel genoeg draait
Bronsystemen verversen op hun eigen tempo. Productsystemen, kleursystemen en SAP: allemaal in een ander tempo en met veel handmatige invoer. Gartner noemt inconsistentie tussen bronnen het lastigste datakwaliteitsprobleem en schat de gemiddelde jaarlijkse schade door slechte datakwaliteit op 12,9 miljoen dollar. Dat cijfer komt uit een enquête onder 154 referentieklanten die zelf al datakwaliteitssoftware kochten, dus lees het als een orde van grootte.
Bij AkzoNobel werken we met meer dan 200 miljoen kleur- en productcombinaties. De oude systemen deden er ongeveer 24 uur over om die informatie op te halen. De volledige cyclus die wij bouwden draait in 2 uur.
Een cyclus die 12 keer sneller werkt, klinkt fantastisch maar betekent nog niet dat je brondata 100% correct is. Zonder terugkoppeling levert een snellere run alleen maar sneller dezelfde fouten op. Frequentie en correctheid zijn en blijven twee losse voorwaarden.
Benieuwd hoe ETL bij AkzoNobel werkt? Lees de casestudy.
Audit en ETL: één aantoonbare bron
Gevalideerde masterdata levert pas iets op als je afnemers het ook echt gebruiken. Bij AkzoNobel gaat de dataset via gedocumenteerde API's naar webshops, dashboards en externe partijen. Iedereen leest uit dezelfde bron. Een API-koppeling ontsluit de masterdata voor de ontvangende systemen.
Het tweede deel is de audit trail. Elke wijziging is herleidbaar: herkomst, tijdstip en reden van afkeuring. Een audit trail legt de herkomst en wijzigingen van elk record vast. Want de AVG eist in artikel 5 dat persoonsgegevens juist zijn en zo nodig geactualiseerd worden, en legt in lid 2 de verantwoordingsplicht bij de verwerkingsverantwoordelijke. Kunnen aantonen is een eis waar AkzoNobel wettelijk aan moet voldoen; het is dus geen extraatje.
Veelgestelde vragen
Is een ETL-proces hetzelfde als master data management?
Nee. Een ETL-proces is het mechanisme dat data ophaalt, valideert en doorzet. Master data management is de discipline die bepaalt welke gegevens gezaghebbend zijn en wie ze beheert.
Waarom blijft onze masterdata foutief ondanks validatie?
Waarschijnlijk omdat de validatie foute records tegenhoudt zonder terug te melden waar de fout vandaan komt. De bron blijft ongewijzigd, dus de fout komt bij elke run terug.
Hoe vaak moet een ETL-cyclus draaien?
Zo vaak als je afnemers actuele data nodig hebben. Wij draaien eventgedreven waar het kan en in batch waar het moet. Bij AkzoNobel ging de volledige cyclus van ongeveer 24 uur naar 2 uur.
Kort samengevat
Continu betrouwbare masterdata vraagt om twee dingen tegelijk: validatie die terugmeldt naar de bron en een cyclus die snel genoeg draait. Eén zonder de ander levert of verouderde data die klopt, of actuele data die niet correct is.



![Nor & Th[is]](/_next/image?url=%2Fcms-assets%2F6c9b088a-c2aa-4802-bd0e-06807ec2a00f%2Fimage.png&w=1200&q=85)

