Terug naar Blog

AI Strategie

Je data op orde krijgen voor AI: de stap die iedereen overslaat

AI is zo goed als de data die je erin stopt. Ontdek waarom rommelige data het sluipende gevaar van AI-projecten is, en hoe je data op orde krijgt voor AI.

AI WorkTalent Redactie · · 9 min leestijd

Je data op orde krijgen voor AI: de stap die iedereen overslaat

Data op orde krijgen voor AI is de stap die de meeste bedrijven overslaan — en precies daarom stranden AI-projecten vaker op de data eronder dan op de AI zelf. Die data is dan rommelig: verspreid over vijf systemen, half ingevuld, verouderd. AI is een versterker. Stop je er goede data in, dan krijg je goede resultaten. Stop je er rommel in, dan krijg je overtuigend klinkende rommel.

Waarom data het sluipende gevaar is

Het is verleidelijk om te denken dat AI de rommel wel oplost. Het tegenovergestelde is waar: AI maakt de gevolgen van rommelige data zichtbaarder en sneller. Een medewerker die een inconsistente factuur ziet, denkt "gek, ik pas het even aan". Een AI verwerkt hem fout en gaat door, honderd keer, voor je het merkt.

"Rommelige data" klinkt abstract, maar op de werkvloer van een mkb-bedrijf is het heel herkenbaar. Dit is wat het in de praktijk betekent, en wat het een AI aandoet:

Wat je herkent Gevolg voor de AI
Dubbele klantrecords: dezelfde klant staat in het CRM, de boekhouding en een Excel-bestand, telkens net anders gespeld De AI weet niet welke versie klopt, splitst één klant in meerdere, of mixt gegevens door elkaar
Inconsistente schrijfwijzen: datums als "3-1-2026" naast "1 maart 2026", bedragen met en zonder btw, namen met en zonder tussenvoegsel Het systeem herkent varianten niet als hetzelfde en telt, sorteert of koppelt verkeerd
Lege of half ingevulde velden, of een "n.v.t." waar een getal hoort te staan De AI vult de leegte op met een aanname — en aannames zijn precies waar het misgaat
Data verspreid over Excel, CRM en mailbox: de ene helft van het klantdossier staat in het systeem, de andere helft in een oude e-mailwisseling De AI ziet maar een deel van de waarheid, of iemand moet handmatig blijven aanvullen — waarmee het automatiseringsvoordeel verdwijnt
Verouderde gegevens: prijslijsten, contracten of productinfo van jaren terug die niemand heeft opgeschoond De AI geeft antwoorden die ooit klopten, met evenveel overtuiging als antwoorden die nu nog kloppen

Een voorbeeld: drie systemen, één klant, te veel versies

Ter illustratie van hoe dit in de praktijk uitpakt: een bedrijf wil een AI inzetten om klantvragen te beantwoorden op basis van gegevens uit de webshop, het CRM en de facturatie. Drie systemen leggen dezelfde klant vast, en elk doet dat op zijn eigen manier. Het ene systeem gebruikt een andere spelling van de bedrijfsnaam, het andere nog het oude factuuradres in plaats van het nieuwe, en in het derde staat een contactpersoon die allang niet meer bij het bedrijf werkt.

Zet je de AI meteen los op die drie bronnen, dan gaat het mis: hij beantwoordt de vraag van klant A misschien met de factuurgeschiedenis van wat eigenlijk klant B blijkt te zijn. Dat gebeurt omdat beide records net iets anders zijn gespeld, waardoor het systeem ze niet als dezelfde klant herkent. Pas als je de dubbelingen samenvoegt en vastlegt welk systeem voor welk gegeven leidend is, kan de AI er betrouwbaar mee werken. Dat opruimwerk voelt als vertraging, maar is in de praktijk vaak het grootste deel van het project — en de reden dat het daarna wél goed werkt.

Zet je zo'n AI in om rechtstreeks met klanten te praten, dan geldt er nog een verplichting. Vanaf 2 augustus 2026 schrijft artikel 50 van de AI-verordening voor dat de mensen met wie het systeem praat, moeten weten dat ze met AI communiceren. Dat hoeft niet als het al vanzelf duidelijk is uit de context. Dat staat los van hoe schoon je data is, maar hoort bij hetzelfde project.

Goed genoeg, niet perfect

Nu de valkuil aan de andere kant. "Eerst alle data op orde" is een project dat nooit afkomt, en dus vooral een excuus om nooit te beginnen. Je data hoeft niet perfect te zijn — die moet goed genoeg zijn voor de ene taak die je automatiseert.

Zo bepaal je wanneer dat zo is: zodra je in één zin kunt benoemen welke velden en records je toepassing nodig heeft. Voldoen die aan de eisen uit de checklist hieronder? Dan ben je klaar om te bouwen. De rest van je administratie — oude dossiers, ongebruikte velden, de andere helft van je CRM — mag rommelig blijven tot je eraan toe komt. Dat is geen compromis. Het is een bevrijdend inzicht: je hoeft niet al je data op orde te hebben, alleen de data die je gekozen toepassing nodig heeft.

Automatiseer je de verwerking van één type factuur, dan hoef je alleen dat type consistent te hebben, niet je hele administratie. Dat sluit aan bij het stappenplan voor AI in het mkb: klein beginnen beperkt niet alleen het risico, maar ook het datawerk. En voordat je de knoop doorhakt of de investering de moeite waard is, helpt het om de ROI van AI te berekenen. Reken de tijd die opschonen kost daarin gewoon mee.

En je documenten dan? Ongestructureerde data telt net zo goed mee

Alles hierboven ging over records en velden in systemen: een CRM, een Excel-bestand, de facturatie. Maar een van de meest voorkomende eerste AI-toepassingen bij het mkb is een andere: een AI die vragen beantwoordt op basis van je eigen documenten — handleidingen, contracten, e-mails, PDF's met productinformatie. Die ongestructureerde data stelt andere eisen dan een nette tabel met velden.

Waar je bij records vooral let op consistente formaten, let je bij documenten vooral op actualiteit en versiebeheer. Staan de oude en de nieuwe versie van een handleiding allebei in dezelfde map, dan weet de AI niet welke hij moet gebruiken en citeert hij zonder waarschuwing de verouderde. Hetzelfde gevaar geldt voor een prijslijst die drie keer is bijgewerkt maar waarvan alle versies nog rondslingeren, of een contract waarvan de conceptversie naast de getekende versie staat. Ruim dubbele en verouderde documenten op vóór je ze aan een AI voedt, en spreek af waar de actuele versie voortaan staat — anders herhaalt zich het probleem van rommelige records, nu met bestanden in plaats van velden.

De checklist: data op orde voor AI, van rommelig naar goed genoeg

Dit gaat over de kwaliteit van wat er in je systemen staat, niet over hoe je die systemen straks technisch aan elkaar knoopt — dat is een aparte technische uitdaging met eigen keuzes. Onderstaande stappen zijn de datakant: per stap wat je doet, en wanneer je verder mag met bouwen in plaats van eindeloos door te poetsen.

Stap Wat je doet Wanneer het goed genoeg is
Bepaal de afbakening Leg vast welke data deze ene toepassing precies raakt — niet "alles", maar dit specifieke proces Je kunt in één zin zeggen welke gegevens de AI wel en niet nodig heeft
Kies de bron van waarheid Staat dezelfde informatie op meerdere plekken (CRM, Excel, mailbox)? Bepaal welke leidend is en laat de AI daaruit putten Er is één plek waar het juiste antwoord vandaan komt, niet drie die elkaar tegenspreken
Maak de formaten consistent Datums, bedragen, namen en categorieën in één vaste schrijfwijze Een steekproef van tien records laat geen afwijkende varianten meer zien
Ruim de ergste gaten op Vul of verwijder de ontbrekende gegevens waar de AI anders naar zou moeten gokken De velden die de taak echt nodig heeft zijn compleet — de rest mag leeg blijven
Toets wat je nog mag bewaren Controleer bewaartermijn en dataminimalisatie: mag dit nog bestaan, en heb je het nodig voor deze taak? Je hebt bewust "nee" gezegd tegen gegevens die alleen risico toevoegen
Toets na de eerste testversie of het ook klopt Laat de AI twintig echte vragen beantwoorden zoals een klant of collega ze zou stellen, en controleer de antwoorden handmatig De antwoorden kloppen inhoudelijk — een steekproef op formaten alleen bewijst dat nog niet
Spreek het onderhoud af Bepaal hoe nieuwe data er straks consistent bij komt, en wie daarvoor verantwoordelijk is Er ligt een afspraak (of een geautomatiseerde controle), geen losse belofte

Die laatste stap sla je het snelst over, en het is precies waar rommel meestal weer terugkomt. Spreek je niet af hoe nieuwe data binnenkomt, dan is de basis over een half jaar weer net zo rommelig als toen je begon. Voor dat soort terugkerend opschoon- en invoerwerk werkt automatisering van je werkprocessen vaak beter dan er iedere maand handmatig doorheen fietsen — zie bijvoorbeeld wat n8n als automatiseringstool voor je kan doen. En twijfel je of je dit zelf oppakt of uitbesteedt: die afweging geldt voor data-opschoning net zo goed als voor de AI zelf.

De AVG-kant van je data

Je data klaarmaken voor AI raakt onvermijdelijk aan de AVG, want een groot deel van je bedrijfsdata bestaat uit persoonsgegevens. Opschonen is daarom niet alleen een technische exercitie, maar ook het moment om te toetsen wat je eigenlijk nog mág bewaren en gebruiken.

Vier AVG-beginselen zijn hier direct relevant:

  • Dataminimalisatie: verzamel en bewaar niet meer dan nodig voor het doel waarvoor je de gegevens gebruikt.
  • Opslagbeperking (de bewaartermijn): persoonsgegevens mogen niet langer identificeerbaar bewaard blijven dan nodig is.
  • Juistheid (artikel 5 lid 1 onder d AVG): persoonsgegevens moeten kloppen en waar nodig geactualiseerd worden. Dit is precies het beginsel dat dit hele artikel onderbouwt — verouderde of foute gegevens zijn niet alleen slecht voor je AI, ze zijn ook een AVG-overtreding.
  • Doelbinding (artikel 5 lid 1 onder b AVG): je verzamelt gegevens voor een concreet, vooraf bepaald doel en gebruikt ze niet zomaar voor iets anders. Hier lopen veel mkb'ers op stuk: klantgegevens die je vastlegde voor orderafhandeling, wil je nu misschien hergebruiken om een AI mee te voeden. Dat is een nieuw doel. Berust dat niet op toestemming of op een wettelijke bepaling, dan moet het eerst de verenigbaarheidstoets van artikel 6 lid 4 AVG doorstaan.

Een opschoonactie die dubbele klantrecords samenvoegt, verouderde dossiers verwijdert en foutieve gegevens corrigeert, is dus vaak tegelijk een AVG-opruiming — je verwijdert data die je toch al niet meer had mogen bewaren, en je corrigeert wat je toch al had moeten corrigeren. Let daarnaast op waar de AI die data verwerkt: bij een aanbieder buiten de EU kan die data buiten de EU worden verwerkt. De Autoriteit Persoonsgegevens heeft een stappenplan speciaal voor ondernemers en het mkb; zie ook wat de AVG concreet van je vraagt.

AI is zo goed als de data eronder. Breng de gegevens voor je eerste toepassing op orde — goed genoeg, niet perfect — en je vergroot de kans op succes meer dan met welke modelkeuze dan ook. Twijfel je of je dit zelf aanpakt of er een specialist bij haalt? Lees waar je op let bij het inhuren van een AI-expert. Op AI WorkTalent vind je specialisten die zowel de data als de AI aanpakken.

Dit artikel geeft een algemene aanpak; de data-eisen verschillen per toepassing. De AVG-passages zijn gebaseerd op de beginselen van dataminimalisatie, opslagbeperking, juistheid en doelbinding uit de AVG; dit is geen juridisch advies.