BLOG/OPINIE – In veel organisaties leeft nog altijd de hardnekkige misvatting dat ai een oplossing is die je zomaar op elk bedrijfsprobleem kunt loslaten. Alsof technologie op zichzelf volstaat. In werkelijkheid hangt het succes van ai al decennialang af van één essentiële bouwsteen: data. En die data moeten eerst geschikt zijn voor het doel waarvoor je ai wil inzetten.
Net zoals een kleerkast of opbergruimte af en toe een grote schoonmaak nodig heeft, moeten we ook bedrijfsdata regelmatig onder handen nemen. Anders verliezen organisaties het overzicht en leveren ai-modellen niet langer de gewenste resultaten op. De term ‘ai-ready data’ klinkt misschien nieuw, maar het principe bestaat al veel langer. Denk aan de bekende 80-20-regel: 80% van het werk gaat naar het voorbereiden van data, terwijl slechts 20% draait om het effectieve gebruik ervan.
Goede data blijft de belangrijkste voorwaarde om ai-systemen succesvol te implementeren. Hoe je data ai-ready maakt, hangt sterk af van het type ai-model dat je wil gebruiken. Forecasting vraagt andere data dan een large language model (llm). Traditionele tekstanalyse vertrekt vanuit andere gegevens dan predictieve ai-modellen. Alles begint dus bij de vraag welk probleem je met ai wil oplossen. Die vraag bepaalt welke data relevant is en hoe je die moet voorbereiden, en laat die voorbereidingsoefening allesbehalve eenvoudig zijn.
Daarbij springen twee uitdagingen in het oog.
1. Integratie van databronnen
Aan data is meestal geen gebrek. In de meeste organisaties is beschikbaarheid niet het grootste probleem: bijna elk proces is in zekere mate gedigitaliseerd en genereert dus gegevens. De echte uitdaging ligt in het samenbrengen van al die verschillende databronnen.
Zo worden bijvoorbeeld klanteninformatie en aankoopgegevens vaak in verschillende systemen bijgehouden. Die bronnen moeten eerst met elkaar verbonden worden voordat een AI-systeem er betrouwbare inzichten uit kan halen.
Dat klinkt eenvoudiger dan het is. Integraties gebeuren niet automatisch. Ai-tools kunnen het proces weliswaar versnellen, maar iemand moet nog altijd de juiste koppelingen voorzien en controleren. Die stap is cruciaal: alleen met een volledig klantbeeld kan een ai-model betrouwbare en strategisch waardevolle patronen herkennen.
2. Representatieve en realiteitsgetrouwe data
Een tweede uitdaging raakt aan de betrouwbaarheid van een ai-model. Daarvoor moeten organisaties kunnen aantonen dat er voldoende gegevens beschikbaar zijn en dat die data een correcte weerspiegeling vormen van de werkelijkheid. Een AI-model leert immers uit historische voorbeelden. Voor situaties die vaak voorkomen, zijn meestal voldoende gegevens beschikbaar om betrouwbare patronen te herkennen. Maar voor zeldzame gebeurtenissen of uitzonderlijke gevallen is dat veel moeilijker. Daardoor loopt een model het risico om minder nauwkeurige voorspellingen of beslissingen te nemen net op de momenten waarop de impact het grootst kan zijn.
Wanneer bepaalde groepen, gedragingen of situaties in datasets ondervertegenwoordigd zijn, ontstaat het risico dat AI ze over het hoofd ziet of patronen herkent die geen correcte weergave van de realiteit zijn. Een veel besproken en berucht voorbeeld zijn beeldherkenningsalgoritmes die minder goed presteren in een niet-Westerse context. Hetzelfde probleem doet zich voor bij gezichtsherkenning, waar de nauwkeurigheid voor personen met een donkere huidskleur vaak lager ligt.
Ook uitschieters en ontbrekende waarden kunnen modellen vertekenen. Een eenmalige piek in de verkoop tijdens de coronapandemie, een uitzonderlijk grote bestelling van één klant of een foutieve registratie in de data, kan data uit balans brengen. Omgekeerd kan essentiële informatie ontbreken, zoals de leeftijd van een klant. Daarnaast moeten data vaak gelabeld worden voor een specifieke AI-toepassing, bijvoorbeeld door klanten te classificeren op basis van hun loyaliteit.
Het zijn stuk voor stuk uitdagingen die opgelost moeten worden voordat data echt klaar is voor ai. Het werk van data engineers is daarbij moeilijk te overschatten. Zij leggen de fundering waarop data scientists en ai-teams verder bouwen. Maar zelfs wanneer data technisch klaarstaat, betekent dat nog niet dat ze automatisch geschikt is voor elk ai-gebruik.
Van statistiek tot privacy: extra drempels voor ai
Naast integratie en representativiteit spelen ook statistische en juridische factoren mee. Denk aan kardinaliteit: een veld met heel veel verschillende waarden kan het voor ai moeilijker maken om patronen te herkennen. België telt bijvoorbeeld duizenden postcodes, wat in sommige modellen voor extra complexiteit zorgt.
Daarnaast blijft privacy een belangrijk aandachtspunt. Dat klantendata technisch beschikbaar en voorbereid is, betekent niet dat je die gegevens zomaar voor elke toepassing mag gebruiken. In sommige gevallen moeten gegevens eerst geanonimiseerd worden, bijvoorbeeld door synthetische data te genereren op basis van echte data.
Ook de stap naar productie wordt soms onderschat. Data waarop een model is getraind, is niet altijd beschikbaar in een operationele omgeving. Zeker wanneer een model voorspellingen moet doen over toekomstige situaties, kunnen er plots gaten ontstaan in de data waarop het systeem rekent.
Een houdbaarheidsdatum voor data
Al deze uitdagingen maken duidelijk dat data ai-ready maken geen eenmalige oefening is, maar een continu proces dat opvolging vraagt. Versiebeheer speelt daarin een belangrijke rol. Hoewel het vaak wordt overgeslagen, is het zeker voor ai cruciaal om te weten welke data wanneer is gebruikt en wat er doorheen de tijd is veranderd. Alleen zo kan je modellen betrouwbaar houden en achteraf aantonen hoe een ai-systeem en zijn output tot stand zijn gekomen. Ook vanuit regelgeving en compliance is die transparantie essentieel.
Geef data en modellen daarom een duidelijke houdbaarheidsdatum. En doe, net als thuis, regelmatig een grote schoonmaak. Ga na welke data nog relevant is, wat representatief blijft en welke informatie je echt nodig hebt voor een concrete toepassing.
Er is vandaag zoveel data beschikbaar dat het steeds moeilijker wordt om het overzicht te bewaren. Vertrek daarom vanuit de businessvraag en focus op de gegevens die je organisatie vooruithelpen. Wie vandaag met ai wil versnellen, moet eerst investeren in de basis: data begrijpen, opschonen, verbinden en blijven monitoren. Dat is de kortste weg naar duurzaam succes met ai.
Véronique Van Vlasselaer, head of ai & data science bij SAS emea. Ze schrijft deze opinie in eigen naam

