Complexe data,
omgezet
in inzicht.
Ik ben Ian en ik bouw en onderhoud productiedatasystemen en de analytics erbovenop, vanuit elk complex datatype: wekelijkse webscraping-data met hoog volume, geodata, graaf- of tabeldata. Met die data beantwoord ik vragen van stakeholders.
Mijn focusgebieden
Als Head of Data draag ik veel petten. Mijn vier focusgebieden: de data-infrastructuur bouwen, de systemen zelf opzetten, verschillende soorten data hanteren en de analytics erbovenop draaien.
Data engineering
Datapijplijnen en efficiënte opslag bouwen en onderhouden, zoals drie jaar wekelijkse collectie/scraping uit 8 verschillende bronnen voor een vastgoedfonds met 10B AuM, en die data vervolgens automatisch structureren, opschonen en ontdubbelen.
Systeemarchitectuur
Het platform eronder opzetten: serverinstances, PostGIS, gedistribueerde Iceberg-compute en dataverwerkingsservers, netwerken/VPN, API's en security. Voorbeeld: 13 verschillende services die als productie-infrastructuur draaien om bergen complexe dataproducten aan te kunnen.
Complexe dataproducten
Complexe en onconventionele datatypes omzetten in bruikbare data voor analytics: ruimtelijke en netwerkdata, documentdata en tijdreeksen, end-to-end in eigen beheer van ruwe data tot inzichten.
Analytics & ML
De analyselaag erbovenop: nowcasting, ABM-simulaties, regressies, statistische methoden en toegepaste ML die shipt: van hedonische prijsmodellen tot beeldclassificatie tot statistisch degelijke tijdreeksanalyses.
Projecten & papers.
Acht stukken werk over de vier sporen: productiesystemen, geleverde producten, en het onderzoek dat ze mogelijk maken.
LanguageBuddy: AI language tutor
Een zelf-gehoste AI-taaltutor voor Nederlands, Italiaans en Spaans, gebouwd op taalleeronderzoek, met een LLM-tutor via chat of spraakgesprek en SM-2-herhaling. Elke fout wordt vastgelegd in een spaced-repetition-wachtrij die de oefeningen van de volgende dag aanstuurt, en een scraper van echt nieuws levert het leesmateriaal. Volgt het CEFR-raamwerk met 6.200+ woordenschat-items en helpt gebruikers sneller op CEFR-niveau te komen.
Gentrification agent-based model
Mijn MSc-thesisonderzoek naar gentrificatie, waarvoor ik een agent-based model van buurtverandering bouwde: huishoudens interacteren met buurten in de onderzochte steden Amsterdam, Utrecht en Milaan op basis van hun eigen inkomen, de betaalbaarheid van de buurt en de aantrekkelijkheid, gebaseerd op elementen als 'beauty'-classificatie van streetview-beelden, GTFS-connectiviteit, groen en online buurtsentiment. Een uitbreiding met sociale huur als tweede huurvorm is in de maak.
Research pipelines as production systems
Elk persoonlijk onderzoeksproject dat ik doe gebruikt Airflow 3-datapijplijnen die in dit project gehost worden. Het schaalt van een laptop tot een multi-machine CeleryExecutor-cluster. Dit project is gebouwd met idempotentie-guards, custom operators en agentic monitoring.
SponsoredBye: sponsor-segment detection
Een sponsor-skipper voor YouTube op basis van alleen tekst, gebouwd vóórdat YouTube Premium er een uitbracht: sentence-T5-embeddings voeden een BiLSTM-sequence-tagger die gesponsorde zinnen markeert en terugkoppelt naar tijdstempels, met een segmentatiefout die daalt van 99% naar 16% WindowDiff.
FishFinder: photo-to-species ID
Een Flutter-app die 63 Nederlandse vissoorten herkent van een foto, volledig on-device, en een Pokédex-achtige FishDex vult bij elke vangst. De trainingspijplijn: ~3.000 handmatig geannoteerde foto's gemaskeerd met Segment Anything Model, daarna een gefinetunede ResNet50 gecomprimeerd tot een TFLite-model van 8,8 MB voor on-device gebruik.
Predicting flooding risk from local features
Mijn BSc-thesis, over de vraag of overstromingsrisico verklaard kan worden uit lokale kenmerken in plaats van een black-box hydrodynamische simulatie. 33 kenmerken verzameld over ~45.000 Europese locaties, zoals bodemverharding, grondsoort en afstand tot de rivier, uit 100GB+ aan data, en een Random Forest gedraaid om het verband te vinden. Bevindingen: 97,5% op de binaire 20-jaarsvraag, met omliggende verharding en relatieve hoogte als belangrijkste voorspellers.
Connectivity & walkability scoring
Een project dat ik leidde en uitvoerde tijdens mijn werk bij KR&A: een op verzadiging gevalideerde connectiviteits- en loopbaarheidsscore op perceelniveau, uitgerold over 38 markten in EU/NA/APAC, met TB's aan data en honderden databronnen.
Monthly house-price index · 13 EU countries
Een project uitgevoerd tijdens mijn werk bij KR&A: een webscraping-pijplijn over 13 landen die een hedonische log-prijsregressie voedt; maandelijkse indices getest als disaggregatie-indicatoren voor de kwartaal-HPI's van Eurostat.
Papers.
Methoden, data en resultaten achter de projecten. Alle papers →

