Projecten & papers.
Acht stukken werk over de vier sporen: productiesystemen, geleverde producten, en het onderzoek dat ze mogelijk maken.
LanguageBuddy: AI language tutor
Een zelf-gehoste AI-taaltutor voor Nederlands, Italiaans en Spaans, gebouwd op taalleeronderzoek, met een LLM-tutor via chat of spraakgesprek en SM-2-herhaling. Elke fout wordt vastgelegd in een spaced-repetition-wachtrij die de oefeningen van de volgende dag aanstuurt, en een scraper van echt nieuws levert het leesmateriaal. Volgt het CEFR-raamwerk met 6.200+ woordenschat-items en helpt gebruikers sneller op CEFR-niveau te komen.
Gentrification agent-based model
Mijn MSc-thesisonderzoek naar gentrificatie, waarvoor ik een agent-based model van buurtverandering bouwde: huishoudens interacteren met buurten in de onderzochte steden Amsterdam, Utrecht en Milaan op basis van hun eigen inkomen, de betaalbaarheid van de buurt en de aantrekkelijkheid, gebaseerd op elementen als 'beauty'-classificatie van streetview-beelden, GTFS-connectiviteit, groen en online buurtsentiment. Een uitbreiding met sociale huur als tweede huurvorm is in de maak.
Research pipelines as production systems
Elk persoonlijk onderzoeksproject dat ik doe gebruikt Airflow 3-datapijplijnen die in dit project gehost worden. Het schaalt van een laptop tot een multi-machine CeleryExecutor-cluster. Dit project is gebouwd met idempotentie-guards, custom operators en agentic monitoring.
SponsoredBye: sponsor-segment detection
Een sponsor-skipper voor YouTube op basis van alleen tekst, gebouwd vóórdat YouTube Premium er een uitbracht: sentence-T5-embeddings voeden een BiLSTM-sequence-tagger die gesponsorde zinnen markeert en terugkoppelt naar tijdstempels, met een segmentatiefout die daalt van 99% naar 16% WindowDiff.
FishFinder: photo-to-species ID
Een Flutter-app die 63 Nederlandse vissoorten herkent van een foto, volledig on-device, en een Pokédex-achtige FishDex vult bij elke vangst. De trainingspijplijn: ~3.000 handmatig geannoteerde foto's gemaskeerd met Segment Anything Model, daarna een gefinetunede ResNet50 gecomprimeerd tot een TFLite-model van 8,8 MB voor on-device gebruik.
Predicting flooding risk from local features
Mijn BSc-thesis, over de vraag of overstromingsrisico verklaard kan worden uit lokale kenmerken in plaats van een black-box hydrodynamische simulatie. 33 kenmerken verzameld over ~45.000 Europese locaties, zoals bodemverharding, grondsoort en afstand tot de rivier, uit 100GB+ aan data, en een Random Forest gedraaid om het verband te vinden. Bevindingen: 97,5% op de binaire 20-jaarsvraag, met omliggende verharding en relatieve hoogte als belangrijkste voorspellers.
Connectivity & walkability scoring
Een project dat ik leidde en uitvoerde tijdens mijn werk bij KR&A: een op verzadiging gevalideerde connectiviteits- en loopbaarheidsscore op perceelniveau, uitgerold over 38 markten in EU/NA/APAC, met TB's aan data en honderden databronnen.
Monthly house-price index · 13 EU countries
Een project uitgevoerd tijdens mijn werk bij KR&A: een webscraping-pijplijn over 13 landen die een hedonische log-prijsregressie voedt; maandelijkse indices getest als disaggregatie-indicatoren voor de kwartaal-HPI's van Eurostat.
Papers.
Working papers, preprints en methodologische verslagen over onderzoek naar stedelijke dynamiek, netwerkanalyse, geospatiale methoden en data science.