Projekte & Paper.
Acht Arbeiten über die vier Spuren: Produktionssysteme, ausgelieferte Produkte und die Forschung, die sie möglich machen.
LanguageBuddy: AI language tutor
Ein selbst gehosteter KI-Sprachtutor für Niederländisch, Italienisch und Spanisch, gebaut auf Spracherwerbsforschung, mit einem LLM-Tutor zum Chatten oder Telefonieren und SM-2-Wiederholung. Jeder Fehler landet in einer Spaced-Repetition-Warteschlange, die die Übungen des nächsten Tages steuert, und ein Scraper für echte Nachrichten liefert Lesetexte. Folgt dem CEFR-Rahmen mit 6.200+ Vokabeleinträgen und bringt Nutzer schneller auf ihr CEFR-Niveau.
Gentrification agent-based model
Meine MSc-Arbeit zu Gentrifizierung: ein agentenbasiertes Modell von Nachbarschaftswandel. Haushalte interagieren mit Nachbarschaften in den untersuchten Städten Amsterdam, Utrecht und Mailand, auf Basis ihres eigenen Einkommens, der Leistbarkeit der Nachbarschaft und ihrer Attraktivität, gespeist aus Elementen wie einer 'Beauty'-Klassifikation von Streetview-Bildern, GTFS-Konnektivität, Begrünung und der Online-Stimmung zur Nachbarschaft. Eine Erweiterung um sozialen Wohnbau mit zwei Mietformen ist in Arbeit.
Research pipelines as production systems
Jedes persönliche Forschungsprojekt, das ich angehe, nutzt Airflow-3-Datenpipelines, die in diesem Projekt gehostet sind. Es skaliert vom Laptop bis zum Multi-Maschinen-CeleryExecutor-Cluster. Gebaut mit Idempotenz-Guards, eigenen Operatoren und agentischem Monitoring.
SponsoredBye: sponsor-segment detection
Ein rein textbasierter Sponsor-Skipper für YouTube, gebaut bevor YouTube Premium einen auslieferte: sentence-T5-Embeddings speisen einen BiLSTM-Sequence-Tagger, der gesponserte Sätze markiert und auf Zeitstempel zurückrechnet. Der Segmentierungsfehler sinkt von 99% auf 16% WindowDiff.
FishFinder: photo-to-species ID
Eine Flutter-App, die 63 niederländische Fischarten vom Foto erkennt, vollständig on-device, und mit jedem Fang eine Pokédex-artige FishDex füllt. Die Trainingspipeline: ~3.000 handannotierte Fotos, maskiert mit dem Segment Anything Model, dann ein feingetuntes ResNet50, komprimiert auf ein 8,8-MB-TFLite-Modell für den Einsatz on-device.
Predicting flooding risk from local features
Meine BSc-Arbeit zur Frage, ob sich Hochwasserrisiko aus lokalen Merkmalen erklären lässt statt aus einer Black-Box-Hydrodynamiksimulation. 33 Merkmale über ~45.000 europäische Standorte gesammelt, etwa Bodenversiegelung, Bodentyp und Entfernung zum Fluss, über 100GB+ an Daten, und ein Random Forest auf den Zusammenhang angesetzt. Ergebnis: 97,5% auf der binären 20-Jahres-Frage, wobei umliegende Versiegelung und relative Höhe die meiste Arbeit leisten.
Connectivity & walkability scoring
Ein Projekt, das ich bei KR&A geleitet und durchgeführt habe: ein sättigungsvalidierter Konnektivitäts- und Walkability-Score auf Parzellenebene, ausgerollt über 38 Märkte in EU/NA/APAC, mit Terabytes an Daten und Hunderten von Datenquellen.
Monthly house-price index · 13 EU countries
Ein Projekt aus meiner Zeit bei KR&A: eine Web-Scraping-Pipeline über 13 Länder, die eine hedonische Log-Preis-Regression speist; monatliche Indizes getestet als Disaggregationsindikatoren für die Quartals-HPIs von Eurostat.
Papers.
Working Papers, Preprints und Methodenberichte zu Forschung über urbane Dynamik, Netzwerkanalyse, Geodatenmethoden und Data Science.