Komplexe Daten,
transformiert
zu Erkenntnissen.
Ich bin Ian und ich baue und betreibe Produktionsdatensysteme und die Analytik darauf, aus jedem komplexen Datentyp: wöchentlich gescrapte Daten in hohem Volumen, Geodaten, Graph- oder Tabellendaten. Mit diesen Daten beantworte ich die Fragen von Stakeholdern.
Vier Schwerpunkte
Als Head of Data trage ich viele Hüte. Meine vier Schwerpunkte: die Dateninfrastruktur bauen, die Systeme selbst aufsetzen, verschiedene Datentypen handhaben und die Analytik obendrauf betreiben.
Data Engineering
Datenpipelines und effiziente Speicherung bauen und warten, etwa drei Jahre wöchentliche Erhebung/Scraping aus 8 verschiedenen Quellen für einen Immobilienfonds mit 10B AuM, und diese Daten dann automatisch strukturieren, bereinigen und deduplizieren.
Systemarchitektur
Die Plattform darunter aufsetzen: Serverinstanzen, PostGIS, verteiltes Iceberg-Compute und Datenverarbeitungsserver, Netzwerk/VPN, APIs und Security. Beispiel: 13 verschiedene Services laufen als Produktionsinfrastruktur für eine Menge komplexer Datenprodukte.
Komplexe Datenprodukte
Komplexe und unkonventionelle Datentypen in nutzbare Daten für die Analytik verwandeln: räumliche und Netzwerkdaten, Dokumentdaten und Zeitreihen, end-to-end verantwortet von den Rohdaten bis zu den Erkenntnissen.
Analytics & ML
Die Analyseschicht obendrauf: Nowcasting, ABM-Simulationen, Regressionen, statistische Methoden und angewandtes ML, das in Produktion geht: von hedonischen Preismodellen über Bildklassifikation bis zu statistisch sauberen Zeitreihenanalysen.
Projekte & Paper.
Acht Arbeiten über die vier Spuren: Produktionssysteme, ausgelieferte Produkte und die Forschung, die sie möglich machen.
LanguageBuddy: AI language tutor
Ein selbst gehosteter KI-Sprachtutor für Niederländisch, Italienisch und Spanisch, gebaut auf Spracherwerbsforschung, mit einem LLM-Tutor zum Chatten oder Telefonieren und SM-2-Wiederholung. Jeder Fehler landet in einer Spaced-Repetition-Warteschlange, die die Übungen des nächsten Tages steuert, und ein Scraper für echte Nachrichten liefert Lesetexte. Folgt dem CEFR-Rahmen mit 6.200+ Vokabeleinträgen und bringt Nutzer schneller auf ihr CEFR-Niveau.
Gentrification agent-based model
Meine MSc-Arbeit zu Gentrifizierung: ein agentenbasiertes Modell von Nachbarschaftswandel. Haushalte interagieren mit Nachbarschaften in den untersuchten Städten Amsterdam, Utrecht und Mailand, auf Basis ihres eigenen Einkommens, der Leistbarkeit der Nachbarschaft und ihrer Attraktivität, gespeist aus Elementen wie einer 'Beauty'-Klassifikation von Streetview-Bildern, GTFS-Konnektivität, Begrünung und der Online-Stimmung zur Nachbarschaft. Eine Erweiterung um sozialen Wohnbau mit zwei Mietformen ist in Arbeit.
Research pipelines as production systems
Jedes persönliche Forschungsprojekt, das ich angehe, nutzt Airflow-3-Datenpipelines, die in diesem Projekt gehostet sind. Es skaliert vom Laptop bis zum Multi-Maschinen-CeleryExecutor-Cluster. Gebaut mit Idempotenz-Guards, eigenen Operatoren und agentischem Monitoring.
SponsoredBye: sponsor-segment detection
Ein rein textbasierter Sponsor-Skipper für YouTube, gebaut bevor YouTube Premium einen auslieferte: sentence-T5-Embeddings speisen einen BiLSTM-Sequence-Tagger, der gesponserte Sätze markiert und auf Zeitstempel zurückrechnet. Der Segmentierungsfehler sinkt von 99% auf 16% WindowDiff.
FishFinder: photo-to-species ID
Eine Flutter-App, die 63 niederländische Fischarten vom Foto erkennt, vollständig on-device, und mit jedem Fang eine Pokédex-artige FishDex füllt. Die Trainingspipeline: ~3.000 handannotierte Fotos, maskiert mit dem Segment Anything Model, dann ein feingetuntes ResNet50, komprimiert auf ein 8,8-MB-TFLite-Modell für den Einsatz on-device.
Predicting flooding risk from local features
Meine BSc-Arbeit zur Frage, ob sich Hochwasserrisiko aus lokalen Merkmalen erklären lässt statt aus einer Black-Box-Hydrodynamiksimulation. 33 Merkmale über ~45.000 europäische Standorte gesammelt, etwa Bodenversiegelung, Bodentyp und Entfernung zum Fluss, über 100GB+ an Daten, und ein Random Forest auf den Zusammenhang angesetzt. Ergebnis: 97,5% auf der binären 20-Jahres-Frage, wobei umliegende Versiegelung und relative Höhe die meiste Arbeit leisten.
Connectivity & walkability scoring
Ein Projekt, das ich bei KR&A geleitet und durchgeführt habe: ein sättigungsvalidierter Konnektivitäts- und Walkability-Score auf Parzellenebene, ausgerollt über 38 Märkte in EU/NA/APAC, mit Terabytes an Daten und Hunderten von Datenquellen.
Monthly house-price index · 13 EU countries
Ein Projekt aus meiner Zeit bei KR&A: eine Web-Scraping-Pipeline über 13 Länder, die eine hedonische Log-Preis-Regression speist; monatliche Indizes getestet als Disaggregationsindikatoren für die Quartals-HPIs von Eurostat.
Papers.
Methoden, Daten und Ergebnisse hinter den Projekten. Alle Papers →

