Ian Ronk
Ian Ronk
Data Lead · Data Engineer & System Architecture
Amsterdam, NL

Komplexe Daten,
transformiert
zu Erkenntnissen.

Ich bin Ian und ich baue und betreibe Produktionsdatensysteme und die Analytik darauf, aus jedem komplexen Datentyp: wöchentlich gescrapte Daten in hohem Volumen, Geodaten, Graph- oder Tabellendaten. Mit diesen Daten beantworte ich die Fragen von Stakeholdern.

SchwerpunkteData EngineeringSystemarchitekturKomplexe DatenprodukteAnalytics & ML

Hallo, ich bin Ian.
Ich gewinne Erkenntnisse aus Daten

Ich arbeite als Head of Data und baue und betreibe Datensysteme: Daten sammeln, verarbeiten und strukturieren für verschiedene Datenprodukte, genutzt von Pensionsfonds, Statistikämtern und Immobilieninvestoren mit 10B AuM.

Im Laufe meiner Karriere habe ich mit vielen verschiedenen Datentypen und Tools gearbeitet, maßgeschneiderte Systeme für das jeweilige Datenproblem gebaut, mit Stakeholdern auf Kundenseite gesprochen und innovative Lösungen entwickelt.

Vollständige Bio lesen
Ian Ronk
RolleData Lead · Data Engineer
StandortAmsterdam, NL
AusbildungMSc Bocconi · BSc AI, UvA
StackBash · Python · PostGIS/SQL · Airflow · Iceberg

Vier Schwerpunkte

Als Head of Data trage ich viele Hüte. Meine vier Schwerpunkte: die Dateninfrastruktur bauen, die Systeme selbst aufsetzen, verschiedene Datentypen handhaben und die Analytik obendrauf betreiben.

§ 03.01

Data Engineering

Datenpipelines und effiziente Speicherung bauen und warten, etwa drei Jahre wöchentliche Erhebung/Scraping aus 8 verschiedenen Quellen für einen Immobilienfonds mit 10B AuM, und diese Daten dann automatisch strukturieren, bereinigen und deduplizieren.

AirflowPythonETLMonitoringIceberg
§ 03.02

Systemarchitektur

Die Plattform darunter aufsetzen: Serverinstanzen, PostGIS, verteiltes Iceberg-Compute und Datenverarbeitungsserver, Netzwerk/VPN, APIs und Security. Beispiel: 13 verschiedene Services laufen als Produktionsinfrastruktur für eine Menge komplexer Datenprodukte.

Linux/BashResource Management & S3Networking & APIsDockerDistributed Compute
§ 03.03

Komplexe Datenprodukte

Komplexe und unkonventionelle Datentypen in nutzbare Daten für die Analytik verwandeln: räumliche und Netzwerkdaten, Dokumentdaten und Zeitreihen, end-to-end verantwortet von den Rohdaten bis zu den Erkenntnissen.

SpatialGraphNoSQL/MongoDBOCRData Validation
§ 03.04

Analytics & ML

Die Analyseschicht obendrauf: Nowcasting, ABM-Simulationen, Regressionen, statistische Methoden und angewandtes ML, das in Produktion geht: von hedonischen Preismodellen über Bildklassifikation bis zu statistisch sauberen Zeitreihenanalysen.

RegressionTime SeriesSimulationsInsightsStatistical Analysis

Projekte & Paper.

Acht Arbeiten über die vier Spuren: Produktionssysteme, ausgelieferte Produkte und die Forschung, die sie möglich machen.

conversationlemmatizeSM-21d6d15dnext-day6,200 vocab · A1–C1
§ 04.01KI-ProduktPROJECT

LanguageBuddy: AI language tutor

Ein selbst gehosteter KI-Sprachtutor für Niederländisch, Italienisch und Spanisch, gebaut auf Spracherwerbsforschung, mit einem LLM-Tutor zum Chatten oder Telefonieren und SM-2-Wiederholung. Jeder Fehler landet in einer Spaced-Repetition-Warteschlange, die die Übungen des nächsten Tages steuert, und ein Scraper für echte Nachrichten liefert Lesetexte. Folgt dem CEFR-Rahmen mit 6.200+ Vokabeleinträgen und bringt Nutzer schneller auf ihr CEFR-Niveau.

FastAPILLMTTSSQLiteDocker
t=0t=10yattractiveness ↑affordability ↓parcels: AMS · UTRECHT · MILAN
§ 04.02MSc-Arbeit · BocconiRESEARCH

Gentrification agent-based model

Meine MSc-Arbeit zu Gentrifizierung: ein agentenbasiertes Modell von Nachbarschaftswandel. Haushalte interagieren mit Nachbarschaften in den untersuchten Städten Amsterdam, Utrecht und Mailand, auf Basis ihres eigenen Einkommens, der Leistbarkeit der Nachbarschaft und ihrer Attraktivität, gespeist aus Elementen wie einer 'Beauty'-Klassifikation von Streetview-Bildern, GTFS-Konnektivität, Begrünung und der Online-Stimmung zur Nachbarschaft. Eine Erweiterung um sozialen Wohnbau mit zwei Mietformen ist in Arbeit.

Python/GeoPandasLarge Vision ModelPostGISAgent-based Modeling
DAGingest726 GBguardtransformqueuecelery workers
§ 04.03EngineeringPROJECT

Research pipelines as production systems

Jedes persönliche Forschungsprojekt, das ich angehe, nutzt Airflow-3-Datenpipelines, die in diesem Projekt gehostet sind. Es skaliert vom Laptop bis zum Multi-Maschinen-CeleryExecutor-Cluster. Gebaut mit Idempotenz-Guards, eigenen Operatoren und agentischem Monitoring.

AirflowCeleryDockerCIDuckDB
p(sponsor)86% F10.54:326:05sentence-T5 → BiLSTM · 38,600 videos
§ 04.04NLP · Sequence-TaggingPROJECT

SponsoredBye: sponsor-segment detection

Ein rein textbasierter Sponsor-Skipper für YouTube, gebaut bevor YouTube Premium einen auslieferte: sentence-T5-Embeddings speisen einen BiLSTM-Sequence-Tagger, der gesponserte Sätze markiert und auf Zeitstempel zurückrechnet. Der Segmentierungsfehler sinkt von 99% auf 16% WindowDiff.

TensorFlowBiLSTMsentence-T5MongoDBHuggingface
SAM224pxResNet501/638.8 MB on-device
§ 04.05Mobile MLPROJECT

FishFinder: photo-to-species ID

Eine Flutter-App, die 63 niederländische Fischarten vom Foto erkennt, vollständig on-device, und mit jedem Fang eine Pokédex-artige FishDex füllt. Die Trainingspipeline: ~3.000 handannotierte Fotos, maskiert mit dem Segment Anything Model, dann ein feingetuntes ResNet50, komprimiert auf ein 8,8-MB-TFLite-Modell für den Einsatz on-device.

Flutter/DartTFLiteResNet50Segment Anything Model (SAM)Firebase
RF 97.5%33 featuresd(river)Δhimperv. 500m–5kmw.l.
§ 04.06BSc-Arbeit · UvARESEARCH

Predicting flooding risk from local features

Meine BSc-Arbeit zur Frage, ob sich Hochwasserrisiko aus lokalen Merkmalen erklären lässt statt aus einer Black-Box-Hydrodynamiksimulation. 33 Merkmale über ~45.000 europäische Standorte gesammelt, etwa Bodenversiegelung, Bodentyp und Entfernung zum Fluss, über 100GB+ an Daten, und ein Random Forest auf den Zusammenhang angesetzt. Ergebnis: 97,5% auf der binären 20-Jahres-Frage, wobei umliegende Versiegelung und relative Höhe die meiste Arbeit leisten.

scikit-learnRandom Forestraster dataGIS
945 min15 min38 markets · EU/NA/APACparcel score 0–100
§ 04.07Entwickelt bei KR&AKR&A

Connectivity & walkability scoring

Ein Projekt, das ich bei KR&A geleitet und durchgeführt habe: ein sättigungsvalidierter Konnektivitäts- und Walkability-Score auf Parzellenebene, ausgerollt über 38 Märkte in EU/NA/APAC, mit Terabytes an Daten und Hunderten von Datenquellen.

PostGISS3Dijkstra & Network ScienceDistributed Compute
monthlyEurostat Qbase=10013 countries
§ 04.08Entwickelt bei KR&AKR&A

Monthly house-price index · 13 EU countries

Ein Projekt aus meiner Zeit bei KR&A: eine Web-Scraping-Pipeline über 13 Länder, die eine hedonische Log-Preis-Regression speist; monatliche Indizes getestet als Disaggregationsindikatoren für die Quartals-HPIs von Eurostat.

PythonScrapy/SeleniumPostGISMongoDBR

Papers.

Methoden, Daten und Ergebnisse hinter den Projekten. Alle Papers →

Fragen, Ideen, Rollen? Melden Sie sich.

KontaktGitHub
Ian Ronk | Head of Data: data systems, analytics, and urban-dynamics research