Ian Ronk
Ian Ronk
Data Lead · Data Engineer & System Architecture
Amsterdam, NL

Complexe data,
omgezet
in inzicht.

Ik ben Ian en ik bouw en onderhoud productiedatasystemen en de analytics erbovenop, vanuit elk complex datatype: wekelijkse webscraping-data met hoog volume, geodata, graaf- of tabeldata. Met die data beantwoord ik vragen van stakeholders.

FocusgebiedenData engineeringSysteemarchitectuurComplexe dataproductenAnalytics & ML

Hoi, ik ben Ian.
Ik creëer inzichten uit data

Ik werk als Head of Data: ik bouw en onderhoud datasystemen die data verzamelen, verwerken en structureren voor verschillende dataproducten, gebruikt door pensioenfondsen, statistiekbureaus en vastgoedbeleggers met 10B AuM.

In de loop van mijn carrière heb ik met veel verschillende soorten data en tools gewerkt: systemen op maat bouwen voor het dataprobleem van dat moment, met stakeholders bij klanten praten en innovatieve oplossingen neerzetten.

Lees de volledige bio
Ian Ronk
RolData Lead · Data Engineer
BasisAmsterdam, NL
OpleidingMSc Bocconi · BSc AI, UvA
StackBash · Python · PostGIS/SQL · Airflow · Iceberg

Mijn focusgebieden

Als Head of Data draag ik veel petten. Mijn vier focusgebieden: de data-infrastructuur bouwen, de systemen zelf opzetten, verschillende soorten data hanteren en de analytics erbovenop draaien.

§ 03.01

Data engineering

Datapijplijnen en efficiënte opslag bouwen en onderhouden, zoals drie jaar wekelijkse collectie/scraping uit 8 verschillende bronnen voor een vastgoedfonds met 10B AuM, en die data vervolgens automatisch structureren, opschonen en ontdubbelen.

AirflowPythonETLMonitoringIceberg
§ 03.02

Systeemarchitectuur

Het platform eronder opzetten: serverinstances, PostGIS, gedistribueerde Iceberg-compute en dataverwerkingsservers, netwerken/VPN, API's en security. Voorbeeld: 13 verschillende services die als productie-infrastructuur draaien om bergen complexe dataproducten aan te kunnen.

Linux/BashResource Management & S3Networking & APIsDockerDistributed Compute
§ 03.03

Complexe dataproducten

Complexe en onconventionele datatypes omzetten in bruikbare data voor analytics: ruimtelijke en netwerkdata, documentdata en tijdreeksen, end-to-end in eigen beheer van ruwe data tot inzichten.

SpatialGraphNoSQL/MongoDBOCRData Validation
§ 03.04

Analytics & ML

De analyselaag erbovenop: nowcasting, ABM-simulaties, regressies, statistische methoden en toegepaste ML die shipt: van hedonische prijsmodellen tot beeldclassificatie tot statistisch degelijke tijdreeksanalyses.

RegressionTime SeriesSimulationsInsightsStatistical Analysis

Projecten & papers.

Acht stukken werk over de vier sporen: productiesystemen, geleverde producten, en het onderzoek dat ze mogelijk maken.

conversationlemmatizeSM-21d6d15dnext-day6,200 vocab · A1–C1
§ 04.01AI-productPROJECT

LanguageBuddy: AI language tutor

Een zelf-gehoste AI-taaltutor voor Nederlands, Italiaans en Spaans, gebouwd op taalleeronderzoek, met een LLM-tutor via chat of spraakgesprek en SM-2-herhaling. Elke fout wordt vastgelegd in een spaced-repetition-wachtrij die de oefeningen van de volgende dag aanstuurt, en een scraper van echt nieuws levert het leesmateriaal. Volgt het CEFR-raamwerk met 6.200+ woordenschat-items en helpt gebruikers sneller op CEFR-niveau te komen.

FastAPILLMTTSSQLiteDocker
t=0t=10yattractiveness ↑affordability ↓parcels: AMS · UTRECHT · MILAN
§ 04.02MSc-thesis · BocconiRESEARCH

Gentrification agent-based model

Mijn MSc-thesisonderzoek naar gentrificatie, waarvoor ik een agent-based model van buurtverandering bouwde: huishoudens interacteren met buurten in de onderzochte steden Amsterdam, Utrecht en Milaan op basis van hun eigen inkomen, de betaalbaarheid van de buurt en de aantrekkelijkheid, gebaseerd op elementen als 'beauty'-classificatie van streetview-beelden, GTFS-connectiviteit, groen en online buurtsentiment. Een uitbreiding met sociale huur als tweede huurvorm is in de maak.

Python/GeoPandasLarge Vision ModelPostGISAgent-based Modeling
DAGingest726 GBguardtransformqueuecelery workers
§ 04.03EngineeringPROJECT

Research pipelines as production systems

Elk persoonlijk onderzoeksproject dat ik doe gebruikt Airflow 3-datapijplijnen die in dit project gehost worden. Het schaalt van een laptop tot een multi-machine CeleryExecutor-cluster. Dit project is gebouwd met idempotentie-guards, custom operators en agentic monitoring.

AirflowCeleryDockerCIDuckDB
p(sponsor)86% F10.54:326:05sentence-T5 → BiLSTM · 38,600 videos
§ 04.04NLP · sequence taggingPROJECT

SponsoredBye: sponsor-segment detection

Een sponsor-skipper voor YouTube op basis van alleen tekst, gebouwd vóórdat YouTube Premium er een uitbracht: sentence-T5-embeddings voeden een BiLSTM-sequence-tagger die gesponsorde zinnen markeert en terugkoppelt naar tijdstempels, met een segmentatiefout die daalt van 99% naar 16% WindowDiff.

TensorFlowBiLSTMsentence-T5MongoDBHuggingface
SAM224pxResNet501/638.8 MB on-device
§ 04.05Mobile MLPROJECT

FishFinder: photo-to-species ID

Een Flutter-app die 63 Nederlandse vissoorten herkent van een foto, volledig on-device, en een Pokédex-achtige FishDex vult bij elke vangst. De trainingspijplijn: ~3.000 handmatig geannoteerde foto's gemaskeerd met Segment Anything Model, daarna een gefinetunede ResNet50 gecomprimeerd tot een TFLite-model van 8,8 MB voor on-device gebruik.

Flutter/DartTFLiteResNet50Segment Anything Model (SAM)Firebase
RF 97.5%33 featuresd(river)Δhimperv. 500m–5kmw.l.
§ 04.06BSc-thesis · UvARESEARCH

Predicting flooding risk from local features

Mijn BSc-thesis, over de vraag of overstromingsrisico verklaard kan worden uit lokale kenmerken in plaats van een black-box hydrodynamische simulatie. 33 kenmerken verzameld over ~45.000 Europese locaties, zoals bodemverharding, grondsoort en afstand tot de rivier, uit 100GB+ aan data, en een Random Forest gedraaid om het verband te vinden. Bevindingen: 97,5% op de binaire 20-jaarsvraag, met omliggende verharding en relatieve hoogte als belangrijkste voorspellers.

scikit-learnRandom Forestraster dataGIS
945 min15 min38 markets · EU/NA/APACparcel score 0–100
§ 04.07Ontwikkeld bij KR&AKR&A

Connectivity & walkability scoring

Een project dat ik leidde en uitvoerde tijdens mijn werk bij KR&A: een op verzadiging gevalideerde connectiviteits- en loopbaarheidsscore op perceelniveau, uitgerold over 38 markten in EU/NA/APAC, met TB's aan data en honderden databronnen.

PostGISS3Dijkstra & Network ScienceDistributed Compute
monthlyEurostat Qbase=10013 countries
§ 04.08Ontwikkeld bij KR&AKR&A

Monthly house-price index · 13 EU countries

Een project uitgevoerd tijdens mijn werk bij KR&A: een webscraping-pijplijn over 13 landen die een hedonische log-prijsregressie voedt; maandelijkse indices getest als disaggregatie-indicatoren voor de kwartaal-HPI's van Eurostat.

PythonScrapy/SeleniumPostGISMongoDBR

Papers.

Methoden, data en resultaten achter de projecten. Alle papers →

Vragen, ideeën, rollen? Neem contact op.

ContactGitHub
Ian Ronk | Head of Data: data systems, analytics, and urban-dynamics research