Dati complessi,
trasformati
in conoscenza.
Sono Ian e costruisco e mantengo sistemi di dati in produzione e l'analytics che ci sta sopra, a partire da qualsiasi tipo di dato complesso: dati web-scraped settimanali ad alto volume, dati geospaziali, a grafo o tabellari. Con questi dati rispondo alle domande degli stakeholder.
Aree di focus
Come Head of Data indosso molti cappelli. Le mie quattro aree di focus sono costruire l'infrastruttura dati, mettere in piedi i sistemi stessi, gestire tipi di dati diversi e fare analytics sopra.
Data engineering
Costruisco e mantengo pipeline di dati e storage efficiente: per esempio tre anni di raccolta e scraping settimanale da 8 fonti diverse per un fondo immobiliare con 10B AuM, con strutturazione, pulizia e deduplica automatiche dei dati.
Architettura di sistema
Metto in piedi la piattaforma sottostante: istanze server, PostGIS, calcolo distribuito su Iceberg e server di elaborazione dati, networking/VPN, API e sicurezza. Un esempio: 13 servizi diversi girano come infrastruttura di produzione per sostenere prodotti dati complessi.
Prodotti dati complessi
Trasformo tipi di dati complessi e non convenzionali in dati utilizzabili per l'analytics: dati spaziali e di rete, dati documentali e serie storiche, con ownership end-to-end dal dato grezzo agli insight.
Analytics & ML
Lo strato di analisi sopra: nowcasting, simulazioni ABM, regressioni, metodi statistici e ML applicato che arriva in produzione: dai modelli edonici dei prezzi, alla classificazione di immagini, fino ad analisi di serie storiche statisticamente solide.
Progetti & paper.
Otto lavori lungo le quattro corsie: sistemi di produzione, prodotti consegnati e la ricerca che rendono possibile.
LanguageBuddy: AI language tutor
Un tutor linguistico AI self-hosted per olandese, italiano e spagnolo, costruito sulla ricerca sull'apprendimento delle lingue, con un tutor LLM via chat o chiamata vocale e ripetizione SM-2. Ogni errore finisce in una coda di ripetizione dilazionata che guida gli esercizi del giorno dopo, e uno scraper di notizie reali alimenta l'apprendimento della lettura. Segue il framework CEFR con oltre 6.200 voci di vocabolario e aiuta gli utenti a raggiungere più in fretta l'allineamento CEFR.
Gentrification agent-based model
La ricerca della mia tesi magistrale sulla gentrificazione, dove ho costruito un modello ad agenti del cambiamento di quartiere: le famiglie interagiscono con i quartieri delle città trattate, Amsterdam, Utrecht e Milano, in base al proprio reddito, all'accessibilità economica del quartiere e alla sua attrattività, calcolata da elementi come la classificazione di 'bellezza' delle immagini streetview, la connettività GTFS, il verde e il sentiment online del quartiere. Un'estensione a due regimi abitativi per l'edilizia sociale è in corso.
Research pipelines as production systems
Ogni mio progetto di ricerca personale usa pipeline di dati Airflow 3 ospitate in questo progetto, che scala dal laptop a un cluster CeleryExecutor multi-macchina. È costruito con guardie di idempotenza, operatori custom e monitoraggio agentico.
SponsoredBye: sponsor-segment detection
Uno skipper di sponsor per YouTube basato solo sul testo, costruito prima che YouTube Premium ne lanciasse uno: embedding sentence-T5 alimentano un sequence tagger BiLSTM che segnala le frasi sponsorizzate e le riporta ai timestamp, riducendo l'errore di segmentazione dal 99% al 16% WindowDiff.
FishFinder: photo-to-species ID
Un'app Flutter che identifica 63 specie ittiche olandesi da una foto, interamente on-device, e riempie una FishDex in stile Pokédex a ogni cattura. La pipeline di training: ~3.000 foto annotate a mano mascherate con Segment Anything Model, poi un ResNet50 rifinito con fine-tuning e compresso in un modello TFLite da 8,8 MB per l'uso on-device.
Predicting flooding risk from local features
La mia tesi triennale, che chiede se il rischio di alluvione si possa spiegare con caratteristiche locali invece che con una simulazione idrodinamica black-box. Ho raccolto 33 caratteristiche su ~45.000 località europee, come impermeabilizzazione del suolo, tipo di terreno e distanza dal fiume, su oltre 100GB di dati, e ho usato una Random Forest per trovarne la relazione. Il risultato: 97,5% sulla domanda binaria dell'alluvione ventennale, con impermeabilizzazione circostante e altezza relativa a fare la maggior parte del lavoro.
Connectivity & walkability scoring
Un progetto guidato e condotto durante il mio lavoro in KR&A: un punteggio di connettività e pedonabilità validato per saturazione a risoluzione di particella, distribuito su 38 mercati EU/NA/APAC, lavorando con TB di dati e centinaia di fonti.
Monthly house-price index · 13 EU countries
Un progetto condotto durante il mio lavoro in KR&A: una pipeline di web scraping su 13 paesi che alimenta una regressione edonica log-prezzo; indici mensili testati come indicatori di disaggregazione per gli HPI trimestrali di Eurostat.
Paper.
Metodi, dati e risultati dietro i progetti. Tutti i paper →

