Progetti & paper.

Otto lavori lungo le quattro corsie: sistemi di produzione, prodotti consegnati e la ricerca che rendono possibile.

conversationlemmatizeSM-21d6d15dnext-day6,200 vocab · A1–C1
§ 04.01Prodotto AIPROJECT

LanguageBuddy: AI language tutor

Un tutor linguistico AI self-hosted per olandese, italiano e spagnolo, costruito sulla ricerca sull'apprendimento delle lingue, con un tutor LLM via chat o chiamata vocale e ripetizione SM-2. Ogni errore finisce in una coda di ripetizione dilazionata che guida gli esercizi del giorno dopo, e uno scraper di notizie reali alimenta l'apprendimento della lettura. Segue il framework CEFR con oltre 6.200 voci di vocabolario e aiuta gli utenti a raggiungere più in fretta l'allineamento CEFR.

FastAPILLMTTSSQLiteDocker
t=0t=10yattractiveness ↑affordability ↓parcels: AMS · UTRECHT · MILAN
§ 04.02Tesi MSc · BocconiRESEARCH

Gentrification agent-based model

La ricerca della mia tesi magistrale sulla gentrificazione, dove ho costruito un modello ad agenti del cambiamento di quartiere: le famiglie interagiscono con i quartieri delle città trattate, Amsterdam, Utrecht e Milano, in base al proprio reddito, all'accessibilità economica del quartiere e alla sua attrattività, calcolata da elementi come la classificazione di 'bellezza' delle immagini streetview, la connettività GTFS, il verde e il sentiment online del quartiere. Un'estensione a due regimi abitativi per l'edilizia sociale è in corso.

Python/GeoPandasLarge Vision ModelPostGISAgent-based Modeling
DAGingest726 GBguardtransformqueuecelery workers
§ 04.03EngineeringPROJECT

Research pipelines as production systems

Ogni mio progetto di ricerca personale usa pipeline di dati Airflow 3 ospitate in questo progetto, che scala dal laptop a un cluster CeleryExecutor multi-macchina. È costruito con guardie di idempotenza, operatori custom e monitoraggio agentico.

AirflowCeleryDockerCIDuckDB
p(sponsor)86% F10.54:326:05sentence-T5 → BiLSTM · 38,600 videos
§ 04.04NLP · sequence taggingPROJECT

SponsoredBye: sponsor-segment detection

Uno skipper di sponsor per YouTube basato solo sul testo, costruito prima che YouTube Premium ne lanciasse uno: embedding sentence-T5 alimentano un sequence tagger BiLSTM che segnala le frasi sponsorizzate e le riporta ai timestamp, riducendo l'errore di segmentazione dal 99% al 16% WindowDiff.

TensorFlowBiLSTMsentence-T5MongoDBHuggingface
SAM224pxResNet501/638.8 MB on-device
§ 04.05Mobile MLPROJECT

FishFinder: photo-to-species ID

Un'app Flutter che identifica 63 specie ittiche olandesi da una foto, interamente on-device, e riempie una FishDex in stile Pokédex a ogni cattura. La pipeline di training: ~3.000 foto annotate a mano mascherate con Segment Anything Model, poi un ResNet50 rifinito con fine-tuning e compresso in un modello TFLite da 8,8 MB per l'uso on-device.

Flutter/DartTFLiteResNet50Segment Anything Model (SAM)Firebase
RF 97.5%33 featuresd(river)Δhimperv. 500m–5kmw.l.
§ 04.06Tesi BSc · UvARESEARCH

Predicting flooding risk from local features

La mia tesi triennale, che chiede se il rischio di alluvione si possa spiegare con caratteristiche locali invece che con una simulazione idrodinamica black-box. Ho raccolto 33 caratteristiche su ~45.000 località europee, come impermeabilizzazione del suolo, tipo di terreno e distanza dal fiume, su oltre 100GB di dati, e ho usato una Random Forest per trovarne la relazione. Il risultato: 97,5% sulla domanda binaria dell'alluvione ventennale, con impermeabilizzazione circostante e altezza relativa a fare la maggior parte del lavoro.

scikit-learnRandom Forestraster dataGIS
945 min15 min38 markets · EU/NA/APACparcel score 0–100
§ 04.07Sviluppato in KR&AKR&A

Connectivity & walkability scoring

Un progetto guidato e condotto durante il mio lavoro in KR&A: un punteggio di connettività e pedonabilità validato per saturazione a risoluzione di particella, distribuito su 38 mercati EU/NA/APAC, lavorando con TB di dati e centinaia di fonti.

PostGISS3Dijkstra & Network ScienceDistributed Compute
monthlyEurostat Qbase=10013 countries
§ 04.08Sviluppato in KR&AKR&A

Monthly house-price index · 13 EU countries

Un progetto condotto durante il mio lavoro in KR&A: una pipeline di web scraping su 13 paesi che alimenta una regressione edonica log-prezzo; indici mensili testati come indicatori di disaggregazione per gli HPI trimestrali di Eurostat.

PythonScrapy/SeleniumPostGISMongoDBR

Paper.

Working paper, preprint e note metodologiche sulla ricerca in dinamiche urbane, network analysis, metodi geospaziali e data science.

01
2025-03-05
US vs EU: does training-data geography matter for autonomous-driving object detection?A controlled 2×3 fine-tuning study on YOLOv3/YOLOv8: US dashcam data transfers roughly nothing to European streets (+0.001 mAP vs +0.153 for in-domain data), and bicycle detection collapses without EU ground truth.Scarica il PDF ↓
WORKING-PAPER
02
2026-07-09
When Does Metro Infrastructure Capitalize into Property Prices? Phase-Decomposed Difference-in-Differences Evidence from Seven European CitiesWhen do new metro lines show up in house prices? Across 42,000 observations from seven European cities, the market pays on delivery, not on promises, and the number worth defending is Milan's +167 EUR/m² within Ring D.Scarica il PDF ↓
IN PROGRESS
03
2026-08-14
Calibrating Free Postcode Boundaries from OpenStreetMap: A Transferable Seed-Density Accuracy CurveFree postcode boundaries built from OpenStreetMap addresses, with a calibrated accuracy curve that predicts how good they are before any reference map exists. Tested across five countries, deployed on all of Italy.Scarica il PDF ↓
WORKING-PAPER
04
Social housing impact on the gentrification ABM
IN PROGRESS
05
Urban heat island research
IN PROGRESS
Scrivimi
Projects & Papers | Ian Ronk