Dati di epoche diverse, OLITEC presenta una tassonomia per renderli confrontabili

23
tassonomia semantica dei dati

La tassonomia semantica dei dati illustrata da Massimiliano Nicolini punta a rendere confrontabili archivi nati in epoche e contesti diversi.

La tassonomia semantica dei dati è il metodo illustrato a Roma da Massimiliano Nicolini, responsabile della ricerca della Fondazione Olivetti Tecnologia e Ricerca, davanti a oltre quattrocento studenti universitari. L’obiettivo è permettere ad archivi costruiti in periodi differenti di dialogare senza cancellare le condizioni nelle quali ogni informazione è stata prodotta. Approfondimenti sulle attività sono disponibili sul sito della Fondazione OLITEC.

Un numero, infatti, non ha un significato isolato: dipende dalla definizione adottata, dalla fonte, dal periodo storico, dal territorio e dalla popolazione osservata. Due banche dati possono usare la stessa parola per indicare realtà diverse oppure parole differenti per descrivere lo stesso fenomeno.

Il lavoro presentato nel saggio tecnico dedicato alla tassonomia e agli algoritmi di normalizzazione propone di registrare non soltanto la corrispondenza finale, ma anche le trasformazioni applicate e le condizioni che rendono ammissibile il confronto. È un’impostazione legata al più ampio dibattito sull’uso responsabile dei dati e dell’intelligenza artificiale.

Tassonomia semantica dei dati, equivalenze e incompatibilità

Il metodo distingue informazioni equivalenti, convertibili, comparabili solo a determinate condizioni, collegabili per contesto oppure incompatibili. Nicolini ha richiamato l’esempio di un archivio scolastico del 1996 confrontato con una piattaforma del 2026: prima di accostare i valori occorre chiarire cosa veniva misurato e con quali criteri.

Gli algoritmi in sviluppo hanno il compito di proporre e verificare relazioni, senza sostituire la responsabilità scientifica di chi interpreta i risultati. Il sistema conserva quindi una traccia delle scelte e segnala i margini di incertezza.

La prossima fase prevede test su archivi rappresentativi per misurare errori, precisione e limiti operativi. La tassonomia semantica dei dati viene così proposta come un’infrastruttura di trasparenza: non promette confronti automatici in ogni situazione, ma rende esplicito quando un collegamento è possibile e quando, invece, le differenze tra fonti impediscono conclusioni affidabili.