L’architettura è stata progettata in modo modulare, con OpenSearch come base per l’analisi e la visualizzazione dei dati, sincronizzato regolarmente con il sistema DSpace-CRIS per mantenere aggiornate le dashboard. Per l’integrazione delle fonti esterne è stato adottato Dremio come data lake engine, capace di creare dataset virtuali a partire dai dati CRIS e da altre fonti governative nazionali, permettendo l’accesso in tempo reale ai dati integrati senza necessità di spostamenti fisici e preservandone così l’integrità. Apache Superset gestisce le visualizzazioni e le analisi avanzate, con dashboard personalizzate che monitorano la distribuzione dei ricercatori e delle risorse per area geografica, oltre a statistiche su età media, area disciplinare e genere dei ricercatori. Il flusso dati parte da un database relazionale contenente le informazioni universitarie, sincronizzato su indici OpenSearch e arricchito tramite processo ETL verso Dremio prima della visualizzazione finale in Superset.