Al centro della Digital Publishing Platform (DPP) si trova Apache Kafka, scelto per la capacità di gestire eventi e flussi di dati in tempo reale attraverso un modello publish/subscribe, e utilizzato come spina dorsale per l’elaborazione e la distribuzione dei contenuti. I contenuti, originati da sorgenti Oracle/XML, generano eventi di pubblicazione che attraversano servizi applicativi collegati a Kafka e vengono infine distribuiti verso tre destinazioni specializzate in base al formato: PostgreSQL per i dati relazionali/JSON, OpenSearch per l’indicizzazione e la ricerca dei contenuti in formato JSON, e un Object Store per i file PDF. L’architettura modulare consente di integrare servizi specializzati per tipologia di contenuto — normativa, news, volumi PDF, giurisprudenza — pubblicando lo stesso contenuto come articolo online, inserzione in newsletter o capitolo di e-book. La piattaforma integra inoltre tecnologie di machine learning per la classificazione automatica dei documenti e l’estrazione di entità, migliorando l’accuratezza della categorizzazione e le funzionalità di ricerca e personalizzazione.