Il web e i social network rendono disponibili volumi sempre più importanti di informazioni che sono ormai diventate una preziosa fonte sia per le ricerche nell’ambito delle scienze sociali che per tutti i sistemi a supporto delle decisioni, anche in ambito aziendale.
In particolare, Twitter è diventato un mezzo di comunicazione fondamentale, che ha trasformato il modo in cui viene diffusa l’informazione. Chi lo usa non è più semplice utente passivo ma può creare e diffondere informazioni e opinioni.
Alla luce di questo, Fondazione Nord Est ha cominciato a esplorare le possibilità di utilizzare l’analisi dei tweet non solo per descrivere la situazione attuale, praticamente in real time, ma per provare a fare previsioni sulle dinamiche future.
In collaborazione con Quantitas, start up innovativa che si occupa di data visualization, abbiamo realizzato una piattaforma che partendo dalle opinioni degli utenti di Twitter italiani sul coronavirus fornisce un esempio di come “scavando e ripulendo” i dati presenti nel web si possono ricavare informazioni.
In particolare, abbiamo raccolto e analizzato tutti i tweet contenenti la parola coronavirus a partire dal 20 febbraio, giorno precedente l’individuazione del primo caso in Italia. Il risultato è visibile al seguente link: http://quantitas.it/dev/dataviz/covid19/
Cosa vediamo?
La nuvola di parole (“Di cosa si parla”) consente di visualizzare le parole usate con maggiore frequenza e all’interno di essa le parole in blu rappresentano temi emergenti. Attraverso l’analisi della nuvola è possibile individuare, per ogni giorno, i temi di discussione più frequenti e quelli emergenti. Ai piedi della nuvola abbiamo inserito un rimando ad alcuni dei fatti avvenuti nel giorno analizzato.

Il primo barplot a sinistra della visualizzazione (“Quanto se ne parla”) descrive la serie storica del numero di tweet singoli (non retweet) contenenti la parola coronavirus. È un’indicazione dell’attenzione che gli utenti di twitter hanno dedicato al tema (si noti l’esplosione di attenzione tra il 20 febbraio e il 21, giorno in cui si scopre il primo caso italiano).
Il secondo barplot (“In che modo”) descrive il “sentiment” di questi tweet. In particolare, viene usato un algoritmo di Sentiment Analysis (elaborazione del linguaggio naturale per ricavarne opinioni ed emozioni dal testo) che classifica i tweet come positivi, negativi o neutri e aggrega il risultato in un indicatore sintetico. Nel periodo analizzato il sentiment è sempre negativo, anche se con intensità diverse che segnano un miglioramento negli ultimi giorni analizzati.
Partendo dal “Social Mood on Economy Index” elaborato dall’Istat stiamo elaborando una misura del sentiment del Nord Est sull’economia basata sui dati di twitter…. Stay tuned!
———————————————————-
Una lettura introduttiva su Sentiment Analysis basata sui dati di twitter:
Basile P., Basile V., Nissim M., Novielli N., Patti V. (2017) Sentiment Analysis of Microblogging Data. In: Alhajj R., Rokne J. (eds) Encyclopedia of Social Network Analysis and Mining. Springer, New York, NY
Solari, D., Sciandra, A., & Finos, L. (2019). TextWiller: Collection of functions for text mining, specially devoted to the Italian language. Journal of Open Source Software, 4(41), 1256.