La voce contiene molte più informazioni di quelle che l'orecchio umano riesce a cogliere. È da questa intuizione che nasce uno dei filoni più promettenti dell'intelligenza artificiale applicata all'otorinolaringoiatria: l'analisi automatizzata della voce per identificare patologie delle corde vocali. Di particolare interesse in questo ambito sembra essere il “deep learning”, algoritmo di intelligenza artificiale in cui delle reti neurali analizzano enormi quantità di dati grezzi ed estraggono da sole le caratteristiche rilevanti, riducendo la necessità di intervento umano. Un recente lavoro pubblicato sugli European Archives of Oto-Rhino-Laryngology ha fatto il punto sullo stato dell'arte, analizzando tutte le evidenze disponibili sull'impiego del deep learning nella diagnosi delle patologie della glottide attraverso il solo segnale vocale. I risultati sono incoraggianti, ma suggeriscono anche prudenza prima di immaginare una reale applicazione clinica.
L'idea è semplice: la maggior parte delle patologie laringee glottiche (benigne o maligne che siano) alterano la biomeccanica della fonazione e modificano caratteristiche acustiche che spesso sfuggono alla percezione umana. Gli algoritmi di deep learning sono invece in grado di analizzare migliaia di parametri contemporaneamente, individuando pattern complessi associati a specifiche malattie. La revisione sistematica ha incluso 14 studi pubblicati tra il 2002 e il 2022, per un totale di oltre 3.000 pazienti. Le patologie investigate comprendevano edema di Reinke, noduli, polipi, paralisi cordale unilaterale, laringiti croniche, disfonie neurologiche e carcinoma laringeo. Nella maggior parte dei lavori ai pazienti veniva richiesto di emettere una vocale sostenuta, generalmente la /a/, mentre in altri venivano utilizzati campioni di parlato continuo o lettura di brevi testi. Le registrazioni venivano successivamente elaborate da reti neurali artificiali addestrate a distinguere soggetti sani da pazienti affetti da patologie laringee.
Uno degli aspetti più incoraggianti emersi dalla revisione riguarda le prestazioni degli algoritmi. In gran parte degli studi l'accuratezza diagnostica nell’individuare tracce vocali patologiche ha superato il 90%, con valori compresi tra il 73% e il 100% (valore medio intorno al 90,1%) a seconda della patologia e del modello utilizzato. Particolarmente interessante è il caso del carcinoma laringeo. In uno degli studi più avanzati, una rete neurale convoluzionale è stata in grado di identificare alterazioni vocali associate al tumore glottico con accuratezza superiore al 96%, suggerendo la possibilità futura di utilizzare semplici registrazioni vocali come strumento di screening preliminare. Alcuni sistemi, anche se purtroppo si tratta di una minoranza, hanno inoltre dimostrato la capacità di distinguere diverse patologie laringee in base alle loro specifiche caratteristiche acustiche. Questo tipo di applicativo, più ambizioso rispetto alla semplice classificazione "sano versus patologico", sembra essere quello potenzialmente più utile per un impiego come metodica di screening, ma data la sua maggiore complessità risulta probabilmente anche quello più lontano da una reale applicabilità clinica.
Nonostante i risultati promettenti, gli stessi autori della revisione sottolineano importanti limiti metodologici. Tutti gli studi inclusi erano retrospettivi e nessuno prevedeva una validazione esterna indipendente, considerata oggi un requisito essenziale per valutare l'affidabilità di qualsiasi sistema di intelligenza artificiale. In altre parole, gli algoritmi sono stati testati sugli stessi database da cui avevano imparato, una condizione che tende a sovrastimare le prestazioni reali. Anche la dimensione dei dataset rappresenta un problema. Sebbene oltre 3.000 pazienti possano sembrare molti, per il deep learning si tratta di numeri relativamente limitati. Le moderne applicazioni di intelligenza artificiale raggiungono infatti la massima efficacia quando vengono addestrate su decine o centinaia di migliaia di esempi. Un'ulteriore criticità riguarda la standardizzazione delle registrazioni. Frequenze di campionamento, microfoni utilizzati e tipologia di traccia vocale variavano notevolmente da uno studio all'altro, rendendo difficile confrontare i risultati e trasferirli nella pratica quotidiana. La raccolta dei campioni vocali è avvenuta per tutti gli studi in ambiente controllato, aspetto utile per l’addestramento dell’algoritmo ma sicuramente poco replicabile come metodica di “real-life screening”.
Nonostante queste limitazioni, il messaggio della revisione è chiaro: la voce rappresenta un biomarcatore digitale estremamente promettente, anche perché sempre disponibile e facilissimo da campionare. La crescente diffusione di smartphone, smartwatch e piattaforme di telemedicina rende oggi possibile raccogliere campioni vocali in modo semplice, economico e non invasivo. In futuro, sistemi basati sull'intelligenza artificiale potrebbero facilitare lo screening precoce dei pazienti disfonici, supportare il monitoraggio dopo il trattamento e contribuire a individuare rapidamente situazioni che richiedono una valutazione specialistica. Naturalmente nessun algoritmo è destinato a sostituire l'esame endoscopico o il giudizio clinico dell'otorinolaringoiatra. Più realisticamente, queste tecnologie potrebbero diventare strumenti di supporto capaci di migliorare l'accessibilità alle cure e anticipare il sospetto diagnostico. La sfida dei prossimi anni sarà trasformare risultati oggi confinati ai laboratori di ricerca in strumenti validati, affidabili e realmente utilizzabili nella pratica clinica. I dati disponibili ad oggi rappresentano ancora una prova di concetto, ma indicano una direzione precisa: la diagnosi delle patologie della voce potrebbe iniziare molto prima dell'ingresso in ambulatorio, semplicemente ascoltando ciò che il paziente ha da dire.
Andrea Carobbio
Articoli di riferimento
10 Ottobre 2026
2026 © Copyright ORL.NEWS - Eureka Srl - C.F. e P.I. 01841430463
Testata giornalistica registrata presso il Tribunale di Milano (n.35 del 26/02/2020)
Consulta l'informativa sulla privacy e cookie policy | Contatti