Il boom degli investimenti nella IA vocale
Nel corso degli ultimi anni, investitori hanno versato miliardi di dollari in start‑up di IA vocale, spingendo lo sviluppo di soluzioni che vanno dalla creazione di modelli a fornitori di servizi clienti per le imprese, fino ai sistemi di trascrizione automatica e ai tool per prendere appunti in meeting. Ogni settimana emergono nuovi modelli e strumenti che promettono di imitare la voce umana e di conversare come un essere umano. Tuttavia, la realtà è che la voce artificiale non ha ancora raggiunto il suo “momento ChatGPT”, secondo il CTO di PolyAI, Shawn Wen.
PolyAI e la ricerca del ragionamento veloce
PolyAI ha raggiunto un traguardo importante: i suoi modelli full‑duplex possono parlare mentre ascoltano contemporaneamente. Wen ha dichiarato che il passo successivo consiste nel rendere il ragionamento molto più rapido, in modo che la risposta venga restituita in tempo reale e la conversazione sembri naturale. Ha inoltre sottolineato che gli agenti vocali del servizio clienti non devono suonare robotici; devono conferire fiducia al chiamante. Se la voce è convincente e il cliente interagisce per i primi due o tre turni, può iniziare a fidarsi dell’agente e a sentirsi libero di non parlare con un umano se l’agente risolve il problema.
Otter e i digital twins per le riunioni
Alex Gay, CMO di Otter, ha evidenziato che l’identificazione del parlante, la cattura dell’intento e l’integrazione con la conoscenza organizzativa sono passi fondamentali per l’automazione. La compagnia sta inoltre sviluppando digital twins che rappresentano le persone presenti in una riunione. Per questa tecnologia, Gay ha affermato che la voce emessa deve trasmettere le stesse espressioni emotive di una conversazione reale. Senza questa qualità, il risultato è solo un chatbot di tipo Q&A.
Le sfide della comprensione e della trasparenza
Nonostante i progressi, gli assistenti vocali spesso non comprendono gli utenti, producendo trascrizioni errate o riassunti imprecisi. Wen sostiene che i modelli ASR (Automatic Speech Recognition) tendono a perdere parole chiave importanti, creando problemi di contesto. Gay ha confermato questa osservazione e ha aggiunto che la lingua è un’area in cui i modelli vocali devono migliorare. Per Otter, la trascrizione non è un obiettivo finale, ma un livello che consente di guidare i guadagni di produttività. Se la trascrizione originale non è accurata, tutte le azioni successive diventano difettose, minando la fiducia nella piattaforma.