Amazon sta usando l’intelligenza artificiale per sviluppare nuovi stili di parlato per Alexa, inclusa una voce da giornalista per leggere articoli
Alexa di Amazon continua a imparare nuovi trucchi e la voce parlante in stile giornalista verrà lanciata sui dispositivi abilitati tra poche settimane.
Puoi ascoltare di seguito i campioni dello stile del parlato e i risultati parlano da soli. La voce non può essere confusa con un umano, ma incorpora l’enfasi nelle frasi nello stesso modo che aspetteresti da un giornalista televisivo o radiofonico.
Amazon afferma che il nuovo stile è reso possibile dallo sviluppo della tecnologia “neurale text-to-speech” o NTTS; questa è la prossima generazione di sintesi vocale, che usa il machine learning per generare più velocemente voci espressive. Attualmente, Alexa usa la sintesi vocale concatenativa, un metodo che esiste da decenni: ciò comporta la suddivisione degli esempi di parlato in suoni distinti (noti come fonemi) e quindi la concatenazione per formare nuove parole e frasi.
Stile concatenativo:
NTTS standard
NTTS in stile newscaster
La sintesi vocale concatenativa può produrre risultati sorprendentemente buoni, ma i nuovi metodi con AI superano rapidamente i limiti precedenti. Lo scorso ottobre, Google ha lanciato una nuova forma di sintesi vocale per l’Assistente Google che utilizza tecniche di machine learning sviluppate dal laboratorio di intelligenza artificiale di Londra DeepMind. Amazon ha affermato che Alexa dovrebbe passare alla sintesi neurale vocale (completa con la voce da giornalista) “nelle prossime settimane”. È plausibile che tale implementazione, però, possa comportare un’attesa maggiore per l’Italia.
La voce da giornalista è stata creata registrando clip audio da canali di notizie reali, utilizzando, poi, il maschile learning per individuare gli schemi nel modo in cui i giornalisti leggono il testo. Amazon ha affermato che questo approccio cattura più facilmente i dettagli negli stili di espressione umana.
In particolare, Amazon sostiene che ci sono volute solo poche ore di dati per insegnare ad Alexa la voce da giornalista, suggerendo che un’intera gamma di stili potrebbe essere facilmente incorporata in futuro. Finora, Amazon ha già aggiunto una modalità sussurrata per Alexa, e dopo l’aggiornamento a NTTS nelle prossime settimane potremo probabilmente aspettarci una serie di nuovi voci che andranno, man mano, ad essere implementate nel corso del 2019.
Nel Processo Musk contro OpenAI riemerge il Dossier Sutskever, 52 pagine di accuse interne che…
Anthropic affitta tutta la capacità del data center Colossus 1 di SpaceX a Memphis: oltre…
Cloudflare licenzia il 20% del personale perchè ha introdotto l'AI-Agentica, una spietata nuova efficienza algoritmica…
Al Brussels Economic Forum il premio Nobel per l'Economia 2025 Philippe Aghion smonta il pessimismo…
Il Brussels Economic Forum 2026 si apre con un discorso che non lascia dubbi: o…
Quando un’azienda decide di investire sull’intelligenza artificiale si concentra su GPU, modelli, dati e spesso…
Via Italia 50, 20900 Monza (MB) - C.F. e Partita IVA: 03339380135
Reg. Trib. Milano n. 409 del 21/7/2011 - ROC n. 21424 del 3/8/2011