Visualizzazione post con etichetta Google Home. Mostra tutti i post
Visualizzazione post con etichetta Google Home. Mostra tutti i post

martedì 19 ottobre 2021

Pieraccini, AI Assistants


 
Copertina di Roberto Pieraccini, AI Assistants
A parer mio, i moderni assistenti digitali sono prodotti di estremo interesse per la linguistica e potrebbero avere sviluppi rivoluzionari in particolare nell’insegnamento delle lingue. Quasi quattro anni fa (!) ne avevo parlato nel mio Lingue e intelligenza artificiale, ma negli anni seguenti lo sviluppo è stato notevolissimo. Tanto per dirne una, quando il mio libro è uscito non erano ancora arrivati in Italia gli altoparlanti intelligenti, come i sistemi Alexa di Amazon e Google Home, e i sistemi di dialogo in commercio avevano appena iniziato a mantenere il contesto della conversazione…
 
Eppure, nonostante gli sviluppi e le promesse, le pubblicazioni in proposito sono state ben poche. Solo negli ultimi mesi sono finalmente comparsi alcuni libri che descrivono in modo sistematico i moderni assistenti digitali, che fino a oggi erano descritti in sostanza solo dalle pubblicazioni specialistiche (con molte informazioni rimaste implicite nelle conoscenze dei ricercatori) o da istruzioni per l’uso come quelle di Dialogflow.
 
Del secondo di questi libri, Hey, Cyba!, conto di parlare più avanti. Qui invece vorrei parlare di AI Assistants, che, firmato da Roberto Pieraccini per la collana Essential Knowledge del MIT, finalmente descrive in modo sistematico il funzionamento degli assistenti digitali moderni.
 
Da un certo punto di vista il libro può essere considerato un’appendice o una continuazione dell’ottimo The Voice in the Machine dello stesso autore. Buona parte dello spazio, in effetti, è dedicata, più che agli assistenti digitali in sé, ai loro prerequisiti, cioè allo sviluppo delle tecnologie vocali dal dopoguerra a oggi. Questa storia era già stata raccontata in dettaglio appunto da The Voice in the Machine, ma la sovrapposizione tra i due libri è più ridotta di quanto si potrebbe immaginare: l’autore ha trattato il tema in modo nuovo. E soprattutto, queste informazioni sono importanti per comprendere molti aspetti del funzionamento degli assistenti digitali.
 
Una simile scelta fa sì che le caratteristiche specifiche degli assistenti digitali in quanto tali siano presentate solo nei due ultimi capitoli: il sesto, dedicato a The Dialog Manager, e il settimo, Interacting with an Assistant. Chi si sente già preparato sui modelli di Markov nascosti o sulle difficoltà connesse alla generazione del parlato potrebbe quindi essere tentato di saltare direttamente a questi… ma credo che sarebbe un peccato, perché la descrizione delle fasi precedenti è comunque interessante in questa nuova prospettiva.
 
Inoltre, molte delle informazioni presentate sono sì diffuse nell’ambiente, ma poco formalizzate e descritte. Questo fa sì che il testo fornisca informazioni difficilissime da ricostruire per gli esterni, come questa descrizione dello stato dell’arte per la gestione di pronomi e frasi incomplete:
 
Modern assistants are able to manage referential pronouns and incomplete sentences (called elliptical sentences) based on algorithms that unravel the structure of each query, determine whether the query is incomplete and missing elements such as the specific subject or intent, and try to answer it by resolving the missing elements with the right information. Those algorithms are based on a mix of language rules and the results of data analysis on large corpora of queries done in the past and aggregated over all the users (p. 169).
 
In questo punto, e in molti altri, non ci sono rinvii a fonti di informazione specifiche, e la cosa non mi sorprende. Dove si dovrebbero trovare, del resto?
 
In quanto alle modalità di esposizione, sono fondamentalmente non tecniche (e corrette e approfondite per quanto riguarda le componenti linguistiche). Tuttavia, come già succedeva in The Voice in the Machine, in alcuni punti sono molto sintetiche: nelle parti più tecniche è difficile che il lettore non informato possa comprendere tutto ciò che viene detto.
 
L’esposizione arriva però anche al personale nell’ultimo capitolo. Pieraccini, viareggino, laureato in Ingegneria a Pisa, ha lavorato a Torino al CSELT per poi spostarsi oltreoceano ai mitici Bell Labs e da lì a molte delle principali aziende del settore, avendo occasione di contribuire in prima persona a molti degli sviluppi descritti qui (adesso è Director of Engineering per Google Assistant a Zurigo). Uno di questi contributi ha riguardato lo sviluppo del “robot sociale” Jibo, che ha avuto una storia complessa e ha lasciato un segno importante, apparentemente, sia nella comunità degli sviluppatori sia tra gli utenti. Le pagine dedicate a questo argomento, oltre a essere tra le più interessanti nella mia prospettiva, mostrano un coinvolgimento non superficiale.
 
In definitiva: il libro è caldamente raccomandato a chiunque sia interessato a questi argomenti.
 
Roberto Pieraccini, AI Assistants, Cambridge (Massachusetts), MIT Press, 2021, pp. 288 (edizione tascabile), ISBN (edizione tascabile) 978-0-26254255-5, letto nell’edizione Kindle, ASIN B08PY9X5YF, € 10,99.
 

venerdì 24 luglio 2020

Tavosanis, Misurazione del lessico specialistico nei sistemi per il trattamento automatico del parlato

  
 
Copertina di: Linguaggi settoriali e specialistici
Ho appena ricevuto una copia del corposo volume Linguaggi settoriali e specialistici curato da Jacqueline Visconti, Manuela Manfredini e Lorenzo Coveri. Il volume presenta gli atti del XVI congresso della Società Internazionale di Linguistica e Filologia Italiana, tenuto a Genova nel 2018, e al suo interno c’è anche un mio contributo.
 
Il contributo è dedicato alla Misurazione del lessico specialistico nei sistemi per il trattamento automatico del parlato. In pratica, presenta i risultati di due indagini sul modo in cui la terminologia specialistica in italiano viene gestita dai sistemi commerciali di riconoscimento del parlato.
 
La prima indagine ha riguardato la capacità di definizione di terminologia specialistica da parte di Google Home: su 21 termini selezionati a caso nel dizionario di De Mauro, per 13 è stata fornita la definizione corretta; per 8 è stata fornita la definizione di una parola sbagliata ma affine foneticamente; per 4 è stato fornito un messaggio di errore. Non c’è niente di sorprendente in questo, visto che spesso anche gli esseri umani, fuori contesto, hanno problemi a decidere se una richiesta di chiarimento riguarda la catàstasi o la catarsi, il floccaggio o il bloccaggio, il widia o la lìbia, ‘donna libica’. Semmai, migliorare la capacità di definizione richiede fare ricorso a una base dati più ampia (questa funzione di Google si basa sul dizionario Devoto-Oli ripreso da WordReference). Inoltre, i dubbi di pronuncia potrebbero venir risolti spiegando chiaramente all’utente che può dettare le parole lettera per lettera (una possibilità già attiva); e questo è solo un problema di interfaccia, non di distanza dalla prestazione umana.
 
La seconda indagine ha riguardato la trascrizione attraverso le Google Cloud Speech API di due video tutorial tecnici pubblicati su YouTube. I video riguardavano rispettivamente:


In entrambi i video, la registrazione è semiprofessionale e i parlanti presentano un accento regionale non forte ma ben percepibile. Il WER complessivo, cioè il numero di parole trascritte male, o non trascritte, è stato del 21,8% in un caso, del 12,3% dell'altro, ma il grosso degli errori riguarda interiezioni o parole poco rilevanti. Per quanto riguarda la terminologia, invece, gli errori sono stati pari solo al 6,25% nel primo caso e assenti nel secondo. Questo è molto incoraggiante per quanto riguarda le possibilità di sottotitolatura automatica… che del resto, nel frattempo, sono state potenziate da Google proprio su YouTube (le mie misurazioni risalgono al 2018, e spero che adesso il livello sia più alto).
 
In conclusione, la terminologia sembra gestita da questi strumenti in modo soddisfacente quando è presentata in un contesto. In ciò non c’è nulla di sorprendente; però, per valutare davvero la qualità, e capire se ci sono sviluppi interessanti o meno, è importante fare valutazioni quantitative ed esaustive.
 
Mirko Tavosanis, Misurazione del lessico specialistico nei sistemi per il trattamento automatico del parlato, in Linguaggi settoriali e specialistici. Sincronia, diacronia, traduzione, variazione. Atti del XV Congresso SILFI – Società Internazionale di Linguistica e Filologia Italiana (Genova, 28-30 maggio 2018), a cura di Jacqueline Visconti, Manuela Manfredini e Lorenzo Coveri, Firenze, Cesati, 2020, pp. 451-456, € 45, ISBN 978-88-7667-817-2. Copia autore ricevuta dall’editore.
 

giovedì 25 luglio 2019

Tavosanis, Dai computer come strumenti di comunicazione ai computer che parlano e scrivono

 
Copertina di: L'italiano che parliamo e scriviamo
Ho ricevuto da poco un nuovo libro, L’italiano che parliamo e scriviamo, curato da Sabina Gola. Pubblicato con il contributo dell’Istituto Italiano di Cultura di Bruxelles, il libro prende le mosse dal convegno organizzato appunto a Bruxelles da Sabina Gola nel 2017. Gli interventi presentati vanno però oltre i temi originali e offrono una serie di interessanti approfondimenti su varie sfaccettature dell’italiano contemporaneo.
 
All’interno c’è anche un mio contributo: Dai computer come strumenti di comunicazione ai computer che parlano e scrivono (pp. 67-77). Ovviamente, il tema è collegato a quanto ho scritto nel mio libro su Lingue e intelligenza artificiale; tuttavia, avendo qualche mese in più a disposizione, in questo contributo sono riuscito a fare qualche accenno anche a novità successive all’uscita del libro. Una sezione del testo parla quindi di “altoparlanti intelligenti”, cioè in sostanza di Google Home e Amazon Echo, divenuti disponibili in italiano solo nel corso del 2018. Un’altra accenna agli sviluppi delle tecniche di conversazione, facendo riferimento anche al premio Alexa.
 
Tutto questo rende il contributo, spero, un aggiornamento interessante su quanto detto nel libro. Sarebbe importante riuscire poi a continuare il lavoro, e chissà che non ce ne sia l’occasione…
 
In aggiunta a questo, nel libro sono presenti numerosi altri contributi di rilievo. Mi limito qui a segnalarne uno, La punteggiatura italiana contemporanea tra (neo)standard e lingua mediata dalla rete. Il caso della virgola e dei puntini di sospensione, di Angela Ferrari e Filippo Pecorari (pp. 43-55). Di particolare interesse qui è il trattamento di ciò che viene chiamato “virgola enunciativa”, collocata a cavallo di due enunciati al posto di un punto, di un punto e virgola o dei due punti. Si nota in particolare che nella comunicazione in rete la virgola “sembra essere il segno preferenziale” in uno dei casi in cui viene evitata nello standard: il cambio di funzione illocutiva (p. 49). Quindi si trova spesso per esempio quando si passa da una dichiarazione a una domanda, o, come in questo caso (preso da un forum), da un ringraziamento a un’asserzione:
 
volevo ringraziarti anticipatamente per la tua disponibilità, io sono nuova del forum ma ho trovato davvero utile il tuo mess
 
Anche su questa base, si osserva poi che “dal punto di vista della testualità, la scrittura elettronica è dunque altrettanto lontana dal (neo)standard che dal parlato: un aspetto che non viene mai osservato, ma che è cruciale per capire la specificità della lingua mediata dalla rete” (p. 50). Lato mio, mi sembra di averlo osservato spesso, in particolare nel mio lavoro su L’italiano del web; ma l’importante è che queste distanze vengano studiate e appropriatamente interpretate.
 
Mirko Tavosanis, Dai computer come strumenti di comunicazione ai computer che parlano e scrivono, pp. 67-77, in L’italiano che parliamo e scriviamo, a cura di Sabina Gola, Firenze, Cesati, 2019, pp. 145, € 18, ISBN 978-88-7667-771-7. Copia autore ricevuta dall’editore.
 
Creative Commons License
Blog di Mirko Tavosanis by http://linguaggiodelweb.blogspot.com is licensed under a Creative Commons Attribuzione-Non opere derivate 2.5 Italia License.