Visualizzazione post con etichetta Traduzione automatica. Mostra tutti i post
Visualizzazione post con etichetta Traduzione automatica. Mostra tutti i post

martedì 21 luglio 2026

Aperte le iscrizioni al Master in Traduzione specialistica


 
Sono aperte le iscrizioni alla XIX edizione del Master in Traduzione specialistica di cui sono direttore. Il Master, online, è erogato congiuntamente dalle università di Pisa e Genova; tutte le informazioni sono qui disponibili sul sito del Master
 
Per alcune considerazioni sul Master (e sulla traduzione oggi) rimando anche a questo post dello scorso anno.
 

martedì 26 maggio 2026

Traduzione automatica a Cracovia

 
Lenticchie e birra sullo sfondo della valle dell'Adige
Sono in viaggio per il convegno SILFI 2026 a Cracovia: domani, 27 maggio, parlerò su un tema che ben conosco: la Valutazione dell’italiano delle traduzioni eseguite da LLM. In questo momento, a bordo del RailJet 84 delle ferrovie austriache, sto risalendo la valle dell’Adige... spettacolare quando uno può guardarla per bene senza dover tener gli occhi fissi sulla strada!
 
Per quanto riguarda il mio lavoro, a inizio intervento conto di presentare quattro punti che sono un po’ premesse e un po’ conclusioni:
  1. Verso l’italiano, i sistemi attuali producono per alcuni tipi di testo e per alcune lingue di partenza traduzioni di livello paragonabile a quello di una buona traduzione umana non sottoposta a un’ultima revisione
  2. Di fronte a traduzioni di questo tipo, prive di indicazione d’origine, spesso anche dei valutatori esperti non riescono a distinguere tra traduzione umana e traduzione automatica
  3. Almeno in alcuni ambiti, gli LLM generalisti come ChatGPT forniscono traduzioni di qualità superiore a quella di sistemi specializzati come DeepL
  4. Come per i traduttori umani, gli LLM producono regolarmente esempi di traduttese
Dico “un po’ premesse e un po’ conclusioni” perché lo stato di cose che descrivo mi sembra ormai accettato, nelle linee generali, ma poco documentato (soprattutto per l’italiano). Io spero di contribuire a documentarlo mostrando in particolare i risultati di una valutazione compiuta con gli studenti della laurea magistrale in Linguistica e traduzione dell’Università di Pisa. Abbiamo condotto le prove su brevi sezioni iniziali di tre romanzi, tra cui l’ultimo di McEwan e il sempre caro Nova di Samuel R. Delany, confrontando il lavoro di ChatGPT e DeepL con la venerabile traduzione di Renato Prinzhofer pubblicata a suo tempo dalla Nord.
 
E a parte questo… a Cracovia ci vado in treno! Purtroppo non ho fondi sufficienti a permettermi di fare in treno anche il viaggio di ritorno, per il quale dovrò ripiegare sull’economico volo Ryanair diretto da Cracovia a Pisa. Ma almeno all’andata si va in modo più sostenibile, da Ripafratta e cambi a Pisa Centrale, Firenze Santa Maria Novella, Verona Porta Nuova e Rosenheim, con arrivo auspicato domattina alle 7 a Cracovia Centrale (Kraków Główny)!
 

lunedì 4 novembre 2024

Narayanan e Kapoor – AI Snake Oil

 
Era l’ora! Ecco un libro che posso consigliare senza riserve a proposito delle possibilità dell’“intelligenza artificiale” attuale: AI Snake Oil di Arvind Narayanan e Sayash Kapoor. 
  
Le mie esperienze sulla valutazione sono molto in sintonia con il sottotitolo del libro, What Artificial Intelligence Can Do, What It Can't, and How to Tell the Difference. Il titolo, però, potrebbe risultare opaco al lettore italiano. Gli autori per fortuna ne chiariscono il significato nel primo capitolo, Introduction, rinviando ai venditori di “olio di serpente” (snake oil) diffusi negli Stati Uniti tra la fine dell’Ottocento e i primi del Novecento. L’“olio di serpente” era infatti ritenuto in grado di curare un po’ tutti i problemi di salute: dai reumatismi ai morsi di animale al mal di denti. Ovviamente, non funzionava. Il che però non impediva ai venditori di arricchirsi con il prodotto, che oltretutto spesso, come notano gli autori, in realtà non conteneva davvero “olio di serpente”. Allo stesso modo,
 
AI snake oil is AI that does not and cannot work, like the hiring video analysis software that originally motivated the research that led to this book. The goal of this book is to identify AI snake oil—and to distinguish it from AI that can work well if used in the right ways. While some cases of snake oil are clear cut, the boundaries are a bit fuzzy. In many cases, AI works to some extent but is accompanied by exaggerated claims by the companies selling it. That hype leads to overreliance, such as using AI as a replacement for human expertise instead of as a way to augment it (p. 28).
  
Gli autori notano poi come buona parte delle esagerazioni sia riconducibile al fatto che l’etichetta di “intelligenza artificiale” (IA) viene assegnata a sistemi molto diversi tra di loro. E fanno quindi una distinzione tanto ragionevole quanto forte tra IA “predittive” e IA “generative”.
 
Il secondo capitolo, intitolato How Predictive AI Goes Wrong, viene quindi dedicato a mostrare il modo in cui le IA “predittive” hanno collezionato una serie imponente di insuccessi. Gli autori insistono anche sul fatto che questi sistemi vengono già utilizzati in molti contesti per fare previsioni su questioni di assoluta rilevanza – in particolare nel sistema giudiziario degli Stati Uniti (con sistemi come ORAS e PSA: p. 51) – con esiti non solo pessimi in generale ma chiaramente punitivi per i gruppi sociali svantaggiati: esempi non solo di “how AI tools search under the streetlight” ma di come “More often than not, the streetlight is pointed at the poor” (p. 53).
 
Il secondo capitolo si conclude con alcune ipotesi sul perché, nonostante gli evidenti limiti, i sistemi predittivi sono così popolari. Gli autori ritengono che al di là delle motivazioni pratiche, ci siano anche cause psicologiche profonde:
 
part of the reason surely is that decision-makers are people—people who dread randomness like everyone else. This means they can’t stand the thought of the alternative to this way of decision-making—that is, acknowledging that the future cannot be predicted. They would have to accept that they have no control over, say, picking good job performers, and that it’s not possible to do better than a process that is mostly random (p. 57).
 
Non so quanto essere d’accordo con questo, ma ho pochi elementi per esprimermi in un senso o nell’altro! In fin dei conti, i sistemi predittivi vengono usati soprattutto negli Stati Uniti: in Italia non mi sembrano particolarmente popolari e non ne ho mai sentito incoraggiare l’uso, per esempio, nei concorsi pubblici o nei tribunali.
 
Di applicazione più generale è il capitolo 3, Why Can’t AI Predict the Future? Qui viene presentata innanzitutto una storia di tentativi (falliti) di usare il computer per predire il futuro. Gli autori notano però che non tutte le predizioni sono impossibili: alcune sono perfettamente possibili e normalmente usate. Quel che conta è imparare a distinguere tra ciò che in effetti funziona abbastanza da avere applicazioni pratiche (a cominciare dalle previsioni del tempo) e ciò che invece non funziona per nulla (le previsioni delle agitazioni sociali, o del mercato azionario). Un esempio discusso in dettaglio (da p. 69) è quello della Fragile Families Challenge, uno studio su larga scala condotto per cercare di prevedere gli esiti di vita (voti scolastici e simili) di un campione molto ampio di bambini nati attorno al Duemila. Nonostante la partecipazione di numerosi gruppi di ricerca, anche i migliori modelli sviluppati e basati su IA “were only slightly better than a coin flip” e non sono riusciti a ottenere previsioni migliori di quelle basate su indicatori molto semplici (p. 73).
 
Gli autori notano poi l’incapacità attuale, anche da parte dei migliori esperti, di prevedere in dettaglio successi o fallimenti nell’industria del cinema o della musica, oltre che nei meme. Alcuni dei limiti sono dovuti a vincoli pratici, come la scarsa disponibilità di dati pertinenti; altri però sembrano strutturalmente impossibili da superare (p. 97).
 
Molto diverso è il tono del quarto capitolo, The Long Road to Generative AI. Gli autori esordiscono infatti chiarendo che in questo caso “the technology is powerful and the advances are real” (p. 99). 
Chi segue il mio lavoro conoscerà le mie osservazioni sulla difficoltà di valutare le IA generative, da ChatGPT in giù. Narayanan e Kapoor descrivono il problema in questi termini:
 
Some products do what it says on the tin. Others don’t work at all. In between those two extremes are products that are useful but oversold. Each of these can be harmful, in different ways. Generative AI is a mixed bag.(…) The varied landscape of generative AI applications resists a simple characterization of the limits of the technology (pp. 103-104).
 
Detto questo, gli autori passano a descrivere anche i successi, insistendo in particolare sull’importanza della competizione ImageNet per la classificazione di immagini a partire dal 2020 (p. 111). Insistono poi anche sul ruolo importante del recente premio Nobel Geoffrey Hinton in quanto inventore dalla tecnica di “backpropagation”. Ma notano anche i problemi connessi al fatto che competizioni e tecniche del genere sono poi andate avanti senza coinvolgere gli esperti dei settori su cui le tecniche operavano, creando dinamiche di autoreferenzialità.
 
Vale la pena di notare anche le ragionevoli posizioni degli autori riguardo alla questione di quanto le attività di cui sono capaci i sistemi siano vera comprensione:
 
Understanding is not all or nothing. Chatbots may not understand a topic as deeply or in the same way as a person—especially an expert—might, but they might still understand it to some useful degree. (…) Chatbots “understand” in the sense that they build internal representations of the world through their training process. Again, those representations might differ from ours, might be inaccurate, and might be impoverished because they don’t interact with the world in the way that we do. Nonetheless, these representations are useful, and they allow chatbots to gain capabilities that would be simply impossible if they were merely giant statistical tables of patterns observed in the data. (…) we know that language models learn the structure of language, even though they don’t have grammatical rules programmed into them (pp. 137-138).
 
Non sorprendentemente, gli autori poi ipotizzano che tutte le preoccupazioni sul modo in cui i sistemi generativi possano essere usati per esempio per manipolare elezioni siano esagerate (p. 147). Il vero rischio si colloca invece nelle modalità di sfruttamento economico (p. 148).
 
Con questa ragionevolissima impostazione, non sorprende che la risposta alla domanda posta nel titolo del capitolo 5, Is Advanced AI an Existential Treat? sia un semplice “no”. La domanda più interessante è allora: perché diverse persone intelligenti credono a una cosa tanto assurda? La spiegazione degli autori accosta ai ben evidenti motivi di profitto anche fattori di altro tipo, come la continua tentazione di ognuno ad assegnare importanza cosmica al proprio lavoro.
 
Molto simile è anche l’impostazione del capitolo 5, Why Can’t AI Fix Social Media? I sistemi di “content moderation” (‘moderazione dei contenuti’) vengono qui considerati un terzo tipo di IA, in aggiunta a quelle predittive e generative. Anche qui, però, come nel caso delle IA predittive, i fallimenti sono evidenti – e sono evidenti anche gli abusi.
 
Su questa base, il sesto capitolo si chiede Why Do Myths about AI Persist? Un punto importante è l’applicazione meccanica di semplici cliché sul modo in cui le tecnologie avanzano. Ma vorrei conservare soprattutto una citazione rilevante a proposito dei meccanismi con cui le esagerazioni si autoalimentano:
 
performance on benchmark datasets overestimates the usefulness of AI in the real world. As we saw in chapter 4, the dominant way to determine the usefulness of AI is through benchmark datasets. But benchmarks are wildly overused in AI. They have been heavily criticized for collapsing a multidimensional evaluation into a single number. When used as a way to compare humans and bots, the results can mislead people into believing that AI is close to replacing humans (p. 241).
 
E una citazione sul confronto con la realtà, e su quanto anche i premi Nobel possano dire stupidaggini perfino nel loro campo:
 
Researchers also misuse language to imply that AI tools perform better than they actually do—for instance, by implying that they have human-level reading comprehension, when the only evidence is on a benchmark dataset instead of evaluations in the real world. This culture is exemplified by a dismissive attitude toward domain experts that many AI researchers and developers hold. In 2016, AI pioneer Geoffrey Hinton claimed: “If you work as a radiologist, you’re like the coyote that’s already over the edge of the cliff but hasn’t yet looked down, so doesn’t realize there’s no ground underneath him. People should stop training radiologists now. It’s just completely obvious that within five years, deep learning is going to do better than radiologists.” In 2022, there was a worldwide shortage of radiologists. AI has not even come close to replacing radiologists (pp. 238-239).
 
Detto questo, gli autori si mettono alla prova nel capitolo 8, Where Do We Go from here?. Citano i problemi con i sistemi di identificazione dei testi generati, incoraggiano ad accettare la casualità di molte valutazioni, notano l’impatto reale sui traduttori e così via. E poi descrivono due scenari futuri, visti attraverso gli occhi di due bambini d’invenzione, Kai e Maya. Nel mondo di Kai gli errori legislativi e di sviluppo portano a uno scenario in cui l’applicazione dell’IA devasta la scuola e la vita sociale; nel mondo di Maya, frutto di scelte più sensate, l’IA porta invece un aiuto reale in molte situazioni. Per scegliere l’uno invece dell’altro, gli autori notano che sono necessarie competenze e riflessioni approfondite, non la riproposizione di luoghi comuni. E su questo, come su molte altre delle loro osservazioni, non posso che concordare.
 
Una citazione finale da conservare, con un concetto che sta alla base anche di molte delle mie idee sul modo in cui devono essere valutate le capacità dei sistemi generativi:
 
Medical researchers perform RCTs [randomized controlled trials] despite their slow pace and high expense for a simple reason—easier, faster methods don’t work. The same is true in many areas where AI is used for automated decision-making (p.45).
 
Arvind Narayanan e Sayash Kapoor, AI Snake Oil: What Artificial Intelligence Can Do, What It Can’t, and How to Tell the Difference, Princeton, Princeton University Press 2024, edizione Kindle. € 18,19, ISBN 9780691249643.

Piccola nota storica: agli interessati della mia generazione, il titolo del libro ricorderà quello di Silicon Snake Oil di Clifford Stoll, uscito nel 1995 e con un’impostazione simile. Stoll, però, non viene mai citato da Narayanan e Kapoor. L’omissione può essere motivata facilmente: il libro di Stoll, che ahimè non ho letto, era una critica radicale a Internet e viene normalmente citato come esempio di totale fallimento nelle predizioni. Per esempio, prevedeva che il commercio elettronico non sarebbe mai decollato e che i giornali non sarebbero mai stati rimpiazzati dalle pubblicazioni online… Non avendolo mai letto non so quanto fossero ragionevoli le argomentazioni pubblicate. Di sicuro, il libro di Narayanan e Kapoor brilla invece per la sua prudenza e per la competenza mostrata dagli autori, oltre che per la sua leggibilità.
 

martedì 2 maggio 2023

Intervento su lingue franche e traduzione automatica


 
Sono stato invitato alla Scuola Lingue Estere dell’Esercito a Perugia per parlare domani, mercoledì 3 maggio, a proposito di un tema che mi interessa molto: Dalle lingue franche alla traduzione automatica. L’intervento si inserisce nel convegno su La comunicazione dei valori in pace e in guerra, organizzato dalla Scuola Lingue Estere dell’Esercito e dall’Università degli Studi di Perugia. Il tema generale, come si vede, è purtroppo di particolare attualità. Spero quindi che il mio intervento – centrato sulla lingua franca storica e sulle lingue franche in generale – possa essere un piccolo ma utile contributo alla riflessione. Durante l’intervento saranno menzionati, tra gli altri, Pietro Della Valle e la moglie Sitti Maani, un giapponese che parlava latino in Persia nel Seicento e i Google Smart Glasses…
 

mercoledì 16 dicembre 2020

Papa e Tavosanis, Valutazione umana di DeepL a livello di frase per le traduzioni di testi specialistici dall'inglese verso l'italiano


 
Logo di CLiC-it 2020
Vale davvero la pena tenere d’occhio gli sviluppi della traduzione automatica… è uno dei rarissimi casi in cui la tecnologia è più avanti di quel che sembra!
 
Adesso è appena uscito un contributo scritto da un bravo studente, Sirio Papa, e da me: Valutazione umana di DeepL a livello di frase per le traduzioni di testi specialistici dall’inglese verso l’italiano. Il contributo appare negli atti del convegno CLiC-it 2020, che avrebbe dovuto tenersi quest’anno ma che è stato spostato al marzo 2021: speriamo possa tenersi in presenza.
 
I risultati del lavoro, per quanto incredibile ciò ancora mi sembri, confermano altri studi recenti, in cui si è parlato molto di raggiungimento della “parità” tra traduzione automatica e traduzione umana. Per quanto riguarda l’“adeguatezza”, cioè in sostanza la correttezza dei contenuti, nel mio campione la traduzione automatica è risultata al livello di quella umana. Non arriva invece al livello di quella umana per la “scorrevolezza”, definendo in questo modo il rispetto di tutte le regole grammaticali, l’uso delle collocazioni tipiche di una lingua, eccetera, ma la differenza è davvero ridottissima. Di tutto questo ho già parlato l’anno scorso, parlando della presentazione fatta a Bari e del contributo pubblicato

In quanto ai risultati del lavoro appena uscito, che confermano e rafforzano i precedenti, sono stati ottenuti sottoponendo a un gruppo di 15 valutatori le traduzioni di 108 frasi inglesi. Di ogni frase sono state valutate due diverse versioni, una tradotta da esseri umani e l’altra tradotta da DeepL. Le frasi sono state divise in due gruppi e presentate ai valutatori in ordine casuale, senza informazioni su chi avesse tradotto ogni singola frase. I risultati complessivi, in scala da 1 a 5, sono stati questi:
 
Adeguatezza 
  • Umano: 4,29 
  • DeepL: 4,31
Scorrevolezza 
  • Umano: 4,17 
  • DeepL: 4,09
Insomma, la traduzione automatica ha ricevuto addirittura un punteggio più alto di quello della traduzione umana per quanto riguarda l'adeguatezza, ma la differenza è tanto ridotta da non essere statisticamente significativa: in pratica, si tratta di parità. È invece statisticamente significativo il vantaggio del traduttore umano per la scorrevolezza… ma, come si vede, il margine è comunque molto, molto ridotto.
 
Se al di là dei numeri interessano gli aneddoti, poi, forse è il caso di raccontarne uno. Quando ho ricevuto il documento con le frasi estratte a caso da traduzioni eseguite da DeepL, l’ho scorsa e ho contattato il mio coautore, dicendo: “ci deve essere un errore! Queste mi sembrano le frasi tradotte da traduttori umani”. La risposta, come si sarà immaginato, è stata: “no, no, sono proprio quelle di DeepL”…
 
Vale poi la pena di precisare due cose importanti. La prima è che la valutazione è stata condotta, a differenza dei miei esperimenti precedenti, su testi specialistici: brevetti, manuali, schede di sicurezza. I settori di provenienza erano “biomedicina e discipline del farmaco” e “ambiente ed energia”. E prima di fare la valutazione, confesso che non avevo idea di che cosa sarebbe venuto fuori: questi testi si prestano bene alla traduzione automatica, perché per esempio la sintassi è più rigida di quella di altri tipi di testo? O si prestano male, perché per esempio le difficoltà nella traduzione della terminologia sono insormontabili? Direi che i risultati, come minimo, garantiscono che le difficoltà non sono insormontabili.
 
La seconda cosa, connessa, è che la valutazione è stata condotta grazie al contributo volontario degli studenti e dei docenti (in particolare, delle professoresse Isabella Blum e Silvia Barra) del Master on line in Traduzione specialistica inglese > italiano erogato dal Consorzio ICoN: li ringrazio tutti sentitamente! Il loro coinvolgimento è stato essenziale perché, com’è ovvio, non si può valutare la qualità della traduzione se non si sa che cosa significa il testo originale, o anche solo se determinate parole esistono o no nell’uso italiano.
 
Prossimi sviluppi? Probabilmente passare a valutare testi interi, non più singole frasi. La cosa è difficile e pone anche problemi metodologici (come si fa a nascondere al valutatore l’origine anche solo di un articolo di giornale? Per rendere evidente la provenienza basta che sia presente all’interno anche un solo errore che un essere umano non commetterebbe mai); ma un paio di idee le ho, e forse potrò provare ad applicarle nel 2021.
 
Aggiungo poi che anche in questo caso sono lieto di aver pubblicato l’articolo in italiano, in un contesto in cui la conferenza accetta sia italiano che inglese, ma, se vedo bene, su 69 articoli accettati quelli in italiano sono solo 4. Meglio dei 2 su 75 dell’anno scorso, peraltro! E chissà che la traduzione automatica non permetta comunque la lettura anche a chi non conosce l’italiano...
 
Sirio Papa e Mirko Tavosanis, Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano, pp. 1-7, in CLiC-it 2020 – Proceedings of the Seventh Italian Conference on Computational Linguistics Bologna, Italy, March 1-3, 2021, a cura di Johanna Monti, Felice Dell’Orletta e Fabio Tamburini, CEUR Workshop Proceedings, Aachen University, ISSN 1613-0073.
 

martedì 3 dicembre 2019

Speciale su Macchina, mente e lingua: i volti dell'intelligenza artificiale

  
 
Immagine dal film Her di Spike Jonze: Joaquim Phoenix
Sul sito Treccani è stato pubblicato ieri uno Speciale dedicato a Macchina, mente e lingua: i volti dell'intelligenza artificiale. Io mi sono occupato di una parte dell’attività di coordinamento, e devo dire non è stato facile trovare persone in grado di scrivere con competenza su questo tema! Per questo, vanno ringraziati in modo ancora più sentito del solito gli autori che hanno aderito all’iniziativa… e Silverio Novelli in Treccani, per la pazienza.
 
Lo Speciale è composto:
 
 
Nell’assieme, mi sembra un invito interessante a intensificare la conversazione su un argomento di grande interesse per i linguisti – e non solo.
 

martedì 19 novembre 2019

La traduzione automatica funziona

  
 
Foto: Mirko Tavosanis nel mezzo delle spiegazioni a CLiC-it 2019
La settimana scorsa, il mio viaggio al convegno CLiC-it a Bari è stato molto soddisfacente. Alla soddisfazione hanno contribuito anche due incontri aggiuntivi: uno a Lecce sull’italiano del web, grazie ad Annarita Miglietta, e uno all’Università di Bari sulla valutazione della traduzione, grazie a Maristella Gatto. Aggiungerei poi anche altre cose piacevoli: il viaggio di andata in vagone letto, il cibo (ottimo anche per un vegetariano), i paesaggi, la passeggiata nel centro di Bari…
 
Però vale la pena insistere sul motivo principale per cui ero lì, cioè presentare un mio lavoro di valutazione sulla qualità delle traduzioni automatiche. Non era uno dei centri tematici del convegno, anzi, il mio era proprio un contributo isolato. Però ho scoperto attività di valutazione molto importanti e, soprattutto, ho potuto riscontrare un fortissimo interesse per l’argomento in tanti addetti ai lavori. Al momento di presentare il poster sono stato sommerso di domande: nella foto mi si vede appunto in piena attività!
 
Credo quindi che valga la pena dire una cosa chiaramente: dopo più di mezzo secolo di false partenze, adesso la traduzione automatica funziona. E un miglioramento tanto visibile quanto rapido è dovuto all’introduzione dei sistemi a reti neurali, avvenuta per l’italiano a partire dal 2017, che ha fatto invecchiare molto in fretta il capitolo sulla traduzione automatica contenuto nel mio libro su Lingue e intelligenza artificiale. Ci sarebbe bisogno di un aggiornamento, in effetti… ma intanto è importante notare questa svolta storica.
 
Certo, le attività di traduzione si collocano lungo un continuum, per cui qualche applicazione pratica si è sempre trovata, e qualche azienda come SYSTRAN è riuscita a sopravvivere per decenni – ma erano cose molto di nicchia. Adesso però è possibile prendere un articolo di quotidiano o periodico in inglese e ottenere una traduzione in italiano ancora piena di errori ma che in sostanza riporta correttamente le informazioni del testo di partenza e non è poi molto lontana dal livello di un traduttore umano (qualche dettaglio in più sulla mia verifica è in questo post, e il resto è nel testo pubblicato).
 
Questa non è una cosa scontata. Per decenni, chiunque abbia lavorato nel settore si è sentito dire che la traduzione automatica “funzionava” quando in realtà dietro a questi discorsi non c’era molto: solo rivendicazioni esagerate e a volte ai limiti della truffa, a cominciare dalla celebre dimostrazione “Georgetown-IBM” del 1954. Ricordo bene, per esempio, di aver parlato nel 1990 con un bravissimo editore italiano – oggi scomparso – che raccontava di aver provato un sistema che funzionava bene e che gli avrebbe permesso di fare a meno di traduttori per i suoi libri. Sono ormai passati trent’anni, e nessuno dei libri della sua casa editrice è stato tradotto da un sistema automatico. Non solo: non credo che nessuno dei suoi libri sia stato tradotto con l’aiuto parziale di un sistema automatico.
 
Adesso però la svolta è molto interessante, e le reti neurali cambiano molte regole del gioco. Di regola, sintetizzare una materia complessa in una frase non è sufficiente. Anche nel caso della traduzione automatica occorrerebbe quindi fare un sacco di precisazioni, e di valutazioni. Però, in prima battuta, si può provare anche a condensare la novità in uno slogan: finalmente, la traduzione automatica funziona.
 

giovedì 7 novembre 2019

Da Torino a Lecce

  
 
Immagine dal sito del Festival della tecnologia di Torino
I prossimi giorni saranno per me fitti di impegni fuori sede!
 
Si inizia domenica 10, quando, dalle 15 alle 16:30, parteciperò a un dibattito all’interno del Festival della Tecnologia al Politecnico di Torino. Il titolo è: Storia di un e-taliano. Media e linguaggi nel mondo digitale; modera Gino Roncaglia e partecipano Vera Gheno ed Elena Pistolesi.
 
Mercoledì 13, alle 9, su graditissimo invito di Annarita Miglietta, terrò una lezione sull’Italiano del web a Lecce, all’Università del Salento, all’interno dei seminari di Sociolinguistica per gli studenti dell'area umanistica.
 
Nel pomeriggio dello stesso giorno sarò poi a Bari, dove inizia il convegno CLiC-it 2019. Alle 15:30 parteciperò alla sessione Poster Madness I con il mio lavoro sulla valutazione dei traduttori a reti neurali per i testi giornalistici tradotti dall’inglese in italiano.
 
Insomma, andrò da un capo all’altro dell’Italia... e in diagonale! Incrocio le dita e mi affido alla capacità di Trenitalia di portarmi in orario alle varie destinazioni.
 

martedì 5 novembre 2019

Tavosanis, Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano

  
 
Schermata della pubblicazione online degli atti CLiC-it 2019
Ho un po’ di osservazioni da fare sulla traduzione automatica e, più in generale, sul modo in cui le tecniche di intelligenza artificiale permettono oggi l’elaborazione del linguaggio. Parto segnalando un mio contributo: Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano. Il contributo appare negli atti del prossimo convegno CLiC-it 2019 (sì, nel settore si pubblicano spesso gli atti prima del convegno… cosa utilissima), su cui spero di riferire in diretta.
 
Per inquadrare il lavoro occorre fornire qualche spiegazione, collegata a quanto scrivevo nel mio libro su Lingue e intelligenza artificiale, ma tenendo conto del fatto che nel frattempo ci sono stati sviluppi notevoli. Dal 2017 a oggi la qualità delle traduzioni automatiche è molto migliorata, grazie all’adozione di tecniche di intelligenza artificiale… e fin qui nel libro c’ero arrivato. Poi però sono successe due cose importanti, entrambe nel corso del 2018:
 
  • la qualità delle traduzioni sembra essere ulteriormente migliorata, almeno per alcuni sistemi commerciali
  • la comunità della valutazione si è accorta del fatto che il sistema usato in precedenza sottovalutava in modo clamoroso i prodotti della traduzione a reti neurali
 
Di qui la necessità di rivalutare tutto il quadro, e l’unico metodo efficace è stato il ripartire da zero: fornire i prodotti della traduzione automatica a esseri umani e chiedere a loro di valutarli. I risultati sono clamorosi, perché finalmente mostrano i miglioramenti recenti in tutta la loro portata.
 
Il mio contributo presenta quindi una valutazione delle prestazioni dei due sistemi migliori, Google Traduttore e DeepL, usati attraverso le interfacce web disponibili al pubblico. Per la valutazione ho usato un campione di 100 frasi tratte da testi giornalistici in lingua inglese tradotti in italiano, valutate da studenti del mio corso di Linguistica italiana II (2018-2019) che avevano ricevuto istruzioni e fatto pratica con l’assegnazione di punteggi. Le scale usate sono state:
 
Adeguatezza
  1. Il contenuto informativo dell’originale è stato completamente alterato 
  2. È stata trasmessa una parte del contenuto informativo, ma non la più importante 
  3. Circa metà del contenuto informativo è stata trasmessa 
  4. La parte più importante del contenuto informativo originale è stata trasmessa 
  5. Il contenuto informativo è stato tradotto completamente
Fluenza
  1. Impossibile da ricondurre alla norma 
  2. Con più di due errori morfosintattici 
  3. Con non più di due errori morfosintattici e/o molti usi insoliti di collocazioni 
  4. Con non più di un errore morfosintattico e/o un uso insolito di collocazioni
  5.  Del tutto corretta

I risultati sono stati, appunto, sorprendenti.
  • Google : adeguatezza 4,15, fluenza 3,90 
  • DeepL: adeguatezza 4,30, fluenza 3,94 
  • Umano : adeguatezza 4,60, fluenza 4,46 
In sostanza, la differenza è molto più ridotta di quello che si poteva pensare in base alle metriche usate finora per le traduzioni: una delle più usate, BLEU, assegnava alle traduzioni automatiche punteggi attorno alla metà di quelli ricevuti dai traduttori umani. La situazione è invece molto diversa e, anche se i sistemi automatici continuano a fare un sacco di errori, la distanza è ridotta. Inoltre, in diversi casi le frasi che producono sono indistinguibili per qualità da quelle dei traduttori umani reali – o addirittura migliori. Su questo ci sarà da riflettere molto.
 
Aggiungo poi che di questo lavoro mi fanno particolare piacere tre cose: aver pubblicato in un contesto di linguistica computazionale, sempre un po’ fuori settore per me; aver fatto il lavoro in modo interattivo, assieme agli studenti del mio corso; e infine, aver pubblicato l’articolo in italiano, in un contesto in cui la conferenza accetta sia italiano che inglese, ma, se vedo bene, su 75 articoli accettati quelli in italiano sono solo due.
 
Mirko Tavosanis, Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano, pp. 1-7, in CLiC-it 2019 – Proceedings of the Sixth Italian Conference on Computational Linguistics, Bari, Italy, November 13-15, 2019, a cura di Raffaella Bernardi, Roberto Navigli e Giovanni Semeraro, CEUR Workshop Proceedings, Aachen University, ISSN 1613-0073.
 
Creative Commons License
Blog di Mirko Tavosanis by http://linguaggiodelweb.blogspot.com is licensed under a Creative Commons Attribuzione-Non opere derivate 2.5 Italia License.