Visualizzazione post con etichetta DeepL. Mostra tutti i post
Visualizzazione post con etichetta DeepL. Mostra tutti i post

martedì 26 maggio 2026

Traduzione automatica a Cracovia

 
Lenticchie e birra sullo sfondo della valle dell'Adige
Sono in viaggio per il convegno SILFI 2026 a Cracovia: domani, 27 maggio, parlerò su un tema che ben conosco: la Valutazione dell’italiano delle traduzioni eseguite da LLM. In questo momento, a bordo del RailJet 84 delle ferrovie austriache, sto risalendo la valle dell’Adige... spettacolare quando uno può guardarla per bene senza dover tener gli occhi fissi sulla strada!
 
Per quanto riguarda il mio lavoro, a inizio intervento conto di presentare quattro punti che sono un po’ premesse e un po’ conclusioni:
  1. Verso l’italiano, i sistemi attuali producono per alcuni tipi di testo e per alcune lingue di partenza traduzioni di livello paragonabile a quello di una buona traduzione umana non sottoposta a un’ultima revisione
  2. Di fronte a traduzioni di questo tipo, prive di indicazione d’origine, spesso anche dei valutatori esperti non riescono a distinguere tra traduzione umana e traduzione automatica
  3. Almeno in alcuni ambiti, gli LLM generalisti come ChatGPT forniscono traduzioni di qualità superiore a quella di sistemi specializzati come DeepL
  4. Come per i traduttori umani, gli LLM producono regolarmente esempi di traduttese
Dico “un po’ premesse e un po’ conclusioni” perché lo stato di cose che descrivo mi sembra ormai accettato, nelle linee generali, ma poco documentato (soprattutto per l’italiano). Io spero di contribuire a documentarlo mostrando in particolare i risultati di una valutazione compiuta con gli studenti della laurea magistrale in Linguistica e traduzione dell’Università di Pisa. Abbiamo condotto le prove su brevi sezioni iniziali di tre romanzi, tra cui l’ultimo di McEwan e il sempre caro Nova di Samuel R. Delany, confrontando il lavoro di ChatGPT e DeepL con la venerabile traduzione di Renato Prinzhofer pubblicata a suo tempo dalla Nord.
 
E a parte questo… a Cracovia ci vado in treno! Purtroppo non ho fondi sufficienti a permettermi di fare in treno anche il viaggio di ritorno, per il quale dovrò ripiegare sull’economico volo Ryanair diretto da Cracovia a Pisa. Ma almeno all’andata si va in modo più sostenibile, da Ripafratta e cambi a Pisa Centrale, Firenze Santa Maria Novella, Verona Porta Nuova e Rosenheim, con arrivo auspicato domattina alle 7 a Cracovia Centrale (Kraków Główny)!
 

mercoledì 16 dicembre 2020

Papa e Tavosanis, Valutazione umana di DeepL a livello di frase per le traduzioni di testi specialistici dall'inglese verso l'italiano


 
Logo di CLiC-it 2020
Vale davvero la pena tenere d’occhio gli sviluppi della traduzione automatica… è uno dei rarissimi casi in cui la tecnologia è più avanti di quel che sembra!
 
Adesso è appena uscito un contributo scritto da un bravo studente, Sirio Papa, e da me: Valutazione umana di DeepL a livello di frase per le traduzioni di testi specialistici dall’inglese verso l’italiano. Il contributo appare negli atti del convegno CLiC-it 2020, che avrebbe dovuto tenersi quest’anno ma che è stato spostato al marzo 2021: speriamo possa tenersi in presenza.
 
I risultati del lavoro, per quanto incredibile ciò ancora mi sembri, confermano altri studi recenti, in cui si è parlato molto di raggiungimento della “parità” tra traduzione automatica e traduzione umana. Per quanto riguarda l’“adeguatezza”, cioè in sostanza la correttezza dei contenuti, nel mio campione la traduzione automatica è risultata al livello di quella umana. Non arriva invece al livello di quella umana per la “scorrevolezza”, definendo in questo modo il rispetto di tutte le regole grammaticali, l’uso delle collocazioni tipiche di una lingua, eccetera, ma la differenza è davvero ridottissima. Di tutto questo ho già parlato l’anno scorso, parlando della presentazione fatta a Bari e del contributo pubblicato

In quanto ai risultati del lavoro appena uscito, che confermano e rafforzano i precedenti, sono stati ottenuti sottoponendo a un gruppo di 15 valutatori le traduzioni di 108 frasi inglesi. Di ogni frase sono state valutate due diverse versioni, una tradotta da esseri umani e l’altra tradotta da DeepL. Le frasi sono state divise in due gruppi e presentate ai valutatori in ordine casuale, senza informazioni su chi avesse tradotto ogni singola frase. I risultati complessivi, in scala da 1 a 5, sono stati questi:
 
Adeguatezza 
  • Umano: 4,29 
  • DeepL: 4,31
Scorrevolezza 
  • Umano: 4,17 
  • DeepL: 4,09
Insomma, la traduzione automatica ha ricevuto addirittura un punteggio più alto di quello della traduzione umana per quanto riguarda l'adeguatezza, ma la differenza è tanto ridotta da non essere statisticamente significativa: in pratica, si tratta di parità. È invece statisticamente significativo il vantaggio del traduttore umano per la scorrevolezza… ma, come si vede, il margine è comunque molto, molto ridotto.
 
Se al di là dei numeri interessano gli aneddoti, poi, forse è il caso di raccontarne uno. Quando ho ricevuto il documento con le frasi estratte a caso da traduzioni eseguite da DeepL, l’ho scorsa e ho contattato il mio coautore, dicendo: “ci deve essere un errore! Queste mi sembrano le frasi tradotte da traduttori umani”. La risposta, come si sarà immaginato, è stata: “no, no, sono proprio quelle di DeepL”…
 
Vale poi la pena di precisare due cose importanti. La prima è che la valutazione è stata condotta, a differenza dei miei esperimenti precedenti, su testi specialistici: brevetti, manuali, schede di sicurezza. I settori di provenienza erano “biomedicina e discipline del farmaco” e “ambiente ed energia”. E prima di fare la valutazione, confesso che non avevo idea di che cosa sarebbe venuto fuori: questi testi si prestano bene alla traduzione automatica, perché per esempio la sintassi è più rigida di quella di altri tipi di testo? O si prestano male, perché per esempio le difficoltà nella traduzione della terminologia sono insormontabili? Direi che i risultati, come minimo, garantiscono che le difficoltà non sono insormontabili.
 
La seconda cosa, connessa, è che la valutazione è stata condotta grazie al contributo volontario degli studenti e dei docenti (in particolare, delle professoresse Isabella Blum e Silvia Barra) del Master on line in Traduzione specialistica inglese > italiano erogato dal Consorzio ICoN: li ringrazio tutti sentitamente! Il loro coinvolgimento è stato essenziale perché, com’è ovvio, non si può valutare la qualità della traduzione se non si sa che cosa significa il testo originale, o anche solo se determinate parole esistono o no nell’uso italiano.
 
Prossimi sviluppi? Probabilmente passare a valutare testi interi, non più singole frasi. La cosa è difficile e pone anche problemi metodologici (come si fa a nascondere al valutatore l’origine anche solo di un articolo di giornale? Per rendere evidente la provenienza basta che sia presente all’interno anche un solo errore che un essere umano non commetterebbe mai); ma un paio di idee le ho, e forse potrò provare ad applicarle nel 2021.
 
Aggiungo poi che anche in questo caso sono lieto di aver pubblicato l’articolo in italiano, in un contesto in cui la conferenza accetta sia italiano che inglese, ma, se vedo bene, su 69 articoli accettati quelli in italiano sono solo 4. Meglio dei 2 su 75 dell’anno scorso, peraltro! E chissà che la traduzione automatica non permetta comunque la lettura anche a chi non conosce l’italiano...
 
Sirio Papa e Mirko Tavosanis, Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano, pp. 1-7, in CLiC-it 2020 – Proceedings of the Seventh Italian Conference on Computational Linguistics Bologna, Italy, March 1-3, 2021, a cura di Johanna Monti, Felice Dell’Orletta e Fabio Tamburini, CEUR Workshop Proceedings, Aachen University, ISSN 1613-0073.
 

martedì 5 novembre 2019

Tavosanis, Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano

  
 
Schermata della pubblicazione online degli atti CLiC-it 2019
Ho un po’ di osservazioni da fare sulla traduzione automatica e, più in generale, sul modo in cui le tecniche di intelligenza artificiale permettono oggi l’elaborazione del linguaggio. Parto segnalando un mio contributo: Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano. Il contributo appare negli atti del prossimo convegno CLiC-it 2019 (sì, nel settore si pubblicano spesso gli atti prima del convegno… cosa utilissima), su cui spero di riferire in diretta.
 
Per inquadrare il lavoro occorre fornire qualche spiegazione, collegata a quanto scrivevo nel mio libro su Lingue e intelligenza artificiale, ma tenendo conto del fatto che nel frattempo ci sono stati sviluppi notevoli. Dal 2017 a oggi la qualità delle traduzioni automatiche è molto migliorata, grazie all’adozione di tecniche di intelligenza artificiale… e fin qui nel libro c’ero arrivato. Poi però sono successe due cose importanti, entrambe nel corso del 2018:
 
  • la qualità delle traduzioni sembra essere ulteriormente migliorata, almeno per alcuni sistemi commerciali
  • la comunità della valutazione si è accorta del fatto che il sistema usato in precedenza sottovalutava in modo clamoroso i prodotti della traduzione a reti neurali
 
Di qui la necessità di rivalutare tutto il quadro, e l’unico metodo efficace è stato il ripartire da zero: fornire i prodotti della traduzione automatica a esseri umani e chiedere a loro di valutarli. I risultati sono clamorosi, perché finalmente mostrano i miglioramenti recenti in tutta la loro portata.
 
Il mio contributo presenta quindi una valutazione delle prestazioni dei due sistemi migliori, Google Traduttore e DeepL, usati attraverso le interfacce web disponibili al pubblico. Per la valutazione ho usato un campione di 100 frasi tratte da testi giornalistici in lingua inglese tradotti in italiano, valutate da studenti del mio corso di Linguistica italiana II (2018-2019) che avevano ricevuto istruzioni e fatto pratica con l’assegnazione di punteggi. Le scale usate sono state:
 
Adeguatezza
  1. Il contenuto informativo dell’originale è stato completamente alterato 
  2. È stata trasmessa una parte del contenuto informativo, ma non la più importante 
  3. Circa metà del contenuto informativo è stata trasmessa 
  4. La parte più importante del contenuto informativo originale è stata trasmessa 
  5. Il contenuto informativo è stato tradotto completamente
Fluenza
  1. Impossibile da ricondurre alla norma 
  2. Con più di due errori morfosintattici 
  3. Con non più di due errori morfosintattici e/o molti usi insoliti di collocazioni 
  4. Con non più di un errore morfosintattico e/o un uso insolito di collocazioni
  5.  Del tutto corretta

I risultati sono stati, appunto, sorprendenti.
  • Google : adeguatezza 4,15, fluenza 3,90 
  • DeepL: adeguatezza 4,30, fluenza 3,94 
  • Umano : adeguatezza 4,60, fluenza 4,46 
In sostanza, la differenza è molto più ridotta di quello che si poteva pensare in base alle metriche usate finora per le traduzioni: una delle più usate, BLEU, assegnava alle traduzioni automatiche punteggi attorno alla metà di quelli ricevuti dai traduttori umani. La situazione è invece molto diversa e, anche se i sistemi automatici continuano a fare un sacco di errori, la distanza è ridotta. Inoltre, in diversi casi le frasi che producono sono indistinguibili per qualità da quelle dei traduttori umani reali – o addirittura migliori. Su questo ci sarà da riflettere molto.
 
Aggiungo poi che di questo lavoro mi fanno particolare piacere tre cose: aver pubblicato in un contesto di linguistica computazionale, sempre un po’ fuori settore per me; aver fatto il lavoro in modo interattivo, assieme agli studenti del mio corso; e infine, aver pubblicato l’articolo in italiano, in un contesto in cui la conferenza accetta sia italiano che inglese, ma, se vedo bene, su 75 articoli accettati quelli in italiano sono solo due.
 
Mirko Tavosanis, Valutazione umana di Google Traduttore e DeepL per le traduzioni di testi giornalistici dall’inglese verso l’italiano, pp. 1-7, in CLiC-it 2019 – Proceedings of the Sixth Italian Conference on Computational Linguistics, Bari, Italy, November 13-15, 2019, a cura di Raffaella Bernardi, Roberto Navigli e Giovanni Semeraro, CEUR Workshop Proceedings, Aachen University, ISSN 1613-0073.
 
Creative Commons License
Blog di Mirko Tavosanis by http://linguaggiodelweb.blogspot.com is licensed under a Creative Commons Attribuzione-Non opere derivate 2.5 Italia License.