Visualizzazione post con etichetta Lessico. Mostra tutti i post
Visualizzazione post con etichetta Lessico. Mostra tutti i post

sabato 27 ottobre 2018

Tavosanis, Italiano, dialetti, inglese… Il lessico e il cambiamento linguistico

  
 
L'italiano e la rete, le reti per l'italiano
Durante l’ultima Settimana della lingua italiana, come da tradizione, l’Accademia della Crusca ha pubblicato un libro nella collana “La lingua italiana nel mondo”. Il libro ha lo stesso titolo della Settimana, cioè L’italiano e la rete, le reti per l’italiano, ed è stato ottimamente curato da Giuseppe Patota e Fabio Rossi. I contenuti sono formati da una raccolta di contributi sulla lingua della comunicazione in rete, e tra questi ce n’è anche uno mio, intitolato Italiano, dialetti, inglese… il lessico e il cambiamento linguistico.
 
All’interno del mio contributo, la questione è affrontata in prospettiva ampia. Le parole entrate nel lessico italiano in tempi recenti, in collegamento a volte diretto a volte indiretto con la comunicazione in rete, sono viste nel contesto del cambiamento linguistico in generale. La mia analisi è piuttosto conservativa: le novità sono piuttosto limitate e si concentrano in alcuni generi testuali e in alcune tipologie di parole. Inoltre, proprio per loro stessa natura, molte di queste novità hanno natura effimera ed è quindi difficile pensare che portino a effetti significativi sull’italiano. Perfino la pressione dell’inglese, che è molto forte, potrebbe interrompersi prima di quanto pensiamo, per ragioni politiche o tecnologiche – in particolare, come ripeto spesso, in rapporto alla diffusione della traduzione automatica.
 
Il libro contiene poi molti altri contributi interessanti. Per esempio, Elena Pistolesi e Giuliana Fiorentino affrontano, da prospettive diverse, il rapporto tra la della comunicazione in rete e il dialogo. Rita Fresu descrive invece, sulla traccia di molti suoi contributi recenti, il modo in cui il tradizionale concetto di “semicolti” deve essere modificato alla luce della situazione comunicativa contemporanea.
 
Nel complesso, una lettura consigliatissima e un’importante aggiunta alla bibliografia italiana sull’argomento.
 
Mirko Tavosanis, Italiano, dialetti, inglese… il lessico e il cambiamento linguistico , in L’italiano e la rete, le reti per l’italiano, a cura di Giuseppe Patota e Fabio Rossi, Firenze, Accademia della Crusca e goWare, 2018, pp. 35-48, ISBN 978-88-3363-077-9. Il libro può essere acquistato in vari formati dal sito di goWare, che l’ha reso gratuitamente disponibile durante la Settimana della lingua italiana nel mondo, oppure da altre piattaforme di vendita di e-book, ed è disponibile anche in versione su carta; la lunghezza complessiva del libro è di 174 pagine.
 

giovedì 7 giugno 2018

SILFI a Genova

  
 
Per le strade di Genova
La scorsa settimana si è svolto a Genova il XV convegno della Società Internazionale di Linguistica e Filologia Italiana (SILFI). Il convegno è stato dedicato a “Linguaggi settoriali e specialistici: sincronia, diacronia, traduzione, variazione”; purtroppo io mi sono potuto trattenere solo per i primi due giorni, però ho sentito tantissimi interventi interessanti. L’area che mi interessava di più era quella della sincronia, cioè relativa a linguaggi settoriali e specialistici nell’italiano di oggi, ma c’era molto da imparare anche su altri argomenti. Mi ha fatto anche piacere vedere quanti interventi nell’area sincronia hanno citato il mio libro sull’italiano del web!
 
Il mio intervento si intitolava “Misurazione del riconoscimento del lessico specialistico nei sistemi per il trattamento automatico del parlato”. Ho controllato le prestazioni di Google (attraverso le API Speech Cloud) e di Dragon (su programma installato) per verificare l’ipotesi che le parole che fanno parte di un lessico specialistico vengano riconosciute meglio della media, come si può sospettare dai dati in bibliografia. L’ipotesi è risultata confermata, anche oltre le mie aspettative. Per esempio, ho preso l’audio di questo video tecnico su YouTube, dedicato alla manutenzione del carburatore di una motosega:
 

L’audio comprende 16 occorrenze di parole appartenenti al lessico tecnico (Cc, decespugliatore, membrana, motosega e omologato) su un totale complessivo di 733 parole. La percentuale di errore nelle parole in generale è stata del 12,3%; la percentuale di errore nella terminologia è stata dello 0%: tutte le parole appartenenti al lessico tecnico sono state riconosciute correttamente. (Tra parentesi, vale anche la pena notare quanto sia alta la percentuale di successo complessiva per un video di questo tipo, realizzato in modo competente ma da parte di un presentatore non professionista, e con qualche disturbo da rumori di fondo e un accento regionale identificabile!)
 
Per la versione scritta del contributo spero di allargare molto il campione e confermare quindi le conclusioni. Però, al di là delle questioni linguistiche, il convegno è stato anche l’occasione per vedere una Genova fantastica: da Palazzo Ducale a Palazzo Rosso, passando attraverso le strade del centro, la passeggiata del porto la notte, le preghiere islamiche all’aperto, le mura medievali, i conventi e i turisti… E i linguisti, anche.
 

martedì 17 settembre 2013

Valutare la varietà lessicale di un corpus

 
 
Non so se sia una strana serie di coincidenze o meno… però, negli ultimi mesi, mi è capitato di leggere diversi lavori di linguistica italiana (elaborati di studenti, ma anche contributi scientifici prodotti da esperti) che confrontano la varietà lessicale di corpus diversi usando un indicatore piuttosto strano: la percentuale dei lemmi che fanno parte del vocabolario di base.
 
A prima vista, il dato sembrerebbe pertinente. Il lessico italiano è molto esteso, ma il vocabolario di base dell’italiano, secondo gli studi di Tullio De Mauro, è composto da circa settemila parole, divise in tre fasce: lessico fondamentale, di alto uso (o alta frequenza) e di alta disponibilità (quest’ultimo è formato da parole che, come risulta dalle interviste, in pratica tutti gli italiani conoscono, anche se nei corpus compaiono con una frequenza bassissima… e già questo fatto dovrebbe invitare alla prudenza). Si dice spesso che le parole del vocabolario di base, per numero di forme, costituiscono qualcosa come il 96-98% di qualunque testo in lingua italiana: calcolate in questo modo, quindi, non dicono molto sulla differenza tra i diversi tipi di testo.
 
Valutare il lessico in base ai lemmi, cioè facendo contare per uno tutte le occorrenze di una parola, sia ad alta sia a bassa frequenza, sembrerebbe un modo più promettente per differenziare tipi di testo diversi. E, in effetti, lo è. Con questo sistema, il numero delle forme non interferisce e l’uso di parole meno comuni, e quindi la varietà lessicale, è più facile da evidenziare. C’è però una fortissima controindicazione: la presenza di parole meno comuni dipende in modo molto stretto dalle dimensioni del corpus! Ovviamente non c’è una regola unica – language is never, ever random – e le cose possono variare molto a seconda del tipo di testo con cui si ha a che fare, però, in moltissimi casi, allargando il corpus aumenta il numero di parole diverse al suo interno. La cosa è intuitiva: mentre il o che sono sicuramente presenti anche in corpus molto piccoli, più è grande il corpus, più è facile che contenga parole come pertinentizzazione o cornacchia…. In un certo senso, si tratta di un corollario della legge di Zipf.
 
In questa situazione, più numerosi sono i lemmi contenuti nel campione, meno elevata tenderà a essere la percentuale di essi riconducibile al vocabolario di base. Raggiunto il suo limite, poi, il vocabolario di base non cresce più! Se ho un corpus che contiene mille lemmi, può darsi benissimo che il 95% di questi lemmi rientri nel vocabolario di base. Se ho un corpus che contiene 14.000 lemmi, quelli che rientrano nel vocabolario di base potranno essere al massimo il 50% del totale, perché il vocabolario di base contiene come si è detto, solo settemila lemmi (contro le decine di migliaia contenuti nei dizionari monovolume della lingua italiana). Se ho un corpus che contiene 70.000 lemmi, la percentuale riconducibile al vocabolario di base potrà essere al massimo del 10%. E così via.
 
Per questo motivo non ha senso confrontare, per esempio, un corpus di 50 milioni di parole tratte da quotidiani e periodici con un corpus di 100.000 parole tratte da poesie, dire che la percentuale di lemmi provenienti dal vocabolario di base in un caso è il 10% e nell’altro il 30%, e dedurne che quotidiani e periodici hanno una maggiore varietà lessicale rispetto alle poesie. Il confronto, per essere sensato, deve essere per forza di cose relativo a corpus o sezioni di corpus di dimensioni omogenee. Dire che in un corpus la percentuale di lemmi provenienti dal vocabolario di base è X ha senso solo se si confronta questa percentuale con quella ricavabile da un altro corpus delle stesse dimensioni. Per esempio, un corpus giornalistico può essere confrontato su questa base con un corpus poetico se entrambi sono composti da 100.000 caratteri.
 

giovedì 31 gennaio 2013

Bianchi, Castelli e Tavosanis: Analisi dei fenomeni di contatto...

 
Lessico e lessicologia, a cura di Silvana Ferreri
Mentre ero a Hong Kong, è uscito il volume Lessico e lessicologia (Roma, Bulzoni Editore, ISBN: 8878706558), a cura di Silvana Ferreri, che raccoglie gli atti del convegno della Società di linguistica italiana (SLI) tenuto a Viterbo dal 27 al 29 settembre 2010.

All’interno c’è anche un contributo scritto da Elisa Bianchi, Margherita Castelli e me: Analisi dei fenomeni di contatto fra inglese e italiano nella piattaforma MOODLE e nei forum di HTML.it (pp. 325-342). Il titolo spiega già buona parte del contenuto… da parte mia, però, aggiungo che è stato abbastanza sorprendente vedere, nelle coppie di sinonimi, la prevalenza delle parole italiane rispetto all’equivalente inglese, anche in contesti molto informali.

In sostanza, questo significa che nelle raccolte che abbiamo messo insieme “thread” è un po’ più frequente di “discussione”, ma “tracciamento” è più frequente di “tracking”, “utente” è molto più frequente di “user”, eccetera. La percentuale complessiva, alla fine, è del 70% di forme italiane contro il 30% di forme inglesi nelle discussioni degli utenti di Moodle, e del 65% contro il 35% in quelle degli utenti di HTML.it. Anche se, certo, la pressione della lingua inglese è forte, e produce esiti interessanti anche nella formazione di composti nominali (“invio mail”, eccetera).
 
Creative Commons License
Blog di Mirko Tavosanis by http://linguaggiodelweb.blogspot.com is licensed under a Creative Commons Attribuzione-Non opere derivate 2.5 Italia License.