Lessicalizzazione
Previous Top Next

La lessicalizzazione identifica le sequenze di parole definite dall’utente in un’apposita lista e le trasforma nel Corpus (e nel Vocabolario) in un'unica occorrenza.

 
La lessicalizzazione di una lista di segmenti deve rispondere a precise esigenze di analisi poiché tale operazione  può  comportare  una  perdita  di  informazione.
Prendiamo, ad  esempio, i  seguenti  tre segmenti:
- piccola proprietà...................................13 occorrenze
- piccola proprietà contadina.....................7 occorrenze
- proprietà contadina..............................11 occorrenze
In totale questi tre segmenti assommano a 31 occorrenze, ma in realtà si tratta di un valore ridondante poiché le occorrenze di ciascun segmento non sono al netto delle occorrenze degli altri due. Come mostrato in figura una singola occorrenza della parola <proprietà> comune a tutti e tre i segmenti è contata una volta per ogni segmento.
La procedura di lessicalizzazione rimedia a questo problema, ma proprio per questo può far perdere dei segmenti rilevanti

graphic
graphic

Nel nostro caso lessicalizzando il segmento <piccola proprietà contadina> sottraiamo 7 occorrenze agli altri due segmenti. Il segmento <piccola proprietà> conterrà 6 occorrenze e indicherà le volte in cui <piccola proprietà> non è associata a <contadina> (es. piccola proprietà terriera, agraria, ecc). Il segmento <proprietà contadina> conterrà solo 4 occorrenze e si riferirà ai casi in cui la <proprietà contadina> è "non piccola".
E' evidente che in una logica di estrema parsimonia di interventi sul testo, posto che interessi isolare il concetto più specifico, si lessicalizzerà preferibilmente solo <piccola proprietà contadina>. Ove interessi anche "piccola proprietà" occorre ricordare che questo segmento non rappresenterebbe più il 100% di quel concetto.
Un'alternativa alla lessicalizzazione consiste nel produrre una selezione dei segmenti d'interesse con ridondanza in una tabella di tipo <segmenti x testi> da giustapporre in "append" alla tabella <forme x testi>. Spesso la ridondanza facilita l'interpretazione delle analisi multidimensionali.

La lista di sequenze da lessicalizzare può essere creata in due modi:

·     esportando la lista dei segmenti, o una sua selezione, in un file di testo (per i dettagli si veda la voce Esporta una lista di lessicalizzazione/tematizzazione del Menù File)

·     compilando una lista ad hoc al di fuori di TaLTaC2 e salvando il tutto in un file di testo. Tale file deve contenere solo le sequenze di testo (una per ogni riga), senza informazioni aggiuntive (frequenza, lunghezza ecc.);

NOTA: La lista non può contenere il carattere \ (backslash), poiché in questa procedura è un carattere riservato. Si consiglia pertanto di controllare la lista prima di sottoporla all'analisi per cancellare eventuali elementi che lo contengano. Nel caso la lista contenga un backslash TaLTaC2 mostrerà un opportuno avviso. Ovviamente ciò significa che non è possibile lessicalizzare poliformi che contengano un backslash.

NOTA: TaLTaC2 è in grado di effettuare anche lessicalizzazioni di forme già lessicalizzate. Se in precedente è stata lessicalizzata l'espressione <presidente del consiglio>, sottoponendo una seconda lista di lessicalizzazione che contenga l'espressione <presidente del consiglio dei ministri>, TaLTaC2 riuscirà ad indentificare questa sequenza nel testo, che a questo punto risulta composta da tre "parole": <presidente del consiglio>, <dei> e <ministri>. Nel Vocabolario, le occorrenze del poliforme <presidente del consiglio> risulteranno decurtate di quelle che compaiono in <presidente del consiglio dei ministri>.

Per eseguire la lessicalizzazione selezionare la voce omonima dal menù Analisi\Analisi Lessicale\Analisi dei Segmenti oppure premere il tasto graphic nella barra delle applicazioni.

Si aprirà la maschera Lessicalizzazione di poliformi. Accedere alla cartella dove risiede la lista tramite il bottone graphic,  scegliere il file desiderato e premere OK.

graphic

Al termine della procedura, TaLTaC2 informa l'utente che è necessario procedere all'aggiornamento della Lista dei segmenti, poichè la lessicalizzazione ha generato cambiamenti nelle occorrenze delle forme grafiche riaprendo la maschera Parametri di segmentazione del corpus. Se non si desidera individuare nuovamente i segmenti, chiudere la maschera.

Comparira, quindi, la tabella Vocabolario dove le forme lessicalizzate sono individuate dall'etichetta FLESS (forme lessicalizzate) nel campo CAT_SEM e da un valore uguale o superiore a '100' nel campo Tagger.

 
NOTA: Una sequenza di forme lessicalizzate è facilmente riconoscibile anche nel Corpus. Aprendolo in modalità full text dal menù Visualizza\Esplora il Corpus, posizionando il mouse sulla sequenza questa viene indicata in rosso come un'unica occorrenza.

graphic