|
Lessicalizzazione
|
Previous Top Next |
La lessicalizzazione identifica le sequenze di parole definite dall’utente in un’apposita lista e le trasforma nel Corpus (e nel Vocabolario) in un'unica occorrenza.
|
La lessicalizzazione di una lista di segmenti deve rispondere a precise esigenze di analisi poiché tale
operazione può comportare una perdita di informazione.
Prendiamo, ad esempio, i seguenti tre segmenti:
- piccola proprietà...................................13 occorrenze
- piccola proprietà contadina.....................7 occorrenze
- proprietà contadina..............................11 occorrenze
In totale questi tre segmenti assommano a 31 occorrenze, ma in realtà si tratta di un valore ridondante
poiché le occorrenze di ciascun segmento non sono al netto delle occorrenze degli altri due. Come
mostrato in figura una singola occorrenza della parola <proprietà> comune a tutti e tre i segmenti è contata
una volta per ogni segmento.
La procedura di lessicalizzazione rimedia a questo problema, ma proprio per questo può far perdere dei
segmenti rilevanti
Nel nostro caso lessicalizzando il segmento <piccola proprietà contadina> sottraiamo 7 occorrenze agli
altri due segmenti. Il segmento <piccola proprietà> conterrà 6 occorrenze e indicherà le volte in cui
<piccola proprietà> non è associata a <contadina> (es. piccola proprietà terriera, agraria, ecc). Il segmento
<proprietà contadina> conterrà solo 4 occorrenze e si riferirà ai casi in cui la <proprietà contadina> è "non
piccola".
E' evidente che in una logica di estrema parsimonia di interventi sul testo, posto che interessi isolare il
concetto più specifico, si lessicalizzerà preferibilmente solo <piccola proprietà contadina>. Ove interessi
anche "piccola proprietà" occorre ricordare che questo segmento non rappresenterebbe più il 100% di quel
concetto.
Un'alternativa alla lessicalizzazione consiste nel produrre una selezione dei segmenti d'interesse
con
ridondanza in una tabella di tipo <segmenti x testi> da giustapporre in "append" alla tabella <forme x testi>.
Spesso la ridondanza facilita l'interpretazione delle analisi multidimensionali.
|
La lista di sequenze da lessicalizzare può essere creata in due modi:
· esportando la lista dei segmenti, o una sua selezione, in un file di testo (per i dettagli si veda la voce Esporta una lista di lessicalizzazione/tematizzazione del Menù File)
· compilando una lista ad hoc al di fuori di TaLTaC2 e salvando il tutto in un file di testo. Tale file deve contenere solo le sequenze di testo (una per ogni riga), senza informazioni aggiuntive (frequenza, lunghezza ecc.);
NOTA: La lista non può contenere il carattere \ (backslash), poiché in questa procedura è un carattere riservato. Si consiglia pertanto di controllare la lista prima di sottoporla all'analisi per cancellare eventuali elementi che lo contengano. Nel caso la lista contenga un backslash TaLTaC2 mostrerà un opportuno avviso. Ovviamente ciò significa che non è possibile lessicalizzare poliformi che contengano un backslash.
NOTA: TaLTaC2 è in grado di effettuare anche lessicalizzazioni di forme già lessicalizzate. Se in precedente è stata lessicalizzata l'espressione <presidente del consiglio>, sottoponendo una seconda lista di lessicalizzazione che contenga l'espressione <presidente del consiglio dei ministri>, TaLTaC2 riuscirà ad indentificare questa sequenza nel testo, che a questo punto risulta composta da tre "parole": <presidente del consiglio>, <dei> e <ministri>. Nel Vocabolario, le occorrenze del poliforme <presidente del consiglio> risulteranno decurtate di quelle che compaiono in <presidente del consiglio dei ministri>.
Per eseguire la lessicalizzazione selezionare la voce omonima dal menù Analisi\Analisi Lessicale\Analisi dei Segmenti oppure premere il tasto nella
barra delle applicazioni.
Si aprirà la maschera Lessicalizzazione di poliformi. Accedere alla cartella dove
risiede la lista tramite il bottone , scegliere il file desiderato e premere OK.
Al termine della procedura, TaLTaC2 informa l'utente che è necessario procedere all'aggiornamento della Lista dei segmenti, poichè la lessicalizzazione ha generato cambiamenti nelle occorrenze delle forme grafiche riaprendo la maschera Parametri di segmentazione del corpus. Se non si desidera individuare nuovamente i segmenti, chiudere la maschera.
Comparira, quindi, la tabella Vocabolario dove le forme lessicalizzate sono individuate dall'etichetta FLESS (forme lessicalizzate) nel campo CAT_SEM e da un valore uguale o superiore a '100' nel campo Tagger.
|
NOTA: Una sequenza di forme lessicalizzate è facilmente riconoscibile anche nel Corpus.
Aprendolo in modalità full text dal menù Visualizza\Esplora il Corpus, posizionando il mouse sulla
sequenza questa viene indicata in rosso come un'unica occorrenza.
|