Ricostruisci il Corpus
Previous Top Next

Questa opzione consente di ricostruire un corpus, ovvero generare un file <.txt> contenente il corpus annotato con diverse informazioni di natura semantica e/o grammaticale. Sono, inoltre, presenti opzioni di pulizia del testo. Se presenti, TaLTaC2 ricostruirà anche le righe di identificazione dei frammenti e delle sezioni.

Dal menù File selezionare Esporta/Ricostruzione Corpus/Testo annotato con

graphic

Si aprirà la maschera Ricostruzione del corpus.

graphic

Se il Tagging grammaticale non è stato eseguito, il box Ricostruzione per forme miste viene sostituito dal seguente messaggio:

graphic

L’avviso può essere escluso premendo il tasto Nascondi avviso. Il box verrà visualizzato come nella figura iniziale, ma sarà ovviamente disabilitato.

La finestra è suddivisa in due sezioni verticali, quella di sinistra per il tipo di ricostruzione, quella di destra per il formato di uscita e altre opzioni generali.

Per avviare la ricostruzione, scegliere il tipo di ricostruzione, impostarne i parametri, scegliere un formato ed eventualmente le opzioni generali desiderate. Premere il tasto OK, definire il nome del file in cui salvare il corpus ricostruito (TaLTaC2 proporrà un titolo del tipo "Corpus ricostruito" seguito da un suffisso che ricorda il tipo di ricostruzione che si va ad effettuare, ma è possibile cambiarlo a piacere) e la cartella in cui salvare il file (per impostazione predefinita è quella di sessione) e quindi premere Salva. Al termine verrà visualizzato un messaggio che avvisa della fine delle operazioni e ricorda il nome del file creato.

Di seguito vengono illustrate nei dettagli tutte le opzioni messe a disposizione dalla funzione di ricostruzione del corpus.

Tipo di ricostruzione

Quattro sono i tipi di ricostruzione disponibili e sono mutuamente esclusivi.

Ricostruzione semplice/con annotazioni

Questa modalità consente di ottenere un corpus in cui le unità lessicali saranno date dalle scelte operate spuntando le caselle, di questo riquadro, desiderate. Ad esempio, marcando la sola casella Forma grafica, verrà ricostruito un corpus in tutto simile a quello originale, mentre spuntando la casella Lemma verrà ricostruito un corpus in cui le forme saranno sostituite dai rispettivi lemmi. E' possibile marcare anche più di una casella (si ricordi però che Forma grafica e Lemma sono alternative tra loro), ottenendo di fatto un corpus annotato. Ad esempio, marcando le caselle Forma grafica, Categoria grammaticale e Categoria semantica, si otterrà un risultato del genere:

graphic

in cui ogni forma grafica è seguita, unita da un underscore, dalla categoria grammaticale e, se presente, dalla/e categoria/e semantica/he (racchiusa tra parentesi graffe) associata/e.

ATTENZIONE: in TaLTaC2 è possibile categorizzare le forme ambigue e le forme sconosciute (che nel testo ricostruito sono marcate dal solo underscore) completando le informazioni contenute nel vocabolario etichettato creato dalla procedura di Tagging grammaticale. Ad esempio, la forma <governo> è considerata ambigua perché può essere sia sostantivo sia voce del verbo <governare>. Dopo essersi accertati (previa analisi delle concordanze) che nel corpus in analisi si usa sempre e soltanto il sostantivo, è possibile modificare il vocabolario etichettato, attribuendo alla forma <governo> la categoria <N> (nel campo CAT) e il lemma <governo> (nel campo Lemma). In questo modo, quando si effettua la ricostruzione del corpus, la forma governo sarà etichettata sempre come sostantivo.

Di seguito vengono invece presentati altri due esempi di questo tipo di ricostruzione, il primo corrisponde ad aver marcato la sola casella Categoria grammaticale

graphic

mentre il secondo corrisponde ad aver marcato la sola casella Categoria semantica.

graphic

Ricostruzione per forme miste

Questa opzione, attivabile spuntando la casella omonima, disabilita le altre tipologie di ricostruzione, e permette di ottenere un corpus per forme grafiche, eccetto per quelle forme classificate con le categorie grammaticali marcate nel riquadro stesso, al posto delle quali verrà scritto il lemma corrispondente. Questa funzione risulta utile in particolare quando si desidera apprezzare in maniera più chiara l'incidenza di quei lemmi che possiedono un gran numero di flessioni (tipicamente i verbi).

Il riquadro Ricostruzione semplice/con annotazioni rimane parzialmente attivo, in particolare le caselle Categoria grammaticale e Categoria semantica, lasciando così all'utente la possibilità di aggiungere queste annotazioni ad ogni forma/lemma. Di seguito viene presentato un esempio di corpus ottenibile con questo tipo di ricostruzione.

graphic

Si noti che i verbi, gli aggettivi e le preposizioni non ambigue presentano i lemmi e non le forme grafiche, visto che per ottenere questo risultato sono state spuntate proprio le caselle di queste tre categorie grammaticali.

Ricostruzione per pulizia del testo

Questo tipo di ricostruzione permette la pulizia del testo dalle forme grafiche errate, ed è attivabile selezionando l'opzione Ricostruzione per pulizia del testo. In questo caso la ricostruzione avverrà esclusivamente per forme grafiche senza la possibilità di aggiungere alcun tipo di categorizzazione grammaticale o semantica.

Le funzioni disponibili sono l'eliminazione e/o la correzione delle forme errate. Per poter usufruire di queste funzioni, conviene prima operare l'individuazione delle forme errate tramite marcatura del campo CAT della tabella Vocabolario.

Se la forma errata è classificata con l'etichetta ERR, spuntando la prima delle due opzioni, TaLTaC2 sostituisce alla forma, nel corpus ricostruito, il lemma (che dovrà contenere la forma corretta da scrivere).

Se la forma errata è, invece, classificata con l'etichetta DEL, spuntando la seconda opzione la forma verrà definitivamente eliminata.

Ricostruzione per TreeTagger

Quest'ultima opzione disabilita gran parte della finestra e consente di ottenere un corpus trattabile con il software TreeTagger. Il corpus verrà ricostruito in un formato in cui, per ogni riga, compariranno la forma grafica, la categoria grammaticale ed il lemma, separati da un carattere di tabulazione, come nell'esempio seguente.

graphic

Come si nota dalla figura, alle forme non ambigue è stata associata la categoria grammaticale corrispondente di TreeTagger (la parola ragazzo è categorizzata con NOUN, e non con la categoria di TaLTaC2 N) ed il lemma. Sottoponendo un corpus così strutturato a TreeTagger, si beneficia di alcuni vantaggi:

·   si possono scegliere liberamente i separatori, in quanto vengono imposti dalle scelte effettuate in TaLTaC2, e non si è più vincolati, in questo senso, alle impostazioni predefinite di TreeTagger;

·   si può beneficiare di tutti i vantaggi connessi alla normalizzazione eventualmente operata (si noti la forma mesi fa: è lessicalizzata e categorizzata);

·   si possono mantenere tutte le lessicalizzazioni eventualmente operate;

·   le categorizzazioni grammaticali imposte da TaLTaC2, indiscutibili poiché riguardano forme non ambigue, "aiutano" TreeTagger nell'attribuire alle forme non categorizzate la corretta categoria grammaticale, minimizzando così il tasso di errore da cui sono affetti in generale i lemmatizzatori.

Per comprendere meglio l'utilità di questo tipo di ricostruzione, leggere la procedura consigliata presente in fondo a questa pagina.

NOTA: la parola endrowvar posta dopo le righe di identificazione dei frammenti (vedi esempio) viene inserita in automatico da TaLTaC2, e serve a riconoscere la struttura dei frammenti nel caso in cui, dopo aver trattato con TreeTagger il file ricostruito, si desideri reimportarlo in TaLTaC2. Se non si ha intenzione di seguire questa procedura, l'utente può liberamente cancellare questa parola utilizzando la funzione di sostituzione del testo presente in qualsiasi editor di testo. Per un motivo analogo, tutti gli spazi presenti nelle etichette delle sezioni verranno sostituiti con il carattere underscore <_>.

NOTA: per un problema di corretta conversione delle categorie TaLTaC2 nella categorie  TreeTagger, per certe forme, in particolare quelle appartenenti ad alcune classi di aggettivi, benché non ambigue non viene attribuita la categoria grammaticale.

Formato

Questo riquadro permette di impostare la struttura del risultato finale, e presenta le seguenti opzioni:

Testo libero: è l'impostazione di default, ed è il formato più "classico". Consente di ottenere il corpus ricostruito come un unico file in cui le unità lessicali (forme/lemmi/categorie) sono scritte come nei normali testi, ovvero da sinistra verso destra.

Strutturato in campi: consente di ottenere il corpus in un formato tabellare, in tutto analogo al formato previsto per la modalità di caricamento di un file strutturato in campi al quale si rimanda.

Collezione di files: con questa opzione i frammenti del corpus verranno scritti in file separati. In particolare TaLTaC2 creerà una cartella nella cartella di sessione dal nome "Corpus ricostruito" seguita da un suffisso che ricorda il tipo di ricostruzione che si va ad effettuare. In questa cartella verrà scritto:

·            il file delle variabili categoriali associate ai frammenti;

·                                                                                                                                                                                          una sottocartella di nome "Corpus" che conterrà i files della collezione risultante, uno per ogni frammento ovviamente. I nomi dei singoli files saranno dati dalle descrizioni dei rispettivi frammenti, cui verrà aggiunta l'estensione .txt.

Una unità lessicale per riga: con questa ultima opzione il corpus ricostruito verrà scritto "in verticale", ovvero le parole non compariranno in un flusso continuo di testo leggibile da sinistra verso destra (questo è il caso del tasto libero), ma saranno poste una sotto l'altra. Eventuali annotazioni verranno scritte sulla stessa riga separate da una tabulazione, in maniera simile a quanto avviene nella Ricostruzione per TreeTagger. I ritorni a capo e le tabulazioni, verranno sostituiti, rispettivamente, dai tag <CRLF> e <TAB>, in quanto la loro stampa come carattere altererebbe la struttura finale del file, violandola.

Opzioni generali

Sostituisci blank con underscore nelle forme lessicalizzate: l’utente può scegliere di "legare" le forme lessicalizzate tramite il carattere UNDERSCORE <_> al posto del BLANK (il semplice spazio bianco): in questo modo, passando il testo ricostruito ad un altro software, si possono mantenere le lessicalizzazioni effettuate in TaLTaC2.

Scrivi <endrowvar> alla fine della riga delle variabili: è un'opzione che si raccomanda di spuntare nel caso si stia esportando il corpus nel formato una unità lessicale per riga, con l'intenzione di reimportarlo in un secondo momento, ad esempio dopo averlo trattato con un altro software. Questo marcatore consentirà infatti a TaLTaC2 di riconoscere la struttura di frammentazione del corpus.

Scrivi variabile <id_frammento> nel corpus ricostruito: all'atto del caricamento del corpus, TaLTaCassegna ad ogni frammento un identificativo numerico univoco, l'id_frammento appunto. Con questa opzione è possibile esportare anche questa variabile, che verrà aggiunta alla fine della riga delle variabili nella corretta sintassi, e che potrà tornare utile per scopi di controllo.