|
Collezione di file
|
Previous Top Next |
Il Corpus da importare in TaLTaC2 può essere costituito da una collezione di file in formato < .txt >, < .doc > e/o <.rtf>, contenuti all’interno di una cartella e di sue eventuali sottocartelle, a cui può essere associata la descrizione di caratteristiche categoriali organizzate in un foglio elettronico tipo Excel, salvato in formato testo con tabulatori.
Questa funzione provvede all'inserimento dei contenuti testuali dei file della collezione in un'unico file che avrà il nome: < cartella_della_collezione.tltCorpus >. Questo file è il file del Corpus e verrà creato nella cartella madre in cui sono presenti i singoli file di testo e sarà identificabile dall'estensione < .tltcorpus > associata al nome della stessa cartella.
In questo caso, ogni singolo file viene considerato un frammento di testo. Pertanto, non dovranno essere presenti le righe di identificazioni dei frammenti all'interno dei file: sarà infatti TaLTaC2 ad inserirle automaticamente nel file di output tra un frammento e l'altro, assumendo come descrizione di ogni frammento il nome del file (senza estensione) che ne ha originato il testo.
Per associare a ciascun file/frammento anche le variabili categoriali, si dovrà fare uso di un file con estensione < .txt >organizzato in campi. Questo file (si consiglia di utilizzare Excel o un qualsiasi programma di foglio elettronico per la compilazione e alla fine eseguirne il salvataggio in formato < .txt > testo con tabulatore ) dovrà essere strutturato come nell’esempio che segue:
|
DescFramm
|
Data
|
Luogo
|
Tipo
|
|
Art1.txt
|
01/01/2000
|
ITALIA, Nord
|
dossier
|
|
...............
|
………….
|
………….
|
………….
|
|
ArtN.doc
|
31/12/2005
|
ITALIA, Sud
|
boxed story
|
dove:
· la prima riga contiene sempre l'intestazione dei nomi dei campi corrispondenti alla denominazione del frammento e alle sue diverse variabili categoriali;
· le righe successive contengono i rispettivi valori di ogni campo, ossia:
- il primo (DescFramm nell'esempio) deve contenere il nome dei file comprensivi di estensioni (< .txt >, < .doc > e/o <.rtf>);
- i k campi successivi (Data, Luogo e Tipo nell'esempio) devono contenere i valori delle rispettive variabili (è ammesso anche un valore nullo nelle celle).
Se si intende suddividere il testo in più sezioni, occorrerà invece inserire le righe di identificazione delle sezioni all'interno di ciascun file.
Dal menù File scegliere Corpus e quindi Seleziona/Assembla/Struttura.
Si aprirà la maschera Selezione del Corpus.
Premere il tasto Collezione di file.
Indicare la cartella contenente i file di testo premendo il tasto Sfoglia della casella Cartella contenente la collezione di file del Corpus.
Le eventuali sottocartelle sono incluse per default; deselezionare l’opzione Includi le sottocartelle qualora non si volesse includerle.
Indicare il file (opzionale) con la descrizione della variabili categoriali, premendo il secondo tasto Sfoglia.
Premere OK per dare avvio alla procedura di creazione del corpus.
NOTA: Si tenga conto che a questo punto si è in possesso di un file che corrisponde alle specifiche di un corpus in formato file singolo. Pertanto, se si volesse utilizzare questo corpus con una nuova sessione, basterà indicarlo come corpus in formato file singolo di questa nuova sessione, senza dover ripetere la procedura di composizione a partire dalla collezione di file.
Al termine TaLTaC2 chiederà se eseguire il parsing (vedi la voce Parsing del Corpus).
SUGGERIMENTO: Il foglio elettronico contenente la descrizione delle variabili categoriali può essere utilizzato anche come filtro per i documenti da includere nel corpus che verrà acquisito da TaLTaC2.
Basterà, infatti, cancellare dallo stesso file ia riga relativa a quei file che non si desidera includere. TaLTaC2, non trovando il riferimento a questi file nel foglio elettronico, non li includerà automaticamente.