|
La gestione del testo e delle variabili categoriali associate: il modello generale di Corpus
|
Previous Top Next |
In TaLTaC2 sono state ampliate le funzioni di gestione del corpus e delle variabili categoriali associate ai testi. A questo proposito è stato messo a punto un opportuno modello generale di corpus che occorre rispettare affinché sia possibile utilizzare appieno le funzionalità del programma.
Questo modello permette l’analisi di corpora dalle caratteristiche molto diverse, quali: risposte libere a domande aperte provenienti da survey, insiemi di e-mail o altra messaggistica, focus group, documenti più o meno strutturati, articoli di giornale, intere opere di un Autore, ecc.
Qualsiasi corpus, indipendentemente dalla sua natura, può essere considerato come un insieme di frammenti, riconducibili ad altrettante unità di rilevazione. Ad esempio se il corpus è costituito da risposte a domande aperte in un questionario, l’insieme delle risposte in testo libero di ogni intervistato costituisce un frammento; se il corpus è costituito da una collezione di documenti, i frammenti possono essere rappresentati dai singoli documenti.
Questa versione di TaLTaC2 ottimizza l’integrazione tra variabili testuali (espresse in testo libero) e variabili categoriali, in quanto a ciascun frammento possono essere associate più variabili categoriali. Ad esempio nel caso delle risposte a domande aperte, a ciascun frammento possono essere associate variabili come il sesso, l’età e l’istruzione (in pratica tutte le variabili non testuali di ogni intervistato). Nel caso di articoli di giornale, a ciascun articolo è associabile l'informazione della testata, della data, dell'autore, della tipologia dell'articolo.
I frammenti possono a loro volta essere suddivisi in più sezioni. Ad esempio, nel caso di un questionario con tre domande aperte, per ogni frammento si potranno avere tre sezioni, ciascuna delle quali corrisponde alla risposta fornita dall'intervistato ad una delle tre domande. Nel caso di documenti strutturati, le sezioni possono corrispondere ad altrettanti paragrafi o parti del documento: se il corpus fosse costituito da una raccolta di saggi o articoli scientifici, si potrebbero avere le seguenti sezioni: abstract, testo dell'articolo, testo delle note, riferimenti bibliografici.
TaLTaC2 accetta in generale come input file in formato <.txt>. È comunque possibile indicare come corpus anche file in formato <.doc> o <.rtf> poiché, in tal caso, TaLTaC2 provvederà automaticamente a convertirli in un formato compatibile, il formato <.tltcorpus>.
Si è scelto di adottare un sistema di codifica dei frammenti compatibile con quello usato dal software Alceste e molto vicino a quello del software Spad. Piccole trasformazioni rendono pronto il corpus di Taltac per essere sottoposto a questi due software.