Sezioni
Previous Top Next

Da questo menu si accede alle funzioni che permettono il riconoscimento ex-post, ovvero dopo aver effettuato il parsing, delle sezioni. E' cioè possibile acquisire un corpus che non presenti gli identificatori di sezioni nei frammenti (le righe che iniziano con quattro +), ma che magari possieda una qualche struttura che si ripete per ogni frammento, ad esempio una suddivisione in paragrafi tutti con lo stesso titolo o quasi, e sfruttare questa suddivisione dei frammenti per creare le sezioni.

Occorre pertanto:

- innanzitutto impostare gli identificatori di sezione, ovvero definire quali siano, all'interno del testo, le "entità" che rappresentano l'inizio di ogni sezione;

- quindi passare all'identificazione vera e propria;

- infine TaLTaC2 mette a disposizione due strumenti, (Mostra frammenti con sezioni non riconosciute e Concordanze delle etichette di sezione) per controllare il buon esito dell'operazione ed eventualmente correggere possibili malriconoscimenti.

Questa funzione risulta particolarmente utile nel caso in cui il corpus derivi da una collezione di file, in particolare quando tali file possiedano una struttura comune. Si pensi a documenti scientifici, che presentano sempre un abstract, un'introduzione e poi il contenuto, oppure alle rassegne stampa, in cui gli articoli sono sempre suddivisibili almeno in titolo e testo. Questa funzione evita di dover introdurre manualmente le righe di identificazione delle sezioni direttamente nei file di testo, compito ovviamente molto lungo e oneroso, ma consente di sfruttare la struttura stessa dei file per raggiungere lo scopo.