|
Text/Data Mining
|
Previous Top Next |
Text/Data mining è il modulo di TaLTaC2 per la ricerca e selezione di record all'interno delle tabelle.
Una volta aperta una tabella e selezionata una colonna, cliccando sul comando Text/Data mining, accessibile dal Menù Record, viene visualizzata l'omonima
maschera. Alla maschera si accede anche cliccando sul bottone nella barra
delle applicazioni
Dalla maschera è possibile effettuare i seguenti tipi di selezione dei record, molto utili per l’estrazione di informazione dalle liste/tabelle.
· Criteri predefiniti: da questa casella a tendina è possibile selezionare una query predefinita. La query predefinita non è altro che un set di query elementari già predisposte dall'utente. Il risultato della query si traduce nella selezione dei record cercati e nella scrittura nel campo <Informazioni aggiuntive> della tabella di una label uguale al titolo della query (es.: N_astratto).
Una query predefinita è utile per individuare gruppi particolari di parole; di default TaLTaC2 ne propone alcuni:
- Nomi astratti (forme che terminano per à, ezza, aggio, etc. …);
- Linguaggio geo-politico (parole con suffisso ismo/ista);
- Numeri ordinali (forme che terminano per esimo/a/e/i);
- Coorti (forme che terminano per enne - quindicenne, settantaseienne ecc.)
Le query predefinite sono registrate nel file <Query predefinite.txt> presente nella cartella di installazione di TaLTaC2 (di solito C:\Programmi\TALTAC). Tale file può essere personalizzato con l’aggiunta di ulteriori query, seguendo le istruzioni che vi sono riportate all'inizio;
· il secondo criterio permette di effettuare selezioni utilizzando gli operatori logici <uguale a>, <minore/maggiore di>, <minore/maggiore o uguale a>, <diverso da>, particolarmente utile per campi numerici. In campi alfabetici, può essere utilizzato per cercare parole intere (CaseSensitive) con la condizione "=";
· il terzo criterio (Record compresi tra) permette di specificare un range di validità con cui effettuare la selezione. Ad esempio, se si vogliono selezionare le parole con occorrenze totali comprese tra 10 e 100 (inclusi), è sufficiente specificare questi due valori nei campi <tra> ed <e>. Questo criterio funziona anche sulla stringhe di testo. Ad esempio se si vogliono selezionare tutte le parole che iniziano per “a” e “c” è sufficiente specificare tra <a> e <d> (nel caso di testo, il limite superiore non è compreso);
ATTENZIONE: Bisogna specificare sempre il limite inferiore nella casella "Da" ed il limite superiore nella casella "A" .
· il quarto criterio (records LIKE) permette di effettuare delle selezioni molto articolate su campi alfabetici. Tale criterio consente di utilizzare i caratteri jolly, elenchi di caratteri o intervalli di caratteri in qualsiasi combinazione. La seguente tabella indica i caratteri utilizzabili e il relativo significato:
|
Carattere/i in criterio
|
Corrispondenze in stringa
|
|
?
|
Qualsiasi carattere singolo
|
|
*
|
Zero o più caratteri
|
|
[0-9]
|
Qualsiasi cifra singola (0-9)
|
|
[elencocaratteri]
|
Qualsiasi carattere singolo in elencocaratteri
|
|
[!elencocaratteri]
|
Qualsiasi carattere singolo non compreso in
elencocaratteri
|
Le ricerche effettuate tramite il criterio record Like sono di tipo Case Insensitive, pertanto non distinguono le differenze tra caratteri maiuscoli e minuscoli. Pertanto, scrivendo nella casella la parola terra, verranno recuperati tutti i record che nel campo selezionato contengono terra, Terra, TERRA, tErRa ecc.
Gli esempi seguenti si riferiscono a selezioni effettuate sul campo POLIFORME del lessico FDP:
per* seleziona i poliformi che iniziano con <per> (per esempio, per definizione, ecc.);
per*ione seleziona i poliformi che iniziano con <per> e finiscono in <ione> (per definizione, per combinazione);
[s-z]* seleziona i poliformi che iniziano con s, t, u v, z;
in base ? seleziona il poliforme <in base a>;
*[0-9]* seleziona tutti i poliformi contenenti delle cifre (dalle 21 di, alle 21 di);
· il criterio Multiword expressions consente di selezionare tutti i poliformi (in pratica equivale ad impostare il criterio Record LIKE a "* *");
· il quinto criterio (Records con campo) permette di selezionare i record con campo vuoto (utile ad es. per cercare i record senza Categoria grammaticale, ossia le parole sconosciute a TaLTaC2 ) oppure, in alternativa, i record con campo non vuoto;
· il sesto criterio (Records con iniziale) consente di selezionare i records con iniziale maiuscola, utile per le analisi sui nomi propri, o, in alternativa, minuscola.
Le selezioni possono essere effettuate sull’intera lista/tabella (opzione predefinita) o su una selezione di records. Se si desidera effettuare una selezione solo sui record già selezionati (e quindi visibili), spuntare l’opzione Applica solo ai records visibili.
Generalmente le operazioni di selezione possibili con la maschera Text/Data mining prevedono la visualizzazione dei record che rispondono ai criteri selezionati. È però possibile anche eliminare i records, scegliendo la voce Elimina dal riquadro Operazione da eseguire sui records selezionati in base ai criteri. Tale opzione deve essere scelta con cautela, soprattutto se si sta lavorando sulla tabella Vocabolario, perché comporta l’eliminazione irreversibile dei record dalla lista.
ATTENZIONE: se si cancellano dei record sulla tabella Vocabolario non sarà più possibile effettuare correttamente la ricostruzione del Corpus. Se si desidera eliminare record dalla tabella vocabolario si consiglia di lavorare su un duplicato (utilizzando il comando Salva nel DB di Sessione da Menù File).
E' possibile, inoltre, conservare per successive elaborazioni il criterio di selezione corrente scegliendo l’opzione Aggiungi a piano di lavoro. In questo modo si procede alla costruzione di una query complessa, data cioè dall'insieme di più selezioni, che viene memorizzata da TaLTaC2 così da renderla disponibile in futuro, per qualsiasi tabella, nelle successive sessioni di lavoro, anche in quelle diverse da quella utilizzata per creare il piano di lavoro.
Un piano di lavoro si compone, pertanto, di più istruzioni di selezione che vengono svolte in sequenza. Ad ogni istruzione di selezione è possibile associare una operazione di scrittura di una etichetta, definibile a piacere dall'utente, in un qualsiasi campo alfabetico della medesima tabella. Rispetto ad una query predefinita, il piano di lavoro permette operazioni più complesse e riunisce sotto un solo piano anche query di che possono operare selezioni su campi differenti e scrivere etichette diverse in campi diversi (si ricorda che una query predefinita può operare selezioni solo su un campo alla volta e scrive sempre la medesima etichetta nel solo campo Informazioni aggiuntive).
Scegliendo l’opzione Aggiungi a piano di lavoro, TaLTaC2 aprirà una nuova maschera, in cui bisognerà indicare:
- il nome del piano di lavoro (con il quale poterlo richiamare in seguito). E' possibile aggiungere l'operazione di selezione corrente ad un piano già esistente semplicemente scegliendo il nome del piano desiderato dal menu a tendina della casella Piano di lavoro. Per creare un nuovo piano in cui inserire l'operazione di selezione corrente, digitare il nome del nuovo piano nella medeseima casella;
- il campo in cui scrivere l'etichetta;
- l'etichetta da inserire.
Le istruzioni, in linguaggio SQL, vengono inserite automaticamente con la sintassi corretta nel file <Piani di lavoro.txt> contenuto nella cartella di installazione di TaLTaC2. Tale file può essere successivamente modificato o ampliato anche manualmente.
Ovviamente c'è libertà di scrivere l'etichetta nel campo che più conviene, in funzione delle analisi da farsi. Si ricorda di non scrivere mai nel campo Forma grafica (si consiglia di utilizzare i campi Informazioni aggiuntive e Cat_Sem).