18
Indefinito/Interdisciplinare
UNIVERSITÀ DEGLI STUDI DI NAPOLI "L'ORIENTALE"
Dati Generali
Periodo di attività
Syllabus
Obiettivi Formativi
Al termine dell'insegnamento lo/la studente/essa dovrà dimostrare di conoscere e saper comprendere:
• la distinzione fra byte e caratteri e i principi della codifica dei caratteri (ASCII, ISO 8859, UTF-8);
• il modello Unicode (code point, caratteri combinanti, normalizzazione, direzionalità) con riferimento alle scritture asiatiche e africane studiate nel Corso di Studio;
• i principi dell'archiviazione digitale di un corpus testuale: formati sostenibili, metadati, documentazione, licenze e deposito;
• gli strumenti di base per l'interrogazione di un corpus (espressioni regolari, concordanze, frequenze, collocazioni) e i loro limiti.
CAPACITÀ DI APPLICARE CONOSCENZA E COMPRENSIONE
Il percorso formativo intende fornire allo/a studente/essa gli strumenti metodologici necessari per:
• riconoscere, diagnosticare e correggere un errore di codifica in un file di testo nella lingua studiata;
• costituire, documentare e archiviare un piccolo corpus multilingue in testo semplice, con la relativa tabella dei metadati;
• definire e dichiarare una regola di segmentazione adeguata alla propria scrittura;
• interrogare un corpus con espressioni regolari e produrre concordanze, frequenze e collocazioni, interpretandone i risultati.
ULTERIORI RISULTATI DI APPRENDIMENTO ATTESI
Autonomia di giudizio:
al termine dell'insegnamento lo/la studente/essa dovrà dimostrare di saper valutare l'adeguatezza di un formato, di uno strumento e di un criterio di segmentazione rispetto al sistema di scrittura e alla domanda di ricerca, e di saper riconoscere i limiti e le distorsioni degli strumenti automatici (OCR, traduzione automatica, modelli linguistici) e dei dati di frequenza.
Abilità comunicative:
al termine dell'insegnamento lo/la studente/essa dovrà dimostrare di saper descrivere con terminologia appropriata le scelte di codifica, metadatazione, segmentazione e analisi adottate; di saper redigere una documentazione comprensibile a terzi; di saper presentare e discutere il proprio lavoro anche in contesti interdisciplinari.
Capacità di apprendimento:
al termine dell'insegnamento lo/la studente/essa dovrà aver acquisito la capacità di apprendere autonomamente nuovi strumenti a partire dalla documentazione ufficiale e di trasferire il metodo acquisito ad altre lingue, scritture e tipologie di materiali, anche in vista della prova finale.
Prerequisiti
Metodi didattici
• Lezioni frontali: 5 ore (introduzione ai concetti e dimostrazioni guidate su esempi condivisi);
• Esercitazioni: 6 ore (esercizi progressivi su testi selezionati);
• Laboratorio: 5 ore (metadatazione, segmentazione e analisi con Orange);
• Seminari e altre attività: 2 ore (revisione tra pari della documentazione e discussione dei progetti individuali).
Esercitazioni e laboratorio si svolgono su corpora comuni forniti dal docente, così che i risultati siano confrontabili in tempo reale; l'elaborato finale è invece svolto individualmente su un corpus costituito dallo/a studente/essa in una lingua a scelta, con attività non assistite di raccolta, pulizia, documentazione e redazione della relazione.
L'intero percorso si svolge con strumenti liberi e gratuiti, Orange con il componente aggiuntivo Text, affiancato da un editor di testo semplice: non è richiesta l'installazione di ambienti di programmazione né la scrittura di codice. Il programma va installato prima del primo incontro.
Verifica Apprendimento
1. un elaborato individuale, consegnato prima dell'appello, svolto su un corpus costituito dallo/a studente/essa in una lingua a scelta (10-20 testi in formato di testo semplice codificato in UTF-8) e comprendente: la tabella dei metadati; un file di documentazione (README) che dichiari fonti, criteri di selezione, licenza, interventi di normalizzazione e profilo di segmentazione adottato (regola di tokenizzazione, caratteri interni alla parola, punteggiatura eliminata); il workflow di Orange utilizzato, salvato e rieseguibile; una relazione di 3-4 pagine con un'analisi elementare del corpus (concordanze, frequenze o collocazioni) e la discussione critica dei risultati;
2. una prova orale di presentazione e discussione dell'elaborato, estesa alle nozioni teoriche e metodologiche del corso.
Non sono previste prove intermedie valutate; è prevista una consegna intermedia, svolta sul corpus comune del laboratorio, oggetto di feedback formativo non valutato.
Criteri di valutazione: correttezza tecnica della codifica e della normalizzazione; qualità e completezza dei metadati e della documentazione; coerenza dei criteri di costituzione del corpus; adeguatezza e motivazione del profilo di segmentazione; riproducibilità dell'analisi, verificata rieseguendo il workflow consegnato sui file consegnati; capacità di interpretare criticamente i risultati e di riconoscerne i limiti; chiarezza espositiva e proprietà terminologica.
Testi
Testi di riferimento per l'insegnamento:
• S. Moran, M. Cysouw, The Unicode Cookbook for Linguists, Language Science Press, 2018 (accesso aperto, CC-BY: https://langsci-press.org/catalog/book/176).
• Orange Data Mining, documentazione e materiali didattici (https://orangedatamining.com).
• Orange3 Text Mining, documentazione dei widget (https://orange3-text.readthedocs.io/).
• W3C Internationalization, Choosing & applying a character encoding (https://www.w3.org/International/questions/qa-choosing-encodings).
Letture consigliate per l'approfondimento:
• TEI Consortium, TEI P5 Guidelines, capitoli "Languages and Character Sets" e "Characters, Glyphs, and Writing Modes" (https://tei-c.org/guidelines/).
• The Programming Historian, lezioni su costruzione e analisi di corpora (https://programminghistorian.org/en/lessons/).
Tutti i materiali sono gratuitamente accessibili in rete.
Contenuti
Elenco degli argomenti:
1. Il testo come dato: formati aperti e proprietari; codifiche dei caratteri (ASCII, ISO 8859, UTF-8) e diagnosi degli errori di codifica;
2. Unicode e le scritture asiatiche e africane: code point, caratteri combinanti, normalizzazione (NFC/NFD), direzionalità; codifica, font e resa a schermo;
3. Acquisizione e archiviazione dei testi: fonti digitali, OCR/HTR e trascrizione; pulizia e nomenclatura; metadati (Dublin Core), documentazione, licenze, deposito e identificativi persistenti;
4. Ricerca e segmentazione: espressioni regolari; regole di tokenizzazione per la propria lingua, definite e dichiarate; limiti dei modelli automatici, esistenti solo per alcune lingue;
5. Elaborazione di base di un corpus con Orange e il componente Text: concordanze KWIC, frequenze, collocazioni, confronto fra sottocorpora; il workflow come documentazione riproducibile; verifica critica degli strumenti automatici.