36
Didattica delle lingue moderne
UNIVERSITÀ DEGLI STUDI DI NAPOLI "L'ORIENTALE"
Dati Generali
Periodo di attività
Syllabus
Obiettivi Formativi
Conoscenze e capacità di comprensione
Al termine del corso, gli studenti avranno acquisito conoscenze sui principi, i metodi e gli strumenti per la raccolta, la documentazione e la selezione dei dati linguistici destinati allo sviluppo e alla valutazione dei sistemi di traduzione automatica neurale e basati su Large Language Models. Comprenderanno le principali tecniche di adattamento al dominio, integrazione della terminologia specialistica, prompting e fine-tuning per la traduzione automatica, nonché i criteri di valutazione della qualità traduttiva.
Capacità di applicare conoscenza
Gli studenti saranno in grado di applicare le conoscenze acquisite per selezionare e preparare risorse linguistiche adeguate a specifici scenari traduttivi, utilizzare strategie di prompting e adattamento dei modelli, analizzare le prestazioni dei sistemi di traduzione automatica in differenti domini applicativi e interpretarne criticamente i risultati mediante appropriati metodi di valutazione.
Autonomia di giudizio
Gli studenti svilupperanno la capacità di valutare criticamente l'idoneità dei dati, delle metodologie e degli strumenti impiegati nella traduzione automatica, formulando giudizi autonomi sull'efficacia delle diverse strategie di adattamento e sull'impatto di bias, limiti metodologici, aspetti etici e qualità delle traduzioni prodotte.
Abilità comunicative
Gli studenti saranno in grado di utilizzare con proprietà il lessico specialistico del settore e di presentare in modo chiaro e rigoroso analisi, risultati e valutazioni relative ai sistemi di traduzione automatica, argomentando le proprie scelte metodologiche sia in forma orale sia scritta.
Capacità di apprendimento
Gli studenti svilupperanno la capacità di aggiornare autonomamente le proprie conoscenze in un settore caratterizzato da rapida evoluzione tecnologica, consultando criticamente la letteratura scientifica, la documentazione tecnica e le risorse disponibili, e acquisendo nuove metodologie e strumenti per l'analisi e il miglioramento dei sistemi di traduzione automatica.
Prerequisiti
Metodi didattici
Lezioni frontali con supporto di slide e dimostrazioni pratiche con esercitazioni guidate.
Verifica Apprendimento
Lingua dell’esame: Italiano.
Struttura della prova Prova orale sugli argomenti trattati durante il corso Partecipazione attiva: valutazione della partecipazione alle attività seminariali (per frequentanti).
Criteri di valutazione e griglia dei voti
- 30 – 30L: Risultati eccellenti. Ottima comprensione dei contenuti, uso appropriato della terminologia metalinguistica, eccellente capacità di applicazione e autonomia di giudizio.
- 27 – 29: Risultati sopra la media, con errori marginali. Buona conoscenza dei concetti e competenza nell’applicazione.
- 24 – 26: Livello buono ma con alcune lacune. Comprensione adeguata dei contenuti, discreta applicazione delle conoscenze.
- 21 – 23: Risultati sufficienti, presenza di lacune significative. Capacità minima di collegamento tra teoria e pratica.
- 18 – 20: Conoscenza di base limitata, applicazione parziale delle competenze.
- < 18: Insufficiente. Non sono stati acquisiti i concetti fondamentali. L’esame dovrà essere ripetuto.
Testi
Blasi, D., Anastasopoulos, A., & Neubig, G. (2022). Systematic inequalities in language technology performance across the world's languages. In Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1), pp. 5486–5493.
Branco, A., Eskevich, M., Frontini, F., Hajič, J., Hinrichs, E., Jong, F. D., ... & Zinn, C. (2023). The CLARIN infrastructure as an interoperable language technology platform for SSH and beyond. Language Resources and Evaluation, pp. 4359–4385.
Briva-Iglesias, V., Camargo, J. L. C., & Dogru, G. (2024). Large language models "ad referendum": How good are they at machine translation in the legal domain?, pp. 1–22.
Costa-Jussà, M. R., Cross, J., Çelebi, O., Elbayad, M., Heafield, K., Heffernan, K., ... & NLLB Team. (2022). No language left behind: Scaling human-centered machine translation. (selected material), pp. 4–46, pp. 128–131.
Cui, X., Huang, Z., & Adel, N. (2025). Bias in, Bias out: Annotation bias in multilingual large language models. In Proceedings of the Interdisciplinary Workshop on Observations of Misunderstood, Misguided and Malicious Use of Language Models, pp. 1–8.
Liu, Y., Cao, J., Liu, C., Ding, K., & Jin, L. (2025). Datasets for large language models: A comprehensive survey. Artificial Intelligence Review, 58(12), 403, pp. 1–62.
Lu, H., Yang, H., Huang, H., Zhang, D., Lam, W., & Wei, F. (2024, November). Chain-of-dictionary prompting elicits translation in large language models. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pp. 958–967.
Maurer, M., Linde, M., & Lapesa, G. (2026). Who and What? Using Linguistic Features and Annotator Characteristics to Analyze Annotation Variation, pp. 1–9.
Moslem, Y., Haque, R., Kelleher, J., & Way, A. (2022). Domain-specific text generation for machine translation. In Proceedings of the 15th Biennial Conference of the Association for Machine Translation in the Americas (Volume 1), pp. 14–23.
Moslem, Y., Romani, G., Molaei, M., Kelleher, J., Haque, R., & Way, A. (2023). Domain terminology integration into machine translation: Leveraging large language models. In Proceedings of the Eighth Conference on Machine Translation, pp. 902–907.
Noll, R., Frischen, L. S., Boeker, M., Storf, H., & Schaaf, J. (2023). Machine translation of standardised medical terminology using natural language processing: A scoping review. New Biotechnology, 77, pp. 120–128.
Opitz, J., Wein, S., & Schneider, N. (2025). Natural language processing relies on linguistics. Computational Linguistics, 51(3), pp. 1009–1020.
Palmer, M., & Xue, N. (2010). Linguistic annotation. In The Handbook of Computational Linguistics and Natural Language Processing, pp. 238–269.
Pang, J., Ye, F., Wong, D. F., Yu, D., Shi, S., Tu, Z., & Wang, L. (2025). Salute the classic: Revisiting challenges of machine translation in the age of large language models. Transactions of the Association for Computational Linguistics, 13, pp. 73–87.
Poncelas, A., Shterionov, D., Way, A., de Buy Wenniger, G. M., & Passban, P. (2018). Investigating backtranslation in neural machine translation. In Proceedings of the 21st Annual Conference of the European Association for Machine Translation, pp. 249–256.
Röttger, P., Vidgen, B., Hovy, D., & Pierrehumbert, J. (2022). Two contrasting data annotation paradigms for subjective NLP tasks. In Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp. 1–5.
Singh, S., Romanou, A., Fourrier, C., Adelani, D. I., Ngui, J. G., Vila-Suero, D., ... & Hooker, S. (2025). Global MMLU: Understanding and addressing cultural and linguistic biases in multilingual evaluation. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 18761–18769, pp. 18777–18785.
Wang, W., Watanabe, T., Hughes, M., Nakagawa, T., & Chelba, C. (2018). Denoising neural machine translation training with trusted data and online data selection. In Proceedings of the Third Conference on Machine Translation: Research Papers, pp. 133–142.
Wassie, A. K., Molaei, M., & Moslem, Y. (2024). Domain-specific translation with open-source large language models: Resource-oriented analysis, pp. 1–9.
Zeng, J., Meng, F., Yin, Y., & Zhou, J. (2024). Teaching large language models to translate with comparison. In Proceedings of the AAAI Conference on Artificial Intelligence (38(17)), pp. 19488–19494.
Tutti i testi sono disponibili on-line.
Contenuti
Il corso affronta il ruolo dei dati linguistici nello sviluppo e nella valutazione delle tecnologie della traduzione, con particolare attenzione ai modelli linguistici di grandi dimensioni (LLM) e alla traduzione automatica neurale (NMT). Verranno esaminati la qualità, la rappresentatività e la documentazione dei dati linguistici, le strategie di adattamento al dominio, l'integrazione della terminologia specialistica, le tecniche di prompting e fine-tuning per la traduzione, nonché metodologie di addestramento quali backtranslation e data selection. Il corso approfondirà inoltre la traduzione in domini specialistici (giuridico e medico), le lingue a bassa disponibilità di risorse, gli aspetti linguistici, etici e di bias nei sistemi di traduzione automatica e il contributo della linguistica allo sviluppo di tecnologie linguistiche affidabili e inclusive.
Lingua Insegnamento
Italiano
Altre informazioni
Il corso si caratterizza per un approccio integrato tra lezioni teoriche ed esercitazioni pratiche, per cui si consiglia vivamente una partecipazione regolare e attiva. Durante le lezioni verranno utilizzati materiali online e strumenti digitali di supporto, la cui consultazione autonoma è fondamentale per un apprendimento completo ed efficace.
L’interazione in aula e nei laboratori favorisce lo sviluppo di competenze critiche e operative essenziali per la preparazione all’esame e per la formazione nel campo della traduzione.