We are the AI4Text Group, part of the Artificial Intelligence for Media and Humanities Laboratory at the Institute of Information Science and Technologies "Alessandro Faedo" (ISTI-CNR) based in Pisa, Italy. Our recent work focuses on the development of quantification methods, the assessment of complex abilities of Large Language Models, and several downstream applications of NLP technologies.

News

Older posts…

Research Areas

Quantification

Development of quantification algorithms to estimate class prevalence

Complex Abilities of LLMs

Assessment of Large Language Models’ complex capabilities on multiple settings

NLP Applications

Techniques for downstream tasks such as Authorship Analysis and Text Classification

Recent Publications

2026
Uncertainty-Aware Classifier Accuracy Prediction under Prior Probability Shift.
Lorenzo Volpi, Alejandro Moreo, and Fabrizio Sebastiani.
Proceedings of the 1st International Workshop on Quantification and Classification under Dataset Shift, QCDS 2026, Napoli, Italy, September 7, 2026.
2026
Benchmarking accuracy and bias on encyclopedic knowledge in (vision-)language models.
Maria Cassese, Giovanni Puccetti, and Andrea Esuli.
Expert Systems with Applications.
2026
Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI.
Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Abassy, Saadeldine Eletter, Kareem Ashraf Elozeiri, Nurkhan Laiyk, Maiya Goloburda, Tarek Mahmoud, Raj Vardhan Tomar, Alexander Aziz, Ryuto Koike, Masahiro Kaneko, Artem Shelmanov, Ekaterina Artemova, Vladislav Mikhailov, Akim Tsvigun, Alham Fikri Aji, Nizar Habash, Iryna Gurevych, and Preslav Nakov.
Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2026, San Diego, California, United States, July 2-7, 2026.
2026
Gretino: A Greek and Latin Dataset to Benchmark Retrieval Systems in Classical Languages.
Hawau Olamide Toyin, Federico Iezzi, Elia Scapini, Giulio Federico, and Giovanni Puccetti.
Proceedings of the 15th Language Resources and Evaluation Conference, LREC 2026, Palma de Mallorca, Spain, May 13-15, 2026.
2026
GSM-Identity: Evaluating Mathematical Reasoning in LLMs via Equivalence Transformations.
Kajal Negi, Giovanni Puccetti, and Andrea Esuli.
Mach. Learn. 115(4).
2026
Misspellings in natural language processing: A survey of recent literature.
Gianluca Sperduti and Alejandro Moreo.
Natural Language Processing 32(2).
2026
DeSegMa-IT at EVALITA 2026: Overview of the Detection and Segmentation of Machine Generated Texts in Italian.
Giovanni Puccetti, Andrea Pedrotti, and Andrea Esuli.
Proceedings of the 9th Evaluation Campaign of Natural Language Processing and Speech Tools for Italian. Final Workshop (EVALITA 2026).
2025
PSET: a Phonetics-Semantics Evaluation Testbed.
Gianluca Sperduti and Dong Nguyen.
Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, EMNLP, Suzhou, China, November 4-9, 2025.
2025
How Humans and LLMs Organize Conceptual Knowledge: Exploring Subordinate Categories in Italian.
Andrea Pedrotti, Giulia Rambelli, Caterina Villani, and Marianna Bolognesi.
Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2025, Vienna, Austria, July 27-31, 2025.
2025
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors.
Andrea Pedrotti, Michele Papucci, Cristiano Ciaccio, Alessio Miaschi, Giovanni Puccetti, Felice Dell'Orletta, and Andrea Esuli.
Findings of the Association for Computational Linguistics: ACL 2025.
2025
DIACU: A dataset for the DIAchronic analysis of Church Slavonic.
Maria Cassese, Giovanni Puccetti, Marianna Napolitano, and Andrea Esuli.
Proceedings of the 10th Workshop on Slavic Natural Language Processing (Slavic NLP 2025).
2025
Quantification using permutation-invariant networks based on histograms.
Olaya Perez Mon, Alejandro Moreo, Juan Jose Coz, and Pablo Gonzalez.
Neural Computing and Applications. 37(5).
2025
Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation.
Luca Moroni, Giovanni Puccetti, Pere-Lluis Huguet Cabot, Andrei Stefan Bejgu, Alessio Miaschi, Edoardo Barba, Felice Dell'Orletta, Andrea Esuli, and Roberto Navigli.
Findings of the Association for Computational Linguistics: NAACL 2025.
2025
Kernel density estimation for multiclass quantification.
Alejandro Moreo, Pablo Gonzalez, and Juan Jose Coz.
Machine Learning. 114(4).
2025
REVERINO: REgesta generation VERsus latIN summarizatiOn.
Giovanni Puccetti, Laura Righi, Ilaria Sabbatini, and Andrea Esuli.
Proceedings of the 21st Conference on Information and Research science Connecting to Digital and Library science, Udine, Italy, February 20-21, 2025.
2025
Automatic Annotation of Legal References (Allegationes) in the Liber Extra's Ordinary Gloss.
Andrea Esuli, Vincenzo Roberto Imperia, and Giovanni Puccetti.
Proceedings of the 21st Conference on Information and Research science Connecting to Digital and Library science, Udine, Italy, February 20-21, 2025.
2025
The Invalsi Benchmarks: measuring the Linguistic and Mathematical understanding of Large Language Models in Italian.
Giovanni Puccetti, Maria Cassese, and Andrea Esuli.
Proceedings of the 31st International Conference on Computational Linguistics, COLING 2025, Abu Dhabi, UAE, January 19-24, 2025.

Tenured Members

Fabrizio Sebastiani
Director of Research
Andrea Esuli
Director of Research
Alejandro Moreo
Senior Researcher

Postdocs

Alumni

Alessio Molinari Ph.D 2023. Now Data Scientist at STRG, Vienna, Austria
Silvia Corbara Ph.D 2024. Now Data Scientist at SET, Cesena, Italy