Proceedings chapter
OA Policy
French

Normalisation du moyen français : comparaison de modèles pré-entraînés

Presented atNantes, 29 juin - 3 juillet 2026
First online date2026-06-29
Abstract

Pour les humanités numériques, la normalisation de documents historiques est une tâche essentielle qui consiste à réduire les variations orthographiques et à corriger les éventuelles erreurs provenant de la transcription automatique du contenu original. De nombreux travaux l’envisagent comme une tâche de traduction automatique (TA). Cependant, le manque de données parallèles pertinentes pour le domaine et pour la période historique concernée limite les performances des systèmes de TA développés et en fait une tâche comparable à la TA des langues peu dotées. Cette étude vise à évaluer les performances de modèles pré-entraînés afin de déterminer s’ils peuvent être bénéfiques pour la tâche de normalisation de textes en moyen français, pour laquelle les textes source et cible sont des variantes du français contemporain. Pour garantir que nos données ne soient pas connues des grands modèles utilisés, nous exploitons un nouveau corpus parallèle, extrait de documents administratifs rédigés au milieu du XVIe siècle en moyen français et n’ayant jamais été publiés sous leurs formes transcrite ou normalisée. L’étude compare les modèles pré-entraînés populaires en terme d’architecture, de type encodeur–décodeur et décodeur seul, ainsi qu’un modèle Transformer entraîné uniquement pour la tâche de normalisation sur nos données. Les résultats montrent que l’architecture encodeur–décodeur est la plus performante parmi les modèles évalués et soulignent l’utilité du pré-entraînement.

Ce travail a été partiellement financé par le FNS (Fonds National Suisse), subvention SSH 2022 n° 215733, pour le projet intitulé « Une édition sémantique et multilingue en ligne des registres du Conseil de Genève (1545-1550) » (acronyme RCnum). Toutes les expériences ont été réalisées sur les clusters de calcul de l’Université de Genève.

Keywords
  • Humanités numériques
  • Normalisation de textes historiques
  • Moyen français
  • Grands modèles de langue
Citation (ISO format)
RUBINO, Raphaël, CORAM-MEKKEY, Sandra, BOUILLON, Pierrette. Normalisation du moyen français : comparaison de modèles pré-entraînés. In: Actes des 33ème Conférence sur le Traitement Automatique des Langues Naturelles (TALN), volume 1 : articles scientifiques originaux. Nantes. [s.l.] : [s.n.], 2026. p. 386–404.
Main files (1)
Proceedings chapter (Accepted version)
Identifiers
  • PID : unige:195396
1views
0downloads

Technical informations

Creation11/08/2026 13:26:51
First validation20/08/2026 06:03:48
Update20/08/2026 06:03:48
Status update20/08/2026 06:03:48
Last indexation20/08/2026 06:03:49
All rights reserved by Archive ouverte UNIGE and the University of GenevaunigeBlack