Scientific article
OA Policy
English

Towards Robust Synthetic Data Generation for Simplification of Text in French

Published inMachine learning and knowledge extraction, vol. 7, no. 3, no. Knowledge Graphs and Large Language Models, p. 22
First online date2025-07-19
Abstract

We present a pipeline for synthetic simplification of text in French that combines large language models with structured semantic guidance. Our approach enhances data generation by integrating contextual knowledge from Wikipedia and Vikidia articles and injecting symbolic control through lightweight knowledge graphs. To construct document-level representations, we implement a progressive summarization process that incrementally builds running summaries and extracts key ideas. Simplifications are generated iteratively and assessed using semantic comparisons between input and output graphs, enabling targeted regeneration when critical information is lost. Our system is implemented using LangChain’s orchestration framework, allowing modular and extensible coordination of LLM components. Evaluation shows that context-aware prompting and semantic feedback improve simplification quality across successive iterations.

Keywords
  • Text simplification
  • Synthetic data generation
  • Large language models
  • LangChain
Research groups
Citation (ISO format)
TSOURAKIS, Nikolaos. Towards Robust Synthetic Data Generation for Simplification of Text in French. In: Machine learning and knowledge extraction, 2025, vol. 7, n° 3, p. 22. doi: 10.3390/make7030068
Main files (1)
Article (Published version)
Identifiers
Additional URL for this publicationhttps://www.mdpi.com/2504-4990/7/3/68
Journal ISSN2504-4990
34views
359downloads

Technical informations

Creation23/07/2025 15:04:56
First validation28/07/2025 09:54:14
Update27/03/2026 14:09:43
Status update27/03/2026 14:09:43
Last indexation27/03/2026 14:11:57
All rights reserved by Archive ouverte UNIGE and the University of GenevaunigeBlack