Excellent work, execution, and report :). In our recent work https://
arxiv.org/abs/2508.07414, we also released a multilingual data curation pipeline for 39 languages. Training models on the data, we share the same insights, mainly cross-lingual transfer, adding multilingual data does not
Multilingual Data Curation Pipeline and Cross-Lingual Transfer Insights
By
–