Почему исходная модель ("csebuetnlp/mT5_multilingual_XLSum") дала хорошие результаты при тестировании ее на арабских образцах, но при тестировании точно настроенной модели на наборе данных XLSUM для 10 эпох она не дала хороших результатов. Хотя измерения румян хороши при тонкой настройке, потери при обучении и проверке близки к нулю.
Подробнее здесь: https://stackoverflow.com/questions/788 ... ic-dataset