Голос, клонированный по английскому образцу, может говорить по-японски. Язык - это настройка генерации, а не свойство образца, поэтому одного клона хватает на все десять.
Язык, голос и движок - в одном окне вместе с текстом. Смените язык, сгенерируйте заново, и тот же голос прочитает текст на новом - ради этого голос и клонируют один раз, вместо того чтобы десять раз записывать диктора.
Диктовка работает наоборот: она расшифровывает то, что вы записали, а необязательная очистка, которая убирает слова-паразиты и восстанавливает пунктуацию, остаётся на том языке, на котором вы действительно говорили, и ничего не переводит.