Eine Stimme, die aus einer englischen Probe geklont wurde, kann Japanisch sprechen. Die Sprache ist eine Einstellung der Generierung, keine Eigenschaft der Probe - ein Klon deckt also alle zehn ab.
Sprache, Stimme und Engine sitzen im selben Feld wie das Skript. Ändern Sie die Sprache, erzeugen Sie erneut, und dieselbe Stimme liest in der neuen - genau das ist der Sinn davon, einmal zu klonen, statt einen Sprecher zehnmal aufzunehmen.
Das Diktat funktioniert andersherum: Es transkribiert, was Sie aufgenommen haben, und die optionale Bereinigung, die Füllwörter entfernt und die Zeichensetzung wiederherstellt, bleibt in der Sprache, die Sie tatsächlich gesprochen haben, statt sie zu übersetzen.