Die eigene Stimme klonen – kostenlos und auf dem eigenen Rechner

Ausschnitt aus dem Moodle-Kurs: Chiara und Kaja fassen Terme mit den Variablen a und b zusammen
Aus diesem Kursausschnitt hat eine KI den Sprechtext für Beispiel 2 automatisch abgelesen – und dabei von selbst ein „Chiara sagt“ eingefügt.

Anleitungen im Moodle-Kurs vorlesen lassen – und zwar mit meiner eigenen Stimme, ohne jeden Text selbst einsprechen zu müssen? Das geht inzwischen erstaunlich gut. Ich nutze dafür das frei verfügbare Sprachmodell XTTS v2 (über das Python-Paket coqui-tts). Das Besondere: Alles läuft auf dem eigenen Rechner. Weder die Sprachprobe noch die Texte landen bei irgendeinem Online-Dienst. Eine kurze Aufnahme der eigenen Stimme reicht, danach liest der Computer jeden beliebigen Text in dieser Stimme vor.

Gerade für Schülerinnen und Schüler, die mit dem Lesen langer Arbeitsanweisungen kämpfen, ist eine Vorlesefunktion eine echte Hilfe. Und es klingt eben vertraut, wenn die eigene Lehrerin vorliest und nicht eine fremde Computerstimme.

Hörbeispiele

So klingt das Ergebnis. Die ersten beiden Beispiele sind Texte aus meinem Moodle-Kurs zu Termen und Variablen, in denen die Schülerinnen und Schüler die Figur Chiara begleiten:

Beispiel 1: Chiara (Kurs „Terme und Variablen“)
Ausschnitt aus dem Moodle-Kurs: Chiara und Kaja fassen Terme mit den Variablen a und b zusammen
Aus diesem Kursausschnitt hat eine KI den Sprechtext für Beispiel 2 automatisch abgelesen – und dabei von selbst ein „Chiara sagt“ eingefügt.
Beispiel 2: Chiara, Teil 2 – Sprechtext per KI aus dem Bild oben erstellt

Zum Testen habe ich außerdem einen Teil des Artikels „Chemie“ aus dem Klexikon vertonen lassen:

Beispiel 3: Ausschnitt aus dem Klexikon-Artikel „Chemie“ (Text: Klexikon, CC BY-SA 4.0)

Kleine Anmerkung: Ob das Stimmklonen wirklich gelungen ist, können natürlich nur diejenigen beurteilen, die mich und meine Stimme kennen.

So funktioniert es

  1. Einmalig einrichten: Python-Umgebung anlegen und das Paket coqui-tts installieren. Beim ersten Start lädt das Skript das Sprachmodell herunter (ca. 1,8 GB), danach läuft alles offline.
  2. Sprachprobe aufnehmen: 15 bis 30 Sekunden Text in ruhiger Umgebung einsprechen, in Audacity von Rauschen und Stille befreien und als WAV-Datei speichern. Es gibt keine Trainingsphase – das Modell überträgt die Stimmfarbe direkt auf jeden neuen Text.
  3. Text vorbereiten: Den Text, der vorgelesen werden soll, in die Datei sprechtext.txt schreiben.
  4. Skript starten: Das Python-Skript erzeugt daraus eine Audiodatei mit Datum und Uhrzeit im Namen, die man anschließend z. B. in Moodle oder in eine H5P-Aktivität einbauen kann.

Ein normaler Rechner der letzten Jahre reicht (am besten 16 GB Arbeitsspeicher, ca. 4 GB freier Platz). Eine Grafikkarte ist nicht nötig: Ohne NVIDIA-Karte rechnet der Prozessor, ein Absatz dauert dann etwa eine halbe bis wenige Minuten. Die technische Anleitung beschreibt die Einrichtung Schritt für Schritt für Linux, Windows und macOS. Selbst getestet habe ich nur Linux – Rückmeldungen zu Windows und macOS sind sehr willkommen!

Und falls bei der Installation eine Fehlermeldung auftaucht: Einfach die komplette Meldung (oder einen Screenshot des Terminals) einer KI geben und dazusagen, welches Betriebssystem man nutzt. Bei mir hat das bei jedem Fehler schnell zum Ziel geführt.

KI bereitet den Sprechtext vor

Ein Sprachmodell liest, was dasteht – und genau das ist in Mathe und Chemie ein Problem. Formeln kennt es nicht: Aus „H2O“ wird schnell ein merkwürdiges Wort, Sonderzeichen wie ² oder √ führen zu seltsamen Geräuschen, und ein Minuszeichen wird leicht überlesen. Deshalb wird der Text vorher so geschrieben, wie man ihn spricht. Einzelne Buchstaben schreibe ich dabei lautmalerisch aus („aa“, „bee“, „iks“), damit sie zuverlässig richtig klingen:

Im Text stehtIm Sprechtext steht
H₂OHaa zwei Oo
Ca(OH)₂Zee aa, Klammer auf, Oo Haa, Klammer zu, zwei
a²aa hoch zwei
(−3)²minus drei, in Klammern, hoch zwei
f(x)eff von iks
25 °Cfünfundzwanzig Grad Celsius
z. B.zum Beispiel

Das muss man zum Glück nicht von Hand machen. In der Anleitung „Sprachprobe und Sprechtexte“ steht ein ausführlicher Vorbereiter-Prompt mit allen Regeln für Mathe und Chemie. Den kopiert man in eine beliebige KI (z. B. Claude, ChatGPT oder Gemini), hängt den Rohtext an – oder einfach einen Screenshot – und bekommt den fertigen Sprechtext zurück. So beginnt er:

Überarbeite den folgenden Text so, dass ihn eine Text-to-Speech-KI
(XTTS) optimal vorlesen kann. Gib nur den fertigen Sprechtext aus,
ohne Erklärungen. Beachte streng diese Regeln: …

Das Ergebnis kommt in die Datei sprechtext.txt, und das Skript macht den Rest. Wichtig: Auch die KI macht beim Ausschreiben von Formeln und Ladungen manchmal Fehler. Also den Sprechtext kurz gegenlesen und die fertige Audiodatei einmal komplett anhören. In der Anleitung stehen außerdem Tipps zur Aufnahme einer guten Sprachprobe und dazu, wie man mit Satzzeichen Pausen und Satzmelodie steuert.

Auch in Fremdsprachen

Ein schöner Nebeneffekt: Die geklonte Stimme spricht nicht nur Deutsch. XTTS v2 ist mehrsprachig und beherrscht unter anderem Englisch, Französisch, Spanisch, Italienisch, Niederländisch, Polnisch, Türkisch und Russisch. Dazu ändert man im Skript nur eine einzige Zeile:

SPRACHE = "en"   # statt "de", z. B. "fr", "es"

Die deutsche Sprachprobe reicht meist aus – die eigene Stimme liest dann eben einen englischen oder französischen Text vor. Noch natürlicher klingt es oft mit einer eigenen Sprachprobe in der Fremdsprache. Für Englisch enthält die Anleitung einen passenden Referenztext und eine englische Version des Vorbereiter-Prompts.

Downloads

Beide Anleitungen ergänzen sich: Die technische Anleitung erklärt die Installation, die zweite Anleitung alles rund um Sprachprobe und Sprechtexte.

Das Skript läuft unverändert auf allen drei Systemen. Oben lassen sich ein paar Werte anpassen: der Dateiname der Sprachprobe, die Sprache, die Temperatur (kleinere Werte klingen ruhiger und gleichmäßiger) und eine Wiederholungs-Strafe, die verhindert, dass Laute hängen bleiben oder doppelt gesprochen werden.

Wichtig: Nur die eigene Stimme

Eine Stimme zu klonen ist technisch leicht – deshalb gilt: Nur die eigene Stimme verwenden oder die einer Person, die ausdrücklich zugestimmt hat. Außerdem sollten Lernende wissen, dass sie eine KI-Stimme hören, etwa mit dem Satz: „Diese Anleitung wird von einer KI-Version meiner Stimme gesprochen.“

Zur Lizenz: Das Programm coqui-tts ist frei (MPL 2.0). Das Modell XTTS v2 steht dagegen unter der Coqui Public Model License, die nach aktuellem Kenntnisstand nur nicht-kommerzielle Nutzung erlaubt. Für Unterricht und frei geteilte Materialien passt das in der Regel. Bei Material, das im bezahlten Auftrag entsteht, sollte man die Lizenz vorher prüfen.

Ersten Kommentar schreiben

Antworten

Deine E-Mail-Adresse wird nicht veröffentlicht.


*


Diese Website verwendet Akismet, um Spam zu reduzieren. Erfahre, wie deine Kommentardaten verarbeitet werden.