TTS Studio: 322 AI-Stimmen für 75 Sprachen verfügbar

TTS Studio ist ein Open-Source-Text-to-Speech-Tool, das 322 AI-Stimmen und 75 Sprachen unterstützt. Es wird verwendet, um Untertiteldateien (SRT / VTT) oder reinen Text in mehrsprachige Audioinhalte umzuwandeln, was es ideal für Content Creator macht, die mehrsprachige Synchronisation benötigen. Die Bereitstellung über Docker dauert etwa zehn Minuten und kann auf einem eigenen VPS, NAS oder einem persönlichen Computer durchgeführt werden. Es ist kostenlos, ohne monatliche Gebühren und ohne API-Kosten.

Was ist TTS Studio?

TTS Studio ist ein Open-Source-Tool zur Umwandlung von Text in Sprache (Text-to-Speech), dessen Hauptzweck darin besteht, vorhandene Untertiteldateien (im SRT- oder VTT-Format) oder direkt eingegebenen Text in natürliche Sprachdateien (MP3) mithilfe von KI zu synthetisieren. Für Creator von mehrsprachigen Videos und Podcasts kann es eine erhebliche Menge an Zeit beim Aufnehmen von Sätzen einsparen.

Das Tool bietet 322 integrierte Stimmen, die 75 Sprachen abdecken, darunter Chinesisch (Mandarin / Kantonesisch / Taiwanesisches Hochchinesisch und viele Akzente), Englisch (US-amerikanisch / britisch / australisch usw.), Japanisch, Koreanisch, Französisch, Deutsch, Spanisch und viele mehr. Benutzer können im Web-Interface direkt Text eingeben, um die Ergebnisse anzuhören, und die Sprachgeschwindigkeit sowie die Lautstärke anpassen, sodass die Qualität bereits auf Publish-Niveau ist.

Das Tool unterstützt auch die automatische Synchronisation von Zeitachsen – die Zeitstempel der Untertitel werden direkt in die generierte Audiodatei übernommen, sodass die Länge mit dem Originalvideo übereinstimmt, ohne dass manuell angepasst werden muss. Es bietet auch nützliche Funktionen wie Benutzerautorisierung, Generierungshistorie und einen Dunkel-/Hellmodus.

322 Stimmen + 75 Sprachen: Für welche Inhalte ist es am besten geeignet?

Die 322 Stimmen von TTS Studio sind nicht gleichmäßig verteilt – für die gängigen Sprachen (Englisch, Japanisch, Koreanisch, Französisch, Deutsch, Spanisch) gibt es jeweils mehrere Dutzend männliche, weibliche, Kinderstimmen und spezielle Stiloptionen, während es für weniger verbreitete Sprachen (wie Kantonesisch, Arabisch, Vietnamesisch usw.) mindestens 3-5 Stimmen gibt.

Praktische Anwendungsszenarien umfassen:

  • Mehrsprachige Lehrvideos: Ein ursprünglich auf Mandarin oder Englisch basierender Lehrkanal kann mit dem Tool automatisch japanische, koreanische und thailändische Synchronisationen erstellen und diese mit der Mehrspur-Funktion veröffentlichen.
  • Podcast in mehreren Sprachen: Ein ursprünglich kantonesischer Podcast möchte eine englische Version für ausländische Zuhörer anbieten und kann dafür englische Stimmen verwenden.
  • E-Learning-Inhalte: Schulen oder Ausbildungsinstitutionen können mehrsprachige Lehrmaterialien in großen Mengen erstellen.
  • Produkt-Demo-Synchronisation: SaaS-Unternehmen müssen schnell mehrsprachige Produktdemonstrationen erstellen.
  • YouTube Shorts Automatisierung: Automatische Erstellung von Synchronisationen für Kurzvideos.

Die Einschränkungen des Tools: Obwohl die synthetisierten Stimmen natürlich klingen, können sie möglicherweise nicht 100% die spezifische Markenstimme (z.B. den charakteristischen Ton eines bestimmten KOL) nachahmen; kommerzielle Marken-Synchronisationen erfordern in der Regel manuelle Anpassungen. Für allgemeine Content-Erstellung oder erste mehrsprachige Versionen ist es jedoch ausreichend.

Vorbereitung für die Docker-Bereitstellung: Hardware- und Softwareanforderungen

TTS Studio bietet Docker-Images für die Architekturen arm64 und x86, was bedeutet, dass es auf fast allen Plattformen, die Docker unterstützen, bereitgestellt werden kann, einschließlich Windows, Mac (Intel oder Apple Silicon), Linux VPS, NAS (Synology / QNAP) usw.

Minimale Systemanforderungen:

  • Prozessor: 1 Kern ist ausreichend (die Synthese erfolgt hauptsächlich über GPU oder Cloud-API, nicht lokal)
  • Speicher: Empfohlen sind mehr als 1 GB
  • Festplattenspeicher: 500 MB (Docker-Image)
  • Netzwerk: Bei der ersten Bereitstellung müssen das Image und die TTS-Modell-Dateien heruntergeladen werden, etwa 200-500 MB
  • Betriebssystem: Linux / macOS / Windows 10+ (unterstützt Docker Desktop / OrbStack / Rancher Desktop)

Wenn es auf einem Cloud-VPS bereitgestellt wird, reicht eine Einstiegsspezifikation mit 1 GB RAM und 1 vCPU aus. Wenn Sie es auf einem lokalen Computer ausführen möchten, ist ein Apple Silicon Mac energieeffizienter (arm64-Image wird nativ unterstützt), während Intel Macs oder Windows-Rechner das x86-Image verwenden sollten.

Docker Compose Ein-Klick-Bereitstellung

Die offizielle docker-compose.yml ist recht einfach, die gesamte Bereitstellung benötigt nur einen Service:

“`yaml
version: ‘3’
services:
tts-studio:
image: ywsj/tts-studio:latest
container_name: tts-studio
ports:
– “5100:5100”
environment:
– ADMIN_USERNAME=admin
– ADMIN_PASSWORD=admin123
restart: unless-stopped
“`

Wichtige Konfigurationen:

  • Port 5100: Kann auf einen gewünschten Port geändert werden, denken Sie daran, sowohl Host als auch Container entsprechend zu ändern.
  • Standardkonto admin / Passwort admin123: Nach der Bereitstellung muss das Passwort sofort geändert werden (entweder über Umgebungsvariablen oder die Web-Interface-Einstellungen).
  • restart: unless-stopped: Der Dienst wird nach einem Neustart des VPS automatisch wiederhergestellt.

Bereitstellungsschritte (Linux / Mac / WSL):

“`bash
# 1. Arbeitsverzeichnis erstellen
mkdir -p ~/tts-studio && cd ~/tts-studio

# 2. docker-compose.yml erstellen (mit dem obigen yaml-Inhalt)
# nano oder vim sind beide möglich

# 3. Container starten
docker compose up -d

# 4. Status überprüfen
docker compose ps
“`

Nach dem erfolgreichen Start geben Sie die IP des VPS plus Port (standardmäßig 5100) in den Browser ein, um die Anmeldeseite zu sehen. ⚠️ **Vergessen Sie nicht, die entsprechenden Firewall-Regeln für den Port in der Cloud-Konsole zu aktivieren** (z.B. AWS Security Group, Cloudflare Tunnel, nginx Reverse Proxy usw.), sonst kann auf das externe Netzwerk nicht zugegriffen werden.

Benutzungsanleitung: Erste Generierung von mehrsprachiger Sprache

Die Web-Oberfläche nach dem Login besteht aus drei Schritten:

**Erster Schritt: Untertitel hochladen oder Text eingeben**

Das Tool unterstützt das direkte Hochladen von SRT- oder VTT-Untertiteldateien oder das direkte Eingeben von reinem Text in das Textfeld. Wenn Sie eine Untertiteldatei hochladen, wird die generierte Sprache automatisch an die Länge der Zeitachse angepasst, was die nachfolgende Bearbeitung und Synchronisation erleichtert.

**Zweiter Schritt: Sprache und Stimme auswählen**

Das Sprachmenü listet die 75 unterstützten Sprachen auf, jede Sprache hat mehrere bis mehrere Dutzend verschiedene Stimmen zur Auswahl. Die Stimmkennzeichnungen geben normalerweise Geschlecht, Alter und Stil an (z.B. „Männlich – ruhig“, „Weiblich – fröhlich“, „Kind Stimme“ usw.). Nach der Auswahl können Sie sofort die Ergebnisse anhören, um sicherzustellen, dass die Stimme, die Geschwindigkeit (langsam / normal / schnell) und die Lautstärke zufriedenstellend sind, bevor Sie die endgültige Generierung starten.

**Dritter Schritt: Generieren und MP3 herunterladen**

Nachdem Sie auf „Generierung starten“ geklickt haben, wird im Hintergrund die TTS-Engine zur Synthese des Audios aktiviert. Die Generierungszeit hängt von der Textlänge und der Komplexität der Stimme ab, normalerweise benötigt eine 1-3 Minuten lange Synchronisation etwa 30 Sekunden bis 2 Minuten Synthesezeit. Nach Abschluss können Sie die MP3 sofort im Web-Interface anhören und herunterladen.

Best Practices nach der Einarbeitung: Mehrspur-Workflow für Videos

Wenn Ihr Endziel darin besteht, die Mehrspur-Funktion (Multi-language audio tracks) auf YouTube hochzuladen, hier ist ein vollständiger Workflow:

1. Gehen Sie im YouTube-Backend zum Tab „Untertitel“, die ursprünglichen Untertitel sind standardmäßig in der Hauptsprache. Klicken Sie auf „Sprache hinzufügen“ und wählen Sie die Zielsprache (z.B. Japanisch, Koreanisch) aus und laden Sie die entsprechenden Untertiteldateien hoch.

2. Gehen Sie zum Tab „Audio“ und laden Sie die entsprechenden Synchronisationsdateien für jede Sprache hoch. Die von TTS Studio generierten MP3-Dateien sind bereits automatisch an die Zeitachse angepasst und können direkt hochgeladen werden.

3. Stellen Sie die „Standard-Audiospur“ auf Ihre Hauptsprachenversion ein. Die anderen Sprachen werden den Zuschauern im Player-Einstellungsmenü zur Auswahl angeboten.

⚠️ **Hinweis**: Die Mehrspur-Funktion von YouTube wird erst aktiviert, wenn das Video selbst genehmigt wurde, normalerweise wird es innerhalb von 24-48 Stunden nach der Veröffentlichung automatisch angezeigt. Wenn Sie sich nicht sicher sind, ob Ihr Video diese Funktion hat, können Sie im YouTube-Backend im Tab „Untertitel“ überprüfen, ob die Schaltfläche „Sprache hinzufügen“ angezeigt wird.

Hinweise + Einschränkungen

**TTS-Stimmen sind natürlich, können jedoch spezifische Markenstimmen nicht 100% nachahmen.** Wenn das Publikum mit der Stimme eines bestimmten KOL, einer Marke oder eines Charakters sehr vertraut ist, wird die synthetisierte Stimme von TTS zwar natürlich klingen, wird aber in der Regel als AI-generiert erkannt. Kommerzielle Marken-Synchronisationen erfordern normalerweise manuelle Anpassungen oder Mixing.

**Untertitelübersetzungen benötigen zusätzliche Tools.** TTS Studio ist nur für die Sprachsynthese verantwortlich und enthält keine Übersetzungen. Wenn Ihre Ausgangssprache Chinesisch ist, aber eine englische Synchronisation erstellen möchten, müssen Sie zuerst andere Tools (wie Google Translate, DeepL, ChatGPT, Claude) verwenden, um die Untertitel zu übersetzen, bevor Sie mit TTS Studio die englische Synchronisation generieren.

**Die erste Bereitstellung erfordert den Download von 200-500 MB Modell-Dateien.** Je nach Netzwerkgeschwindigkeit des VPS kann dies 5-15 Minuten dauern. Danach verwenden Sie einfach das lokale Modell, ohne erneut herunterladen zu müssen.

**Das Standardkonto admin / admin123 muss sofort geändert werden.** Die Standard-Anmeldeinformationen des Tools sind öffentlich zugänglich, jeder, der die VPS-IP und den Port kennt, kann sich anmelden. Das erste, was nach der Bereitstellung zu tun ist, ist, das Passwort zu ändern oder eine zusätzliche Authentifizierung über Cloudflare Access, Tailscale usw. hinzuzufügen.

Fazit: Wer sollte das selbstgebaute mehrsprachige Synchronisationstool verwenden?

TTS Studio ist einfach über Docker bereitzustellen, bietet 322 Stimmen, die 75 Sprachen unterstützen, und verfügt über nützliche Funktionen wie automatische Untertitel-Synchronisation, Benutzerautorisierung und einen Dunkel-/Hellmodus, was es zu einer kosteneffizienten Wahl für Creator macht, die mehrsprachige Inhalte erstellen möchten.

**Am besten geeignete Benutzer**:

  • YouTube-Creator, die einen mehrsprachigen Kanal erstellen möchten
  • Bildungs-/Schulungseinrichtungen, die mehrsprachige Lehrmaterialien in großen Mengen erstellen möchten
  • SaaS-Unternehmen, die schnell mehrsprachige Produkt-Demos erstellen möchten
  • Podcast-Hosts, die ihre einsprachigen Programme auf mehrsprachige Zuhörer ausweiten möchten
  • Klein- und Mittelunternehmen, die mehrsprachigen Kundenservice / Lehrvideos oder Podcasts erstellen möchten, aber ein begrenztes Budget haben

**Weniger geeignete Benutzer**:

  • Benötigen 100% Nachahmung einer bestimmten KOL / Markenstimme für kommerzielle Synchronisationen
  • Benötigen Unterstützung für unkonventionelle Sprachen (z.B. Minderheitensprachen, Dialekte usw.)
  • Benutzer ohne IT-Hintergrund (Docker-Bereitstellung hat eine Lernkurve für Anfänger)

Wenn Ihr Nutzungsszenario auf eines der oben genannten zutrifft, lohnt es sich, eine Stunde für die Bereitstellung und den Test von TTS Studio aufzuwenden. Im Vergleich zu den monatlichen Gebühren für kommerzielle TTS-APIs (einige Dollar pro tausend Wörter) sind die Selbstkosten nur die einmaligen VPS-Monatsgebühren (ca. 5 USD).


Originalinhalt
Dieser Artikel ist die deutsche Fassung eines Originalbeitrags von TechRitual.
Stein Yep
Stein Yep