KI Text-to-Speech (Inflect Micro v2)

Erzeuge mit dem kompakten Inflect-Micro-v2-Modell direkt im Browser englische Sprache. Kostenlos, mit einstellbarem Tempo und ohne Anmeldung.

Dieses Modell lädt etwa 37.75 MB Daten beim ersten Verwenden herunter. Die Verarbeitung läuft vollständig lokal in deinem Browser. Auf Hugging Face ansehen


Weitere Audio-Tools


Inflect v2 Text-to-Speech direkt im Browser

Inflect v2 wandelt englischen Text vollständig in deinem Browser in eine Sprachaufnahme mit 24 kHz um. Inflect Nano v2 eignet sich für einen möglichst kleinen Download, während Inflect Micro v2 auf eine höhere Sprachqualität ausgelegt ist. Nach dem Laden der Modelldateien läuft die Verarbeitung lokal, ohne deinen Text an einen Sprachdienst zu senden.

Worin unterscheiden sich Inflect Micro v2 und Inflect Nano v2?

Inflect Nano v2 ist mit rund 3,96 Millionen Parametern und einem Download von 16,21 MB die besonders kompakte Variante. Inflect Micro v2 verwendet rund 9,36 Millionen Parameter und 37,75 MB Modelldaten, um die Sprachqualität stärker zu gewichten. Stimme, Ausgabeformat und Geschwindigkeitsregelung sind bei beiden Varianten gleich.

Läuft Inflect Text-to-Speech wirklich lokal?

Ja. Das Modell wird mit ONNX Runtime Web ausgeführt, während ein eSpeak-ng-Phonemizer den englischen Text vorbereitet. Die benötigten Dateien werden direkt in deinen Browser geladen. Für die Spracherzeugung brauchst du weder ein Konto noch einen API-Schlüssel. Der erste Durchlauf dauert länger, weil das Modell zunächst geladen und initialisiert wird.

Kann ich Stimme oder Sprache ändern?

Inflect v2 bietet eine fest vorgegebene synthetische englische Männerstimme. Das Modell unterstützt weder Voice Cloning noch Referenzaufnahmen, weitere Sprecher oder zusätzliche Sprachen. Wenn du zwischen mehreren Stimmen und Sprachen wählen möchtest, nutze Supertonic TTS 2.

Wie funktioniert die Einstellung der Sprechgeschwindigkeit?

Mit dem Regler stellst du das Tempo zwischen 0,5× und 2× ein. Niedrige Werte erzeugen langsamere Sprache, hohe Werte verkürzen die vorhergesagte Sprechdauer. Das Modell erstellt die Aufnahme direkt im gewählten Tempo, anstatt eine fertige Audiodatei nur schneller oder langsamer abzuspielen.

Wie werden Zahlen, Datumsangaben und Abkürzungen ausgesprochen?

Die Browser-Oberfläche erweitert gebräuchliche englische Schreibweisen vor der Lautschriftumwandlung. Dazu gehören Datums- und Uhrzeitangaben, Geldbeträge, Ordnungszahlen, Akronyme und häufige Abkürzungen. Bei seltenen Namen, Homografen oder Fachnotationen kann eine angepasste Schreibweise weiterhin zu einer besseren Aussprache führen.

Kann ich mit Inflect längere Texte vorlesen lassen?

Lange Eingaben werden an Satzzeichen und geeigneten Wortgrenzen in überschaubare Abschnitte geteilt. Das Tool erzeugt die Abschnitte nacheinander und verbindet sie mit kurzen Pausen. Dadurch lassen sich auch längere Absätze verarbeiten, wobei die lokale Berechnung je nach Gerät etwas Zeit benötigen kann.

Wie speichere ich die erzeugte Sprachaufnahme?

Nach der Verarbeitung kannst du das Ergebnis direkt anhören oder als WAV-Datei herunterladen. Mit dem Audio-zu-Video-Visualizer verwandelst du die Aufnahme in einen teilbaren Clip. Der KI-Audio-Transkriptor wandelt gesprochene Inhalte wieder in Text um.

Tool-Navigation

Schnell zu einem beliebigen Tool wechseln