Tools/Web-Engineering

ElevenLabs: Sprachsynthese als API

Ein Review der ElevenLabs-Audio-API: Modellpalette, Latenzangaben, Guthaben- und Zeichenpreise, formatabhängige Stufen, und wo OpenAI und Amazon Polly besser sind.

Art
Voice and audio API
Preis
Free tier · from $5 per month

··10 Min. Lesezeit

  • Text to speech
  • Voice API
  • Speech to text
  • Voice cloning
ElevenLabs-Covermotiv mit Beschriftungen einer Sprach-API-Pipeline

Das Wichtigste in Kürze

  • Die API verlangt 0,04 US-Dollar je 1.000 Zeichen für Flash und v4 Turbo und 0,08 Dollar für v3 und Multilingual v2, etwa drei- bis fünfmal so viel wie die Massenstufe, in der OpenAI, Google und xAI liegen.
  • Jede Latenzangabe in der Modelltabelle ist reine Inferenzzeit und in der Dokumentation ausdrücklich ohne Anwendungs- und Netzlaufzeit erklärt.
  • Nützliche Ausgabeformate sind tarifabhängig: MP3 mit 192 kbps erfordert Creator, PCM oder WAV mit 44,1 kHz den 99-Dollar-Tarif Pro.
  • Der Gratisplan gibt 10.000 Guthaben pro Monat ohne kommerzielle Lizenz, und bei Multilingual v2 beginnt die Parallelität bei zwei Anfragen.
  • Nichts ist selbst betreibbar, die geklonte Stimme und die Prosodie eines Produkts werden also gemietet statt besessen.

ElevenLabs ist eine gehostete Audio-API: Sprachausgabe, Spracherkennung, Synchronisation, Soundeffekte, Musik und eine Pipeline für Sprachagenten hinter einem einzigen Schlüssel. Das Ergebnis ist nach wie vor der Grund, warum Teams das Werkzeug wählen, und die Position hier ist bewusst eng gekauft wird für Sprachqualität und Sprachabdeckung, nicht für die Preisarchitektur, die so gebaut ist, dass ein Zeichenpreis nie so richtig auf die Konkurrenz passt.

Es besetzt die Stelle, die früher ein Cloud-TTS-Dienst einnahm: ein HTTP-Aufruf in einer Content-Pipeline oder ein WebSocket in einem Sprachagenten, und es konkurriert im Preis mit den Audio-Modellen von OpenAI, Amazon Polly und Google Chirp. Alle drei sind je fertiger Minute billiger. Keiner davon bietet professionelles Stimmcloning zusammen mit einer expressiven Modellfamilie, und genau das ist das Produkt. Teams, die eine Echtzeit-Schleife bauen, interessieren sich für diesen Unterschied mehr als für die Modelldatenblätter.

Was es ist

ElevenLabs wurde 2022 von Piotr Dąbkowski und Mati Staniszewski gegründet, sitzt in London mit Büros in New York, Warschau und San Francisco, und der Wikipedia-Eintrag nennt für 2026 rund 400 Mitarbeitende. Das Unternehmen verkauft drei Oberflächen: ElevenCreative im Browser, ElevenAPI für nutzungsabhängige Abrechnung und ElevenAgents für Sprachagenten. Jedes Modell dahinter ist proprietär. Es gibt keine offenen Gewichte und keine Selbstbetriebsvariante, nur Region-Endpunkte.

  • Proprietäre Modelle hinter einer REST-API: nichts zu deployen, keine Gewichte herunterzuladen, keine On-Premises-Variante, nur Region-Hosts.
  • Sprachausgabe umfasst eleven_v4, eleven_v4_turbo, eleven_v3, eleven_multilingual_v2 und eleven_flash_v2_5, mit über 90 Sprachen in der v4-Familie und 29 bei Multilingual v2.
  • Spracherkennung nutzt Scribe v2, Scribe v2 Realtime mit etwa 150 ms und Scribe v2 Medical, mit Sprechererkennung für bis zu 32 Personen und 65 Entitätstypen.
  • Gratisplan gibt 10.000 Guthaben pro Monat ohne kommerzielle Lizenz; die kommerzielle Nutzung beginnt mit Starter für 6 Dollar.
  • Sechs öffentliche Tarife: 0, 6, 22, 99, 299 und 990 Dollar pro Monat, dazu individuelle Enterprise-Konditionen mit SSO, DPA und SLA.
  • Region-Endpunkte für api.elevenlabs.io neben Hosts in den USA, der EU, Indien und Singapur.
  • Die Parallelität hängt am Tarif: 2 gleichzeitige Multilingual-v2-Anfragen im Gratisplan, 5 bei Creator, 10 bei Pro, 15 bei Business.

Wie es funktioniert

Ein Synthesearuf ist ein einziges POST an /v1/text-to-speech/{voice_id} mit dem Ausgabeformat in der Query-Zeichenkette und einem JSON-Body aus text, model_id und optionalen voice_settings. Die Antwort ist die Audiodatei selbst, als Byte-Strom statt als JSON-Hülle, und die offiziellen SDKs zeigen dieselbe Form. Für Echtzeit gibt es einen WebSocket-Endpunkt, bei dem nur die Zeit angerechnet wird, in der das Modell wirklich erzeugt. Determinismus ist Absicht, kein Versprechen: ein seed wiederholt einen Take, previous_text oder previous_request_ids halten die Prosodie über Blöcke hinweg stabil.

ElevenLabs: eine Anfrage von Text zu AudioText wird normalisiert, an ein Modell übergeben, im gewünschten Format kodiert und als Audiodaten zurückgegeben. Der Tarif bestimmt Parallelität und Warteschlangenpriorität und entscheidet überhaupt, welche Ausgabeformate erreichbar sind.ElevenLabs: eine Anfrage von Text zu Audioelevenlabs.io DokuJEDE ANFRAGETextseed, HistorieNormalisierenZahlen, EinheitenModellv4, flashKodierenmp3, pcm, wavAudioBytes rausVOM TARIF BESTIMMTWarteschlange2 gratis, 15 businessFormatgrenzenpcm 44,1 braucht pro
Zeichen bestimmen die Rechnung; der Tarif bestimmt Wartepriorität und welche Ausgabeformate es überhaupt gibt.

Die Formatwahl macht die Tarifstruktur sichtbar. Standard ist mp3_44100_128; MP3 mit 192 kbps erfordert Creator, PCM oder WAV mit 44,1 kHz erfordert Pro, und genau das ist die Stufe, die die meisten Sprach-Pipelines wirklich brauchen. Die Parallelität wird über eine Warteschlange umgesetzt statt über eine Ablehnung, und laut Dokumentation kostet das Überschreiten der Grenze typischerweise rund 50 ms. Die Antwort-Header current-concurrent-requests und maximum-concurrent-requests sind die einzige Telemetrie dafür.

Modelle und Latenz

Die Modellseite veröffentlicht Latenzangaben mit einem Fußnote, die zählt: Jede Zahl steht dort ausdrücklich ohne Anwendungs- und Netzlaufzeit. Lesen Sie sie als reine Inferenzzeit, vergleichbar zwischen Flash und Multilingual v2, und ungeeignet als Zusagen an Endnutzer, solange der Socket-Pfad zur gewählten Region nicht gemessen wurde.

ModellVeröffentlichte LatenzSprachenZeichen pro Anfrage
eleven_v4Keine Zahl veröffentlicht90+10.000
eleven_v4_turboEtwa 100 ms mediane Inferenz90+10.000
eleven_flash_v2_5Etwa 75 ms3240.000
eleven_multilingual_v2Keine Zahl veröffentlicht2910.000
eleven_v3280 ms in der Conversational-Variante70+5.000

Ein verhaltensbezogenes Detail entscheidet häufiger über die Modellauswahl als die Qualität. Flash v2.5 lässt die Textnormalisierung ausdrücklich aus, um die Latenz zu schützen, weshalb Telefonnummern, Daten und Währungen holprig klingen; mit apply_text_normalization einschalten geht bei den v2.5-Modellen nur im Enterprise-Tarif. Multilingual v2 rechnet Zahlen korrekt ab, und deshalb empfiehlt die Dokumentation, den Text vor der Synthese im LLM normalisieren zu lassen, statt es in der TTS-Anfrage zu bezahlen.

Erste Schritte

Der Python-Client installiert mit pip install elevenlabs, der Schlüssel liegt im Dashboard unter Developers. Das folgende Snippet erzeugt einen Clip mit dem Standardausgabeformat; ein Wechsel von model_id auf eleven_flash_v2_5 bringt Latenz und 40.000 Zeichen Grenze, ein Wechsel auf eleven_v4 bringt das neueste Modell.

# pip install elevenlabs
from elevenlabs import ElevenLabs

client = ElevenLabs(api_key="xi-api-key")

audio = client.text_to_speech.convert(
    voice_id="JBFqnCBsd6RMkjVDRZzb",
    output_format="mp3_44100_128",
    text="The first move is what sets everything in motion.",
    model_id="eleven_multilingual_v2",
)

with open("clip.mp3", "wb") as f:
    for chunk in audio:
        f.write(chunk)

Zwei Regler ändern das Verhalten, ohne den Preis zu ändern: die voice_settings (stability, similarity_boost, style, speed) und der Sprachcode. Für langen Text in Blöcke teilen und previous_request_ids mitgeben, damit die Prosodie zwischen den Anfragen weiterläuft. Für Agenten über den WebSocket streamen statt einen kompletten MP3 zu puffern, denn Puffern schiebt die gesamte Generierungszeit vor das erste hörbare Byte.

Preise

Es gibt zwei Zählwerke, und sie lassen sich nicht ineinander umrechnen. Die Creative-Tarife rechnen in Guthaben, einem einzigen geteilten Pool, aus dem jedes Produkt zehrt: Sprachausgabe kostet etwa ein Guthaben pro Zeichen, Spracherkennung 330 Guthaben pro Minute, Musik 900 pro Minute, Synchronisation 2.000 pro Minute. Die ElevenAPI-Seite wird in US-Dollar statt in Guthaben abgerechnet, und nur diese Fassung lässt sich gegen eine Fremdpreistabelle legen.

  • Free: 0 Dollar, 10.000 Guthaben pro Monat, keine kommerzielle Lizenz.
  • Starter: 6 Dollar, 30.000 Guthaben, kommerzielle Lizenz, Instant Voice Cloning.
  • Creator: 22 Dollar, 121.000 Guthaben, professionelles Stimmcloning, Audio mit 192 kbps.
  • Pro: 99 Dollar, 600.000 Guthaben, 44,1-kHz-PCM und WAV über die API.
  • Scale: 299 Dollar, 1.800.000 Guthaben, 3 Arbeitsplatzplätze.
  • Business: 990 Dollar, 6.000.000 Guthaben, 10 Plätze, Sprachausgabe mit niedriger Latenz ab 5 Cent pro Minute.
  • Jahresabrechnung kostet zehn Monate für zwölf, damit liegt Starter bei 5 Dollar und Pro bei 82,50 Dollar pro Monat.

In der API kostet Sprachausgabe 0,04 Dollar je 1.000 Zeichen für Flash und v4 Turbo sowie 0,08 Dollar für v3 und Multilingual v2, mit einer Aktionsrate von 0,022 Dollar für Eleven v4 bis zum 12. Oktober 2026. Spracherkennung kostet 0,22 Dollar die Stunde für Scribe v2 und 0,39 Dollar für Scribe v2 Realtime, die Speech Engine für Agenten 0,08 Dollar pro Minute mit Burst-Abrechnung bei 0,16 Dollar, Musik 0,15 Dollar pro Minute, und die Synchronisation läuft von 0,33 Dollar pro Minute mit Wasserzeichen bis 2,20 Dollar für Dubbing v2.

Guthaben rollen bis zu zwei Monate weiter, solange ein bezahlter Tarif aktiv ist, der Saldo erreicht damit höchstens das Dreifache des Monatskontingents, und Pay-as-you-go-Aufladungen fallen außerhalb dieser Grenze an. Nicht verbrauchtes Guthaben verfällt beim Downgrade oder bei der Kündigung, was das Jahresabo von einem Rabatt zu einer Wette auf Nutzung macht.

Wo es klemmt

Die Schwächen sind strukturell, nicht kosmetisch. Nichts lässt sich selbst betreiben, Verfügbarkeit, Speicherung und Preis sind also Entscheidungen des Anbieters, und Zero Retention existiert nur als Parameter im Enterprise-Tarif. Die Zeichengrenzen je Anfrage begrenzen Langform bei Eleven v4 auf 10.000 und bei Flash auf 40.000 Zeichen, ein Buch ist also eine Schleife aus zusammengenähten Anfragen. Der Guthabenpool macht die Kostenplanung schwerer als ein klarer Zeichenpreis, nützliche Formate hängen an Tarifgrenzen statt an Funktionsgrenzen, und der Gratisplan erlaubt kommerzielle Nutzung gar nicht.

MerkmalElevenLabsOpenAI TTSAmazon Polly
Preis je 1.000 Zeichen0,04 Dollar für Flash und v4 Turbo, 0,08 Dollar für v3 und Multilingual v20,015 Dollar für tts-1 und 0,030 Dollar für tts-1-hd; gpt-4o-mini-tts rechnet Audiotoken0,004 Dollar Standard, 0,016 Dollar Neural, 0,030 Dollar Generative
AbrechnungseinheitZeichen in der API, ein geteilter Guthabenpool in den Creative-TarifenZeichen für tts-1, Audiotoken für gpt-4o-mini-ttsZeichen, monatlich abgerechnet
Gratisstufe10.000 Guthaben pro Monat, kommerzielle Lizenz ab StarterAuf der Preisseite nicht gelistet5 Millionen Standard-Zeichen pro Monat in den ersten 12 Monaten
Wofür es passtGeklonte und expressive Stimmen, über 90 Sprachen, FigurenarbeitNutzsprache neben einem bestehenden OpenAI-StackMasseninneres in AWS, mit kostenloser zwischengespeicherter Wiedergabe

Das Lock-in ist die Stimme selbst. Eine geklonte Stimme, die Aussprachewörterbücher und die Prosodie-Entscheidungen einer Produktlinie haben kein Exportformat, ein Ausstiegsplan ist also wirklich ein Neuaufnahmeplan. Behandeln Sie die Audiodatei als das Artefakt und die API als Lieferanten, der sich nur durch Neusynthese ersetzen lässt, und bewahren Sie Quelltext und seed für jeden Take auf, den Sie reproduzieren wollen.

Fazit

Einsetzen, wenn die Stimme Teil des Produkts ist. ElevenLabs ist die richtige Wahl für Hörbücher, Figurenarbeit, mehrsprachige Erzählung und jede Oberfläche, auf der Zuhörer den Unterschied hören; die falsche Wahl für reine Nutzsprache, wo Polly mit 0,016 Dollar je tausend Zeichen denselben Job erledigt. Die Schwachstelle sind die Preise: erst nach dem Normieren lesbar, die sie an Funktionen, und wer die FAQs vor der Architektur liest, wird belohnt.

  1. Wählen, wenn Sprachqualität für Nutzer hörbar ist: Erzählung, Figuren, Werbematerial, mehrsprachige Inhalte.
  2. Für Agenten Flash oder v4 Turbo nehmen und die Anfrage im WebSocket lassen; 75 ms und 100 ms als Inferenzwerte behandelt, nicht als Round-Trip-Zusage.
  3. Bei geklonten Stimmen oder 192-kbps-Audio ab Creator budgetieren, bei 44,1-kHz-PCM in der Pipeline ab Pro.
  4. Nicht wählen für reine Nutzsprache, nicht ohne Enterprise-Konditionen für Datenresidenz, nicht für alles, was in der eigenen VPC laufen muss.
  5. Die Rechnung in Zeichen je fertiger Audiominute modellieren statt in Guthaben, und diese Einheit vor der Bindung gegen einen Wettbewerber prüfen.
Die Fußnote unter jeder Latenzangabe der Modelldokumentation lautet ohne Anwendungs- und Netzlaufzeit. Eine Architekturentscheidung, die 75 ms zitiert, ohne den Socket-Pfad zu messen, zitiert eine Zahl, aus der bereits der Teil herausgerechnet ist, der üblicherweise dominiert.

Quellen

  1. ElevenLabs-Preise: Tarife und Guthaben
  2. ElevenAPI-Preise: Raten je Produkt
  3. ElevenLabs-Dokumentation: Modelle
  4. API-Referenz: Sprache erzeugen
  5. Wikipedia: ElevenLabs
  6. Amazon-Polly-Preise
  7. OpenAI-API-Preise
  8. SILMA AI: Preisvergleich Sprachausgabe, August 2026

Häufige Fragen

Was kostet ElevenLabs je 1.000 Zeichen?

In der API 0,04 Dollar für Flash und v4 Turbo sowie 0,08 Dollar für v3 und Multilingual v2, mit einer Aktionsrate von 0,022 Dollar für Eleven v4 bis zum 12. Oktober 2026. Die Creative-Tarife rechnen stattdessen in Guthaben, von 6 Dollar für 30.000 Guthaben bei Starter bis 990 Dollar für 6 Millionen bei Business; alle Produkte teilen sich einen einzigen Pool.

Welches ElevenLabs-Modell hat die niedrigste Latenz?

Eleven Flash v2.5 nennt etwa 75 ms und Eleven v4 Turbo etwa 100 ms, jeweils als mediane Inferenzlatenz ohne Anwendungs- und Netzlaufzeit. Flash v2.5 akzeptiert zudem 40.000 Zeichen pro Anfrage, die größte Grenze der Palette, gegen 10.000 bei Eleven v4.

Darf man ElevenLabs-Ausgabe im Gratisplan kommerziell nutzen?

Nein. Die kommerzielle Lizenz beginnt mit dem Starter-Tarif für 6 Dollar im Monat, der auch das Instant Voice Cloning freischaltet. Professionelles Cloning kommt mit Creator (22 Dollar), 44,1-kHz-PCM-Ausgabe über die API mit Pro (99 Dollar).

Läuft ElevenLabs in der eigenen Cloud?

Nein. Es ist eine gehostete API mit Region-Endpunkten in den USA, der EU, Indien und Singapur, Zero Retention ist eine Enterprise-Option. Selbsteinbau oder offene Gewichte gibt es nicht; ein Ausstieg bedeutet Neuabmischung oder Neuaufnahme.

Klingt nach dem, was du suchst?

Erzähl mir von deinem Projekt oder deiner Stelle – ich freue mich, von dir zu hören.