> Realtime Speech-to-Speech oder kaskadierte Pipeline? Latenzbudget je Stufe, Turn-Taking, Tool-Calls, SIP, Qualität auf Deutsch und Ungarisch, KI-VO-Hinweispflicht.
>
> Web page: https://balazscsorba.com/de/blog/voice-agents-realtime-latency · Language: Deutsch · Also available in: [English](https://balazscsorba.com/blog/voice-agents-realtime-latency.md) · [Magyar](https://balazscsorba.com/hu/blog/voice-agents-realtime-latency.md)
> Author: Balázs Csorba · Published: 2026-10-02 · Keywords: voice agents, speech-to-speech vs STT LLM TTS, OpenAI Realtime API, Gemini Live API, voice agent latency budget, turn detection and barge-in, Pipecat vs LiveKit, AI voice agent SIP telephony, German Hungarian voice AI, AI Act Article 50 voice bot disclosure

[Blog](https://balazscsorba.com/de/blog)/KI-Agenten

# Voice Agents bauen: Realtime Speech-to-Speech oder STT, LLM und TTS?

Realtime Speech-to-Speech oder kaskadierte Pipeline? Latenzbudget je Stufe, Turn-Taking, Tool-Calls, SIP, Qualität auf Deutsch und Ungarisch, KI-VO-Hinweispflicht.

[Balázs Csorba](https://balazscsorba.com/de/about)·2\. Oktober 2026·13 Min. Lesezeit

-   Voice agents
-   Realtime API
-   Latency
-   Telephony
-   AI Act

![Diagramm: Ein Anrufer erreicht per SIP oder WebRTC einen Voice Agent, der sich in Turn-Erkennung, Spracherkennung, ein LLM mit Tools und Sprachsynthese verzweigt.](https://balazscsorba.com/images/blog/voice-agents-realtime-latency/cover.webp?v=66ccbf6239)

## Das Wichtigste in Kürze

-   Eine kaskadierte Pipeline kommt realistisch im besten Fall auf etwa 725 ms bis zum ersten gesprochenen Wort und liegt typischerweise bei 1,1 bis 2,1 Sekunden, wobei das erste LLM-Token den größten Anteil hat.
-   Speech-to-Speech-Modelle sparen zwei Hops und behandeln Unterbrechungen nativ, aber dir fehlt der Text zwischen den Stufen: keine Transkript-Prüfung vor der Antwort und weniger austauschbare Komponenten.
-   Turn-Taking entscheidet über das Gefühl eines Voice Agents mehr als reine Geschwindigkeit. Nimm semantische End-of-Turn-Erkennung und prüfe, ob sie deine Sprachen unterstützt: LiveKit, Pipecat Smart Turn und Deepgram Flux decken Deutsch ab, aber nicht Ungarisch.
-   An Tool-Calls scheitern Voice Agents am häufigsten: Eine langsame API bedeutet Stille. Nutze asynchrone Tools, wo das Modell sie kann, und überbrücke jede Wartezeit über einer Sekunde mit einem kurzen gesprochenen Füllsatz.
-   Seit dem 2. August 2026 verlangt Artikel 50 der EU-KI-Verordnung, dass Menschen erfahren, dass sie mit einer KI sprechen, sofern das nicht offensichtlich ist. Sag es im ersten Satz jedes Anrufs.

Auf dieser Seite

1.  [Speech-to-Speech oder kaskadierte Pipeline?](https://balazscsorba.com/#speech-to-speech-vs-cascaded)
2.  [Das Latenzbudget, Stufe für Stufe](https://balazscsorba.com/#latency-budget)
3.  [Turn-Taking und Barge-in](https://balazscsorba.com/#turn-taking-barge-in)
4.  [Tool-Calls, während der Agent spricht](https://balazscsorba.com/#tool-calls)
5.  [Telefonie: SIP, WebRTC und das Telefonnetz](https://balazscsorba.com/#telephony)
6.  [Deutsch und Ungarisch: teste die ganze Kette](https://balazscsorba.com/#german-hungarian)
7.  [Einwilligung, Hinweispflicht und die KI-Verordnung](https://balazscsorba.com/#consent-ai-act)
8.  [Was ich zuerst bauen würde](https://balazscsorba.com/#what-i-would-build)
9.  [Das größere Bild](https://balazscsorba.com/#the-bigger-picture)
10.  [Quellen](https://balazscsorba.com/#sources)

Voice ist die Schnittstelle, an der ein KI-Agent in zwei Sekunden beurteilt wird. Im Chatfenster ist eine langsame Antwort lästig; am Telefon fühlt sich eine Pause von einer Sekunde wie eine unterbrochene Leitung an, und Anrufer reden dazwischen oder legen auf. Deshalb sehen die Architekturfragen anders aus als bei einem Text-Agent: Du gibst ein Zeitbudget aus, kein Token-Budget.

Die erste Entscheidung fällt zwischen zwei Bauformen. Ein **Speech-to-Speech**\-Modell, etwa die OpenAI Realtime API oder die Gemini Live API, verarbeitet Audio und erzeugt Audio in einem einzigen Modell. Eine **kaskadierte Pipeline** verkettet Speech-to-Text, ein Text-LLM und Text-to-Speech, und Orchestrierungs-Frameworks wie Pipecat und LiveKit Agents verdrahten die Teile. Beide laufen in Produktion, und ich entscheide danach, wo ich Kontrolle brauche.

Dieser Artikel geht die Entscheidung mit Zahlen aus den Herstellerdokumentationen durch: das Latenzbudget je Stufe, Turn-Taking und Barge-in, Tool-Calls während der Agent spricht, Telefonie, Qualität auf Deutsch und Ungarisch und was die EU-KI-Verordnung von dir verlangt. Am Ende steht die Checkliste, von der ich ausgehen würde. Preise und Modellnamen ändern sich in diesem Feld alle paar Monate, nimm die Details also als Momentaufnahme vom 2. Oktober 2026.

## Speech-to-Speech oder kaskadierte Pipeline?

OpenAIs eigener [Voice-Agents-Leitfaden](https://developers.openai.com/api/docs/guides/voice-agents) rahmt die Wahl sauber. Die Realtime API ist für „Sprache, Reasoning und Tool-Nutzung in einer Sitzung“: ein Modell interpretiert das Audio, entscheidet, was zu tun ist, und antwortet in Sprache. Der verkettete Weg ist für den Fall, dass du „Kontrolle über jede Sprach- und Textstufe“ brauchst: Du speicherst das Transkript, führst Richtlinienprüfungen aus, bevor der Text-Agent antwortet, und tauschst jede Komponente einzeln aus. Der Leitfaden nennt für keinen der beiden Wege Latenzzahlen, nur den Rat, Median und 95. Perzentil bei ähnlichen Anrufen zu vergleichen.

Das deckt sich mit dem, was ich in Projekten sehe. Speech-to-Speech gewinnt, wenn das Gespräch selbst das Produkt ist und die Logik leicht. Die kaskadierte Pipeline gewinnt, wenn die Antwort vor dem Sprechen geprüft, protokolliert oder abgesichert werden muss, also in den meisten B2B-Fällen: Bestellstatus, Terminänderungen, Support-Triage mit Wissensbasis. So vergleichen sich die beiden:

Aspekt

Speech-to-Speech (Realtime-Modell)

Kaskadiert (STT, LLM, TTS)

Hops pro Turn

Ein Modell, eine Sitzung

Drei Dienste plus Orchestrierung

Latenzuntergrenze

Niedriger: kein Transkriptions- und kein Syntheseschritt; der Praxiswert liegt bei etwa 800 ms Voice-to-Voice inklusive Netzwerk

Höher: im besten Fall rund 725 ms, typischerweise 1,1 bis 2,1 s

Unterbrechungen

In der Sitzung gelöst; du kürzt, was nicht abgespielt wurde

Logik liegt bei dir: TTS abbrechen, Audio leeren, Verlauf anpassen

Zwischentext

Transkripte sind Nebenprodukt, kein Gate

Text zwischen jeder Stufe: speichern, schwärzen, Guardrails

Teile tauschen

Du nimmst das Modell, wie es ist, samt Stimmen

Bestes STT, LLM und beste Stimme je Sprache wählbar

Sprachabdeckung

Je Sprache prüfen; Ungarisch konnte ich in der Dokumentation nicht bestätigen

Frei kombinierbar: Nova-3 und Flash v2.5 führen beide Ungarisch

Kostenkontrolle

Audio-Tokens: Die OpenAI-Modellseite nennt 32 $ pro Million Input, 64 $ pro Million Output und 0,40 $ gecacht

STT und TTS pro Minute plus Text-Tokens; günstigere Modelle für einfache Turns

Debugging

Schwerer: Reasoning und Sprache sind verschmolzen

Leichter: jede Stufe hat Logzeile und Zeitmessung

Zwei Details aus der Dokumentation sind wissenswert. Die Modellseite von `gpt-realtime` nennt ein Kontextfenster von 32.000 Tokens und höchstens 4.096 Output-Tokens und unterstützt WebRTC, WebSocket und SIP. Googles Live API ist eine zustandsbehaftete WebSocket-Verbindung, und ihr Leitfaden begrenzt reine Audio-Sitzungen auf 15 Minuten und Audio mit Video auf 2 Minuten, sofern du nicht Techniken des Session-Managements nutzt. Beide sind sitzungsförmig statt anfrageförmig, was ändert, wie du Reconnects und lange Anrufe behandelst.

**Mein Default**

Für einen Geschäftsprozess mit Tools und Compliance-Anforderungen starte ich mit einer kaskadierten Pipeline in Pipecat oder LiveKit, weil ich den Text zwischen den Stufen prüfen und jedes Teil tauschen kann. Zu einem Realtime-Modell greife ich, wenn das Gespräch offen ist und das Erlebnis wichtiger als die Nachvollziehbarkeit, und ich behalte das Framework, damit ich wechseln kann.

## Das Latenzbudget, Stufe für Stufe

Ein kaskadierter Turn ist ein Staffellauf, und der Anrufer hört nur die Gesamtzeit. Ein Praxis-[Playbook](https://www.forasoft.com/blog/article/voice-ai-agents-livekit-guide) nennt Zahlen für jede Teilstrecke, vom Bestfall bis zu dem, was Deployments typischerweise zeigen. Ich verstehe das als Planungswerte, nicht als Garantien, aber das Muster stimmt über die Quellen hinweg, die ich gelesen habe:

Das erste LLM-Token ist in beiden Zeilen der größte Block. Es zu kürzen, mit einem kleineren Modell, Prompt Caching oder frühem Start der Generierung, bringt mehr, als die übrigen Stufen zusammen zu beschleunigen.

Daraus folgen drei Schlüsse. Erstens: **Das LLM ist das Budget.** Sein erstes Token braucht im besten Fall 400 ms und typischerweise 600 bis 1.200 ms, also zählen Modellwahl, Prompt-Größe und Caching mehr als jede Audio-Feinheit. Die Hebel habe ich in [LLM-Kosten und -Latenz: Prompt Caching und Routing](https://balazscsorba.com/de/blog/llm-cost-latency-prompt-caching-routing) beschrieben. Leite einfache Turns an ein kleines, schnelles Modell und spare das starke für die schwierigen.

Zweitens: **früh starten und alles streamen.** Deepgrams Speech-to-Text-Modell Flux erkennt das Ende eines Turns selbst, in etwa 260 ms, und sendet ein `EagerEndOfTurn`\-Ereignis, mit dem du das LLM startest, bevor der Nutzer sicher fertig ist, und so Hunderte Millisekunden sparst. Der Preis sind verschwendete Aufrufe, wenn der Nutzer weiterspricht; du musst eine spekulative Generierung also sauber abbrechen können. Für Streaming-TTS gilt dieselbe Logik: Fang beim ersten Satz an zu sprechen, nicht beim letzten.

Drittens: **das Telefonnetz kostet extra.** Dasselbe Playbook rechnet 80 bis 150 ms für das öffentliche Telefonnetz zusätzlich zu WebRTC. Und miss so, wie OpenAI es vorschlägt: Median und 95. Perzentil der Zeit, die ein Anrufer auf eine brauchbare gesprochene Antwort wartet, bei echten Anrufen, denn an den Ausreißern erinnern sich die Leute.

## Turn-Taking und Barge-in

Das Schwierigste an einem Voice Agent ist nicht das Sprechen, sondern zu wissen, wann. Einfache Voice Activity Detection beendet einen Turn nach fester Stille. Das scheitert doppelt: Sie schneidet Leuten das Wort ab, wenn sie zum Nachdenken pausieren, und wartet zu lange, wenn sie fertig sind. OpenAIs [Leitfaden zur Turn-Erkennung](https://developers.openai.com/api/docs/guides/realtime-vad) beschreibt beide Modi. Server VAD „nutzt Stillephasen, um das Audio automatisch zu zerteilen“, mit Schwellwert, Stilledauer und Prefix-Padding zum Einstellen. Semantic VAD „nutzt einen semantischen Klassifikator, um anhand der gesprochenen Wörter zu erkennen, dass der Nutzer fertig ist“, und eine `eagerness`\-Einstellung von niedrig bis hoch steuert, wie schnell geantwortet wird.

Die kaskadierten Frameworks haben eigene Antworten. LiveKits Audio-Turn-Detector kombiniert „semantisches Verständnis mit akustischen Hinweisen wie Intonation, Tonhöhe und Rhythmus“ und verschiebt bei Aktivierung das Standardfenster fürs Endpointing auf 0,3 bis 2,5 Sekunden. Pipecats Open-Source-Modell Smart Turn (Version 3.2, BSD 2-Clause) analysiert den ganzen Nutzer-Turn, sobald ein leichtes VAD wie Silero Stille meldet, mit einer Inferenz von „ab 10 ms auf manchen CPUs und unter 100 ms auf den meisten Cloud-Instanzen“. Googles Live API bietet Start- und Ende-Empfindlichkeit sowie eine Stilledauer und warnt, dass sehr niedrige Werte von 100 bis 200 ms Äußerungen in Fragmente zerlegen.

**Barge-in** ist die andere Hälfte. Wenn der Anrufer dem Agent ins Wort fällt, müssen drei Dinge schnell passieren: das laufende Audio stoppen (das Playbook verlangt unter etwa 150 ms), alle gepufferten Audio-Chunks im Client leeren und dem Modell sagen, was der Anrufer tatsächlich gehört hat. In der OpenAI Realtime API sendet der Client ein `conversation.item.truncate`\-Ereignis mit der Audioposition, damit der nicht abgespielte Teil aus der Konversation verschwindet. In der Gemini Live API meldet der Server die Unterbrechung, und die Anwendung soll die Wiedergabe stoppen und die Audio-Warteschlange leeren. Wenn du das auslässt, glaubt das Modell, Dinge gesagt zu haben, die der Anrufer nie gehört hat, und die nächste Antwort bezieht sich darauf.

Zwei Fehlerbilder verdienen je einen Test. **Falsches Barge-in**: Leitungsrauschen, ein Husten oder das eigene Echo des Anrufers über die Freisprecheinrichtung bricht den Agent mitten im Satz ab. Erhöhe den VAD-Schwellwert, nutze Echo-Unterdrückung und verlange eine Mindestdauer an Sprache vor dem Unterbrechen. **Backchannels**: Wenn ein Anrufer „mhm“ sagt, ist das kein neuer Turn. Ich würde nicht zulassen, dass sie den Agent abschneiden.

## Tool-Calls, während der Agent spricht

Ein Voice Agent, der nur reden kann, ist Spielzeug. Der Wert liegt in den Tools: Bestellung nachschlagen, Termin verschieben, Ticket anlegen. Das ist der Agent-Loop aus [Agent Loop erklärt](https://balazscsorba.com/de/blog/agent-loop-explained), nur mit Stoppuhr. Jeder Tool-Call ist eine Lücke im Gespräch, und eine stille Lücke am Telefon wirkt wie ein Ausfall.

Die Mechanik unterscheidet sich je Plattform. In der OpenAI Realtime API sendet das Modell ein `function_call`\-Item in `response.done`; dein Code führt die Funktion aus, gibt ein `function_call_output`\-Item mit der `call_id` zurück und löst eine neue Antwort aus. Googles Leitfaden ist bei der Nebenläufigkeit expliziter: Gemini 3.8 Live unterstützt standardmäßig asynchrone (`NON_BLOCKING`) Funktionsausführung, mit Scheduling-Optionen (`SILENT`, `WHEN_IDLE`, `INTERRUPTED`), die bestimmen, ob das Ergebnis sofort oder erst im Leerlauf des Modells gesprochen wird, während das Modell 3.1 Flash Aufrufe nacheinander ausführt und auf die Antwort wartet. In einer kaskadierten Pipeline steuerst du all das selbst, was mehr Arbeit und mehr Flexibilität bedeutet.

Was ich in der Praxis mache:

-   **Sprich, bevor du abfragst.** Starte einen kurzen Füllsatz („einen Moment, ich schaue nach“), sobald die erwartete Wartezeit über etwa einer Sekunde liegt. Vorproduziertes Audio kostet nichts.
-   **Halte Tools schnell und klein.** Gib dem Agent eine Handvoll schmaler Tools mit Timeouts statt eines allgemeinen Datenbank-Clients. Liefere nur die Felder zurück, die das Modell laut sagen muss. Siehe die Erfahrungen im [MCP-Tool-Design](https://balazscsorba.com/de/blog/mcp-tool-design-lessons-jira-server).
-   **Bestätige, bevor du etwas änderst.** Lies Datum, Betrag oder Adresse zurück und warte auf ein gesprochenes Ja, bevor du schreibst. Sonst werden Erkennungsfehler zu echten Aktionen.
-   **Behandle das Transkript als nicht vertrauenswürdige Eingabe.** Jeder kann am Telefon „ignoriere deine Anweisungen“ sagen. Dieselben [Injection-Muster](https://balazscsorba.com/de/blog/prompt-injection-lethal-trifecta-patterns) gelten, und gesprochene Eingaben sind noch schwerer zu filtern.

## Telefonie: SIP, WebRTC und das Telefonnetz

Browser und Apps nutzen WebRTC. Telefone nutzen SIP und das öffentliche Telefonnetz, und die meisten B2B-Voice-Fälle sind Telefonanrufe. Die gute Nachricht: Die Plattformen holen dich inzwischen auf der SIP-Ebene ab. Bei der OpenAI Realtime API richtest du einen Webhook in deinem Projekt ein; kommt ein Anruf an, sendet OpenAI ein `realtime.call.incoming`\-Ereignis mit Call-ID und SIP-Headern, und du nimmst an, lehnst ab, vermittelst weiter (refer) oder legst auf, über vier Endpunkte. Auf Providerseite brauchst du TLS-Signalisierung auf Port 5061 und SRTP-Medien, und nach dem Annehmen hängst du einen WebSocket mit der Call-ID an, um Ereignisse zu streamen und Befehle zu senden wie gewohnt.

ElevenLabs nennt SIP-Trunk-Integration und eine native Twilio-Integration für seine Agents-Plattform. LiveKits Dokumentation sagt, dass seine Agents volle Telefonie-Unterstützung haben, sodass ein Anrufer einem Raum wie jeder andere Teilnehmer beitritt. Pipecat betreibt dieselbe Pipeline hinter einem Telefonie-Transport. Egal, was du wählst, plane die praktischen Kosten ein: Telefonaudio ist schmalbandig, die Erkennungsqualität sinkt gegenüber einem Studiomikrofon, und das Netz fügt jedem Turn Latenz hinzu, wie das Budget oben zeigt.

Zwei Designpunkte ersparen später Schmerzen. Halte von Tag eins an einen **Übergabeweg zu einem Menschen** bereit: eine SIP-Weiterleitung an eine Person, wenn der Agent unsicher ist, der Anrufer es verlangt oder ein Tool zweimal fehlschlägt. Und speichere die **Call-ID** in jeder Logzeile, damit aus einer Beschwerde über einen Anruf ein Trace wird, den du mit Zeiten je Stufe nachspielen kannst.

## Deutsch und Ungarisch: teste die ganze Kette

Sprachqualität ist eine Kette, und das schwächste Glied bestimmt das Erlebnis. Deutsch ist überall, wo ich nachgesehen habe, gut abgedeckt. Bei Ungarisch reißt die Kette, und nicht dort, wo man es erwartet: Erkennung und Stimme gibt es, die Turn-Erkennung oft nicht. Das sagt die Dokumentation:

Komponente

Deutsch

Ungarisch

Deepgram Nova-3 (Speech-to-Text)

Unterstützt (`de`)

Unterstützt (`hu`)

Deepgram Flux (Turn-Erkennung im STT)

Unterstützt in `flux-general-multi`, das 10 Sprachen abdeckt

Nicht aufgeführt

LiveKit Audio Turn Detector

Unterstützt

Nicht aufgeführt

Pipecat Smart Turn v3.2

Unterstützt (23 Sprachen)

Nicht aufgeführt

ElevenLabs Flash v2.5 (TTS)

Unterstützt; angegebene Latenz etwa 75 ms

Unterstützt; Flash v2.5 hat es gegenüber v2 ergänzt

Realtime-Modelle (OpenAI, Gemini)

In dem, was ich las, nicht je Sprache belegt

In dem, was ich las, nicht je Sprache belegt

Für Ungarisch hat das eine konkrete Folge. Ein kaskadierter Stack kann Nova-3 zur Erkennung und Flash v2.5 für die Stimme nutzen, aber ohne semantische Turn-Erkennung fällt er auf stillebasiertes Endpointing zurück, was längere Pausen oder mehr Unterbrechungen bedeutet. Der Gemini-Leitfaden ergänzt, dass seine nativen Audio-Modelle die Sprache automatisch wählen und mitten im Gespräch wechseln können, ohne explizite Spracheinstellung. Das ist bequem für zweisprachige Anrufer und riskant, wenn du Ungarisch garantieren musst.

Mein Rat: Baue vor der Anbieterwahl ein kleines Evaluations-Set je Sprache: 30 bis 50 echte Aufnahmen mit Akzenten, Zahlen, Namen und Straßenadressen, bewertet nach Wortfehlerrate für die Felder, die dir wichtig sind, und danach, wie natürlich sich das Endpointing anfühlt. Der Ansatz aus [Evals für LLM-Features](https://balazscsorba.com/de/blog/llm-evals-for-product-features) lässt sich übertragen. Sprachlisten der Anbieter sagen dir, was möglich ist; nur deine eigenen Aufnahmen sagen dir, was gut genug ist.

## Einwilligung, Hinweispflicht und die KI-Verordnung

Eine synthetische Stimme, die mit Menschen spricht, löst die Transparenzregeln aus. Artikel 50 Absatz 1 der EU-KI-Verordnung verlangt, dass Anbieter KI-Systeme, die direkt mit Menschen interagieren, so gestalten, dass diese Menschen „darüber informiert werden, dass sie mit einem KI-System interagieren“, es sei denn, das ist für eine angemessen informierte, aufmerksame und verständige Person offensichtlich. Artikel 50 Absatz 2 ergänzt, dass synthetisches Audio maschinenlesbar und erkennbar gekennzeichnet sein muss, soweit technisch machbar. Laut einer [Zusammenfassung einer Anwaltskanzlei](https://www.joneswalker.com/en/insights/blogs/ai-law-blog/yes-august-2-still-matters-the-eu-approved-a-high-risk-ai-delay-but-most-trans.html?id=102nbon) gelten diese Pflichten seit dem 2. August 2026 und wurden vom Digital Omnibus nicht verschoben, der stattdessen die Hochrisiko-Pflichten verlegt hat. Nur Anbieter von Systemen, die vor diesem Datum in Verkehr gebracht wurden, haben bis zum 2. Dezember 2026 Zeit für die technische Kennzeichnung, und Bußgelder können bis zu 15 Millionen Euro oder 3 Prozent des weltweiten Umsatzes erreichen.

In der Praxis würde ich vier Dinge tun. **Zu Beginn offenlegen**: Der erste Satz jedes Anrufs sagt, dass dies ein KI-Assistent ist, und die Stimme tut nicht so, als wäre sie es nicht. **Einen Menschen anbieten**: Sag Anrufern, wie sie eine Person erreichen. **Bewusst aufzeichnen**: Wenn du Audio oder Transkripte speicherst, brauchst du eine Rechtsgrundlage, eine Aufbewahrungsfrist und einen klaren Hinweis, und eine Stimmaufnahme kann eine Person identifizieren, ist also personenbezogen. Meine Notizen zur [DSGVO-Seite von LLM-APIs](https://balazscsorba.com/de/blog/gdpr-llm-api-eu-data-residency) behandeln, wo Audio verarbeitet werden darf. **Vorsicht bei geklonten Stimmen**: Artikel 50 Absatz 4 verpflichtet Betreiber, Deepfake-Audio offenzulegen, ahme also nie die Stimme einer realen Person ohne deren Einwilligung nach.

**Wo Rechtsberatung beginnt**

Das ist eine technische Zusammenfassung, keine Rechtsberatung. Regeln zur Anrufaufzeichnung, Einwilligung bei ausgehenden Anrufen und Branchenvorgaben unterscheiden sich je nach Land und Anwendungsfall. Die vollständige Liste der Entwicklerpflichten findest du in meiner [Artikel-50-Checkliste für Entwickler](https://balazscsorba.com/de/blog/eu-ai-act-article-50-developer-checklist); frag deinen Datenschutzbeauftragten, bevor ein Pilot live geht.

## Was ich zuerst bauen würde

Wenn ein Team mich bäte, nächste Woche einen Voice Agent zu starten, würde ich dieser Reihenfolge folgen:

1.  Wähle einen engen, telefonbasierten Prozess mit klaren Erfolgskriterien, etwa Terminänderungen oder Bestellstatus. Definiere das Ziel: Median unter etwa einer Sekunde bis zum ersten gesprochenen Wort und ein 95. Perzentil, mit dem du leben kannst.
2.  Starte mit einer kaskadierten Pipeline auf Pipecat oder LiveKit, damit jede Stufe Log, Zeitmessung und austauschbaren Anbieter hat. Lass ein Realtime-Modell als zweite Variante auf denselben Anrufen laufen.
3.  Instrumentiere jeden Turn von Tag eins: Turn-Ende, finales STT, erstes LLM-Token, erstes TTS-Byte und Wiedergabestart. Zeichne Median und 95. Perzentil je Stufe.
4.  Wähle eine semantische Turn-Erkennung, die deine Sprachen unterstützt, und teste falsches Barge-in mit verrauschten Leitungen und Freisprechern. Wo deine Sprache keinen Detektor hat, stimme die Stille-Schwellwerte je Sprache ab.
5.  Baue die Tools schmal und schnell, mit Timeouts und gesprochenen Füllsätzen, und füge vor jedem Schreibvorgang eine Rückbestätigung hinzu.
6.  Ergänze den KI-Hinweis im ersten Satz, einen Übergabeweg zu einem Menschen und eine Aufbewahrungsregel für Audio und Transkripte.
7.  Baue das Evaluations-Set je Sprache aus echten Aufnahmen und führe es bei jedem Modell- oder Stimmwechsel erneut aus.
8.  Erst dann optimiere Kosten: kleinere Modelle für einfache Turns, Prompt Caching und günstigere Stimmen, wo die Qualität es erlaubt.

Die Wahl des Frameworks ist weniger wichtig als Disziplin beim Budget. Pipecat ist ein Open-Source-Python-Framework (BSD-2), das über 150 Dienste orchestriert, und LiveKit Agents ist Open Source unter Apache 2.0 und setzt den Agent als Teilnehmer in einen WebRTC-Raum. Beide lassen dich Anbieter wechseln, ohne deine Logik umzuschreiben, und genau das willst du in einem Feld, in dem sich das beste Modell jedes Quartal ändert.

## Das größere Bild

Speech-to-Speech-Modelle werden bei Latenz und Qualität weiter aufholen, und die kaskadierte Pipeline behält ihren Platz überall, wo Text geprüft werden muss. Ich erwarte, dass die meisten Produktivsysteme Hybride werden: ein Realtime-Modell für Smalltalk und einfache Turns und ein Textpfad mit Tools und Guardrails für alles, was ein führendes System berührt.

Die Konstante ist das Budget. Ein Voice Agent, der in einer Sekunde antwortet, weiß, wann er schweigen muss, sagt, wer er ist, und an einen Menschen übergibt, wenn es nötig ist, schlägt einen schlaueren, der das nicht tut. Wenn du einen planst und einen zweiten Blick auf die Architektur willst, ist das genau die Arbeit, die ich als [AI Engineer](https://balazscsorba.com/de/expertise/ai-engineer) mache.

## Quellen

1.  [OpenAI: Voice agents guide](https://developers.openai.com/api/docs/guides/voice-agents)
2.  [OpenAI: gpt-realtime model page](https://developers.openai.com/api/docs/models/gpt-realtime)
3.  [OpenAI: Voice activity detection in the Realtime API](https://developers.openai.com/api/docs/guides/realtime-vad)
4.  [OpenAI: Realtime API with SIP](https://developers.openai.com/api/docs/guides/realtime-sip)
5.  [OpenAI: Realtime conversations (function calling, interruption)](https://developers.openai.com/api/docs/guides/realtime-conversations)
6.  [Google: Gemini Live API overview](https://ai.google.dev/gemini-api/docs/live)
7.  [Google: Gemini Live API capabilities guide](https://ai.google.dev/gemini-api/docs/live-guide)
8.  [Deepgram: Flux quickstart](https://developers.deepgram.com/docs/flux/quickstart)
9.  [Deepgram: Models and languages overview](https://developers.deepgram.com/docs/models-languages-overview)
10.  [ElevenLabs: Agents platform overview](https://elevenlabs.io/docs/eleven-agents/overview)
11.  [ElevenLabs: Text to speech models and languages](https://elevenlabs.io/docs/overview/capabilities/text-to-speech)
12.  [LiveKit: Agents overview](https://docs.livekit.io/agents/)
13.  [LiveKit: Turn detector](https://docs.livekit.io/agents/logic/turns/turn-detector/)
14.  [Pipecat: Introduction](https://docs.pipecat.ai/getting-started/introduction)
15.  [Pipecat: Smart Turn model (GitHub)](https://github.com/pipecat-ai/smart-turn)
16.  [Fora Soft: Voice AI agents on LiveKit, 2026 engineer playbook](https://www.forasoft.com/blog/article/voice-ai-agents-livekit-guide)
17.  [EU AI Act: Article 50, transparency obligations](https://artificialintelligenceact.eu/article/50/)
18.  [Jones Walker: Yes, August 2 still matters (AI Act delay and Article 50)](https://www.joneswalker.com/en/insights/blogs/ai-law-blog/yes-august-2-still-matters-the-eu-approved-a-high-risk-ai-delay-but-most-trans.html?id=102nbon)

## Häufige Fragen

Was ist der Unterschied zwischen einem Speech-to-Speech-Modell und einer STT-, LLM- und TTS-Pipeline?

Ein Speech-to-Speech-Modell wie die OpenAI Realtime API oder die Gemini Live API nimmt Audio entgegen und erzeugt Audio, in einem Modell und einer Sitzung. Eine kaskadierte Pipeline verkettet drei Komponenten: Speech-to-Text, ein Text-LLM und Text-to-Speech. Die Pipeline liefert dir Text zwischen den Stufen, den du speichern, prüfen und umformen kannst, und du kannst jedes Teil einzeln austauschen.

Wie schnell muss ein Voice Agent sein?

Laut einem Praxis-Playbook liegen Antwortpausen im menschlichen Gespräch bei etwa 200 bis 300 ms, Anrufer bemerken Verzögerung ab rund 500 ms und fangen bei etwa einer Sekunde an zu unterbrechen oder aufzulegen. Ein gut abgestimmter kaskadierter Stack erreicht im Median 550 bis 700 ms, was für die meisten Geschäftsanrufe reicht.

Soll ich die OpenAI Realtime API oder Pipecat und LiveKit nehmen?

Das sind keine Alternativen auf derselben Ebene. Die Realtime API ist ein Modell-Endpunkt mit WebRTC-, WebSocket- und SIP-Anbindung. Pipecat und LiveKit Agents sind Open-Source-Frameworks, die Audiotransport, Turn-Erkennung und deine Modellwahl orchestrieren, und sie können darunter ein Realtime-Modell oder eine kaskadierte Pipeline nutzen.

Funktionieren Voice Agents gut auf Deutsch und Ungarisch?

Deutsch ist im ganzen Stack gut abgedeckt. Ungarisch ist lückenhafter: Deepgram Nova-3 und ElevenLabs Flash v2.5 unterstützen es, aber der LiveKit Turn Detector, Pipecat Smart Turn und Deepgram Flux führen es nicht auf. Für die Realtime-Modelle konnte ich Ungarisch in der Herstellerdokumentation nicht bestätigen, teste also mit echten Anrufern, bevor du dich festlegst.

Muss ich Anrufern sagen, dass sie mit einer KI sprechen?

In der EU in den meisten Fällen ja. Artikel 50 Absatz 1 der KI-Verordnung, anwendbar seit dem 2. August 2026, verlangt, dass Menschen, die mit einem KI-System interagieren, darüber informiert werden, außer es ist für eine angemessen informierte Person offensichtlich. Eine synthetische Stimme am Telefon ist selten offensichtlich, also sag es zu Beginn des Anrufs.

Wie verbinde ich einen Voice Agent mit dem Telefonnetz?

Über SIP oder einen Telefonie-Anbieter. Die OpenAI Realtime API nimmt SIP-Anrufe an und benachrichtigt deinen Server per Webhook, ElevenLabs bietet SIP-Trunking und eine native Twilio-Integration, und LiveKit unterstützt Telefonie, sodass ein Anrufer wie jeder andere Teilnehmer einem Raum beitritt. Rechne im Telefonnetz mit zusätzlicher Latenz gegenüber WebRTC.

Geschrieben von Balázs Csorba

Senior Fullstack & AI Engineer in der Steiermark – über 10 Jahre Vue, Nuxt, Node.js und PHP, heute baue ich Werkzeuge für KI-Agenten.

[KI-Entwicklung & MCP-Server →](https://balazscsorba.com/de/expertise/ai-engineer)[Über mich →](https://balazscsorba.com/de/about)

## Weitere Artikel

-   [OpenAI dots: Was Always-on-Agenten verändern werden, und was nicht](https://balazscsorba.com/de/blog/openai-dots-always-on-agents-impact)
-   [Human in the Loop bei KI-Agenten: wo Freigaben hingehören](https://balazscsorba.com/de/blog/human-in-the-loop-ai-agents)
-   [Memory für KI-Agenten entwerfen: Ebenen, Schreibregeln, Poisoning und DSGVO](https://balazscsorba.com/de/blog/ai-agent-memory-design)
-   [Multi-Agent-Systeme: wann sie einen Agenten schlagen und wann nicht](https://balazscsorba.com/de/blog/multi-agent-systems-when-worth-it)

## Klingt nach dem, was du suchst?

Erzähl mir von deinem Projekt oder deiner Stelle – ich freue mich, von dir zu hören.

[Gespräch buchen](mailto:contact@balazscsorba.com) [Auf LinkedIn vernetzen](https://www.linkedin.com/in/balazs-csorba)
