[{"data":1,"prerenderedAt":944},["ShallowReactive",2],{"blog-voice-agents-realtime-latency-hu":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":25,"sources":35,"cover":90,"og":91,"expertise":92,"locales":93,"lang":96,"title":97,"description":98,"coverAlt":99,"metaTitle":100,"takeaways":101,"faq":107,"toc":126,"blocks":157,"others":668},"voice-agents-realtime-latency","2026-10-02",13,"agents",[9,10,11,12,13],"Voice agents","Realtime API","Latency","Telephony","AI Act",[15,16,17,18,19,20,21,22,23,24],"voice agents","speech-to-speech vs STT LLM TTS","OpenAI Realtime API","Gemini Live API","voice agent latency budget","turn detection and barge-in","Pipecat vs LiveKit","AI voice agent SIP telephony","German Hungarian voice AI","AI Act Article 50 voice bot disclosure",[26,29,32],{"name":27,"url":28},"Voice user interface","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FVoice_user_interface",{"name":30,"url":31},"Speech recognition","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FSpeech_recognition",{"name":33,"url":34},"Artificial Intelligence Act","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FArtificial_Intelligence_Act",[36,39,42,45,48,51,54,57,60,63,66,69,72,75,78,81,84,87],{"title":37,"url":38},"OpenAI: Voice agents guide","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fvoice-agents",{"title":40,"url":41},"OpenAI: gpt-realtime model page","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fmodels\u002Fgpt-realtime",{"title":43,"url":44},"OpenAI: Voice activity detection in the Realtime API","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Frealtime-vad",{"title":46,"url":47},"OpenAI: Realtime API with SIP","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Frealtime-sip",{"title":49,"url":50},"OpenAI: Realtime conversations (function calling, interruption)","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Frealtime-conversations",{"title":52,"url":53},"Google: Gemini Live API overview","https:\u002F\u002Fai.google.dev\u002Fgemini-api\u002Fdocs\u002Flive",{"title":55,"url":56},"Google: Gemini Live API capabilities guide","https:\u002F\u002Fai.google.dev\u002Fgemini-api\u002Fdocs\u002Flive-guide",{"title":58,"url":59},"Deepgram: Flux quickstart","https:\u002F\u002Fdevelopers.deepgram.com\u002Fdocs\u002Fflux\u002Fquickstart",{"title":61,"url":62},"Deepgram: Models and languages overview","https:\u002F\u002Fdevelopers.deepgram.com\u002Fdocs\u002Fmodels-languages-overview",{"title":64,"url":65},"ElevenLabs: Agents platform overview","https:\u002F\u002Felevenlabs.io\u002Fdocs\u002Feleven-agents\u002Foverview",{"title":67,"url":68},"ElevenLabs: Text to speech models and languages","https:\u002F\u002Felevenlabs.io\u002Fdocs\u002Foverview\u002Fcapabilities\u002Ftext-to-speech",{"title":70,"url":71},"LiveKit: Agents overview","https:\u002F\u002Fdocs.livekit.io\u002Fagents\u002F",{"title":73,"url":74},"LiveKit: Turn detector","https:\u002F\u002Fdocs.livekit.io\u002Fagents\u002Flogic\u002Fturns\u002Fturn-detector\u002F",{"title":76,"url":77},"Pipecat: Introduction","https:\u002F\u002Fdocs.pipecat.ai\u002Fgetting-started\u002Fintroduction",{"title":79,"url":80},"Pipecat: Smart Turn model (GitHub)","https:\u002F\u002Fgithub.com\u002Fpipecat-ai\u002Fsmart-turn",{"title":82,"url":83},"Fora Soft: Voice AI agents on LiveKit, 2026 engineer playbook","https:\u002F\u002Fwww.forasoft.com\u002Fblog\u002Farticle\u002Fvoice-ai-agents-livekit-guide",{"title":85,"url":86},"EU AI Act: Article 50, transparency obligations","https:\u002F\u002Fartificialintelligenceact.eu\u002Farticle\u002F50\u002F",{"title":88,"url":89},"Jones Walker: Yes, August 2 still matters (AI Act delay and Article 50)","https:\u002F\u002Fwww.joneswalker.com\u002Fen\u002Finsights\u002Fblogs\u002Fai-law-blog\u002Fyes-august-2-still-matters-the-eu-approved-a-high-risk-ai-delay-but-most-trans.html?id=102nbon","\u002Fimages\u002Fblog\u002Fvoice-agents-realtime-latency\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fvoice-agents-realtime-latency\u002Fog.jpg","ai-engineer",[94,95,96],"en","de","hu","Voice agentek építése: realtime speech-to-speech vagy STT, LLM és TTS?","Realtime speech-to-speech vagy kaszkádolt pipeline? Késleltetési keret fázisonként, turn-taking, tool hívások, SIP, német és magyar minőség, AI Act tájékoztatás.","Diagram: a hívó SIP-en vagy WebRTC-n át ér el egy voice agentet, amely turn-felismerésre, beszédfelismerésre, eszközöket használó LLM-re és beszédszintézisre ágazik.","Voice agentek: realtime vs. STT-LLM-TTS · Balázs Csorba",[102,103,104,105,106],"A kaszkádolt pipeline reális legjobb esete kb. 725 ms az első kimondott szóig, jellemzően 1,1 és 2,1 másodperc között van, és a legnagyobb részt az LLM első tokenje adja.","A speech-to-speech modellek két ugrást megspórolnak és natívan kezelik a közbevágást, de elvész a szöveg a fázisok között: nincs átirat-ellenőrzés a válasz előtt, és kevesebb cserélhető komponens van.","A voice agent érzetét a turn-taking határozza meg jobban, mint a nyers sebesség. Használj szemantikus end-of-turn felismerést, és ellenőrizd, hogy támogatja-e a nyelveidet: a LiveKit, a Pipecat Smart Turn és a Deepgram Flux a németet lefedi, a magyart nem.","A voice agentek a tool hívásokon bukják el a legtöbbet: egy lassú API csendet jelent. Használj aszinkron toolokat, ahol a modell tudja, és minden egy másodpercnél hosszabb várakozást fedj le egy rövid, kimondott töltelékmondattal.","2026. augusztus 2. óta az EU AI Act 50. cikke előírja, hogy az emberek megtudják, hogy MI-vel beszélnek, hacsak ez nem nyilvánvaló. Mondd ki minden hívás első mondatában.",[108,111,114,117,120,123],{"q":109,"a":110},"Mi a különbség a speech-to-speech modell és az STT, LLM és TTS pipeline között?","A speech-to-speech modell, például az OpenAI Realtime API vagy a Gemini Live API, hangot fogad és hangot állít elő egyetlen modellben és egyetlen munkamenetben. A kaszkádolt pipeline három komponenst láncol: speech-to-text, szöveges LLM és text-to-speech. A pipeline szöveget ad a fázisok között, amelyet tárolhatsz, ellenőrizhetsz és átalakíthatsz, és minden elemet külön cserélhetsz.",{"q":112,"a":113},"Milyen gyors legyen egy voice agent?","Egy gyakorlati playbook szerint az emberi beszélgetésben a válaszszünet kb. 200–300 ms, a hívók durván 500 ms-nál kezdik észrevenni a késést, és egy másodperc körül elkezdenek közbevágni vagy letenni. Egy jól behangolt kaszkádolt stack mediánban 550–700 ms-ot ér el, ami a legtöbb üzleti híváshoz elég.",{"q":115,"a":116},"Az OpenAI Realtime API-t vagy a Pipecat és LiveKit párost válasszam?","Nem ugyanazon a szinten lévő alternatívák. A Realtime API egy modell-végpont WebRTC, WebSocket és SIP kapcsolattal. A Pipecat és a LiveKit Agents nyílt forráskódú keretrendszer, amely a hangtranszportot, a turn-felismerést és a választott modelleket vezérli, és alatta használhat realtime modellt vagy kaszkádolt pipeline-t is.",{"q":118,"a":119},"Jól működnek a voice agentek németül és magyarul?","A német az egész stacken jól lefedett. A magyar foltosabb: a Deepgram Nova-3 és az ElevenLabs Flash v2.5 támogatja, de a LiveKit turn detector, a Pipecat Smart Turn és a Deepgram Flux nem sorolja fel. A realtime modelleknél a magyart nem tudtam megerősíteni a gyártói dokumentációban, ezért valódi hívókkal teszteld, mielőtt döntesz.",{"q":121,"a":122},"Meg kell mondanom a hívóknak, hogy MI-vel beszélnek?","Az EU-ban a legtöbb esetben igen. Az AI Act 50. cikkének (1) bekezdése, amely 2026. augusztus 2. óta alkalmazandó, előírja, hogy az MI-rendszerrel kapcsolatba lépő embereket tájékoztatni kell erről, kivéve ha ez egy kellően tájékozott személy számára nyilvánvaló. A telefonvonalon szóló szintetikus hang ritkán nyilvánvaló, ezért a hívás elején mondd ki.",{"q":124,"a":125},"Hogyan kötök egy voice agentet a telefonhálózathoz?","SIP-en vagy telefonos szolgáltatón keresztül. Az OpenAI Realtime API fogad SIP hívásokat és webhookkal értesíti a szerveredet, az ElevenLabs SIP trunköt és natív Twilio-integrációt kínál, a LiveKit pedig támogatja a telefóniát, így a hívó úgy lép be egy szobába, mint bármely más résztvevő. A telefonhálózaton a WebRTC-hez képest számíts többlet késleltetésre.",[127,130,133,136,139,142,145,148,151,154],{"id":128,"title":129},"speech-to-speech-vs-cascaded","Speech-to-speech vagy kaszkádolt pipeline?",{"id":131,"title":132},"latency-budget","A késleltetési keret fázisonként",{"id":134,"title":135},"turn-taking-barge-in","Turn-taking és barge-in",{"id":137,"title":138},"tool-calls","Tool hívások, amíg az ügynök beszél",{"id":140,"title":141},"telephony","Telefónia: SIP, WebRTC és a telefonhálózat",{"id":143,"title":144},"german-hungarian","Német és magyar: tesztelj végig az egész láncon",{"id":146,"title":147},"consent-ai-act","Hozzájárulás, tájékoztatás és az AI Act",{"id":149,"title":150},"what-i-would-build","Mit építenék először",{"id":152,"title":153},"the-bigger-picture","A tágabb kép",{"id":155,"title":156},"sources","Források",[158,162,174,177,180,188,191,257,265,272,273,280,289,302,313,320,321,332,335,346,357,358,366,400,403,437,438,445,448,459,460,463,519,522,530,531,538,562,573,574,577,596,599,600,603,611,612],{"type":159,"content":160},"paragraph",[161],"A voice az a felület, ahol egy MI-ügynököt két másodperc alatt megítélnek. Egy csevegőablakban a lassú válasz kellemetlen; telefonon az egy másodperces szünet megszakadt vonalnak hat, és a hívók beszélni kezdenek az ügynök fölött, vagy leteszik. Ezért az architekturális kérdések másként festenek, mint egy szöveges ügynöknél: időkeretet költesz, nem tokenkeretet.",{"type":159,"content":163},[164,165,169,170,173],"Az első döntés két forma között van. A ",{"tag":166,"children":167},"strong",[168],"speech-to-speech"," modell, például az OpenAI Realtime API vagy a Gemini Live API, hangot fogyaszt és hangot állít elő egyetlen modellen belül. A ",{"tag":166,"children":171},[172],"kaszkádolt pipeline"," speech-to-textet, szöveges LLM-et és text-to-speechet láncol, a darabokat pedig olyan orkesztrációs keretrendszerek kötik össze, mint a Pipecat és a LiveKit Agents. Mindkettő működik élesben, és a választást aszerint hozom meg, hol van szükségem kontrollra.",{"type":159,"content":175},[176],"Ez a cikk a gyártók dokumentációjának számaival megy végig a döntésen: a késleltetési keret fázisonként, turn-taking és barge-in, tool hívások beszéd közben, telefónia, német és magyar minőség, és mit kér tőled az EU AI Act. A végén az a checklist áll, amelyből kiindulnék. Az árak és modellnevek ezen a területen pár havonta változnak, ezért a részleteket a 2026. október 2-i pillanatképnek tekintsd.",{"type":178,"level":179,"id":128,"text":129},"heading",2,{"type":159,"content":181},[182,183,187],"Az OpenAI saját ",{"tag":184,"href":38,"children":185},"a",[186],"voice agent útmutatója"," tisztán fogalmazza meg a választást. A Realtime API a „beszéd, következtetés és tool-használat egy munkamenetben” esetére való: egy modell értelmezi a hangot, eldönti, mit tegyen, és beszéddel válaszol. A láncolt út akkor kell, ha „kontrollra van szükséged minden beszéd- és szövegfázis felett”: eltárolod az átiratot, szabályellenőrzést futtatsz, mielőtt a szöveges ügynök válaszol, és minden komponenst külön cserélsz. Az útmutató egyik útra sem közöl késleltetési számot, csak azt javasolja, hogy hasonló hívásoknál a mediánt és a 95. percentilist hasonlítsd.",{"type":159,"content":189},[190],"Ez egybevág azzal, amit a projektekben látok. A speech-to-speech akkor nyer, ha maga a beszélgetés a termék, és a logika könnyű. A kaszkádolt pipeline akkor, ha a választ kimondás előtt ellenőrizni, naplózni vagy megalapozni kell, ami a legtöbb B2B esetben így van: rendelésállapot, időpont-módosítás, support-triázs tudásbázissal. Így hasonlít össze a kettő:",{"type":192,"head":193,"rows":200},"table",[194,196,198],[195],"Szempont",[197],"Speech-to-speech (realtime modell)",[199],"Kaszkádolt (STT, LLM, TTS)",[201,208,215,222,229,236,243,250],[202,204,206],[203],"Ugrások száma körönként",[205],"Egy modell, egy munkamenet",[207],"Három szolgáltatás plusz orkesztráció",[209,211,213],[210],"Késleltetési alsó határ",[212],"Alacsonyabb: nincs átírási és szintézis-lépés; a gyakorlati érték kb. 800 ms voice-to-voice a hálózattal együtt",[214],"Magasabb: legjobb esetben kb. 725 ms, jellemzően 1,1–2,1 s",[216,218,220],[217],"Közbevágás",[219],"A munkameneten belül megoldott; levágod, ami nem hangzott el",[221],"A logika a tiéd: TTS megszakítása, hangpuffer ürítése, előzmények frissítése",[223,225,227],[224],"Köztes szöveg",[226],"Az átirat melléktermék, nem kapu",[228],"Szöveg minden fázis között: tárolás, kitakarás, guardrailek",[230,232,234],[231],"Elemek cseréje",[233],"A modellt úgy kapod, ahogy van, a hangjaival együtt",[235],"Nyelvenként a legjobb STT, LLM és hang választható",[237,239,241],[238],"Nyelvi lefedettség",[240],"Nyelvenként ellenőrizendő; a magyart a dokumentációban nem tudtam megerősíteni",[242],"Szabadon kombinálható: a Nova-3 és a Flash v2.5 is támogatja a magyart",[244,246,248],[245],"Költségkontroll",[247],"Audio tokenek: az OpenAI modelloldala 32 $-t említ millió bemeneti, 64 $-t millió kimeneti és 0,40 $-t gyorsítótárazott tokenre",[249],"STT és TTS percenként plusz szöveges tokenek; olcsóbb modellek az egyszerű körökre",[251,253,255],[252],"Hibakeresés",[254],"Nehezebb: a következtetés és a beszéd összeolvad",[256],"Könnyebb: minden fázisnak van naplósora és időmérése",{"type":159,"content":258},[259,260,264],"A dokumentációból két részlet érdemes megjegyezni. A ",{"tag":261,"children":262},"code",[263],"gpt-realtime"," modell oldala 32 000 tokenes kontextusablakot és legfeljebb 4096 kimeneti tokent említ, és támogatja a WebRTC-t, a WebSocketet és a SIP-et. A Google Live API állapottartó WebSocket-kapcsolat, és az útmutatója a csak hangos munkameneteket 15 percre, a hang és videó munkameneteket 2 percre korlátozza, hacsak nem használsz munkamenet-kezelési technikákat. Mindkettő munkamenet-alapú, nem kérés-alapú, ami megváltoztatja, hogyan kezeled az újracsatlakozást és a hosszú hívásokat.",{"type":266,"variant":267,"title":268,"body":269},"callout","tip","Az alapértelmezésem",[270],[271],"Toolokkal és megfelelőségi igényekkel rendelkező üzleti folyamathoz kaszkádolt pipeline-nal kezdek Pipecatben vagy LiveKitben, mert a fázisok közti szöveget ellenőrizhetem, és minden elemet cserélhetek. Realtime modellhez akkor nyúlok, ha a hívás nyitott, és az élmény fontosabb a nyomon követhetőségnél, a keretrendszert pedig megtartom, hogy válthassak.",{"type":178,"level":179,"id":131,"text":132},{"type":159,"content":274},[275,276,279],"A kaszkádolt kör váltófutás, és a hívó csak az összidőt hallja. Egy gyakorlati ",{"tag":184,"href":83,"children":277},[278],"playbook"," minden szakaszra számot ad, a legjobb esettől addig, amit a telepítések jellemzően mutatnak. Tervezési értéknek tekintem, nem garanciának, de a minta egyezik az általam olvasott források között:",{"type":281,"attrs":282,"inner":286,"caption":287},"diagram",{"viewBox":283,"role":284,"aria-labelledby":285},"0 0 720 352","img","d1-voice-t d1-voice-d","\u003Ctitle id=\"d1-voice-t\">Egy kaszkádolt kör késleltetési kerete\u003C\u002Ftitle>\u003Cdesc id=\"d1-voice-d\">Vízesés-diagram öt fázissal. Legjobb eset milliszekundumban: körvég 50, beszédfelismerés 150, LLM első token 400, TTS első bájt 75, hálózat és lejátszás 50, összesen 725. Jellemző, alsó érték: 80, 200, 600, 150, 80, összesen 1110. Referenciavonalak jelölik az 500 milliszekundumot, ahol a késés feltűnik, és az egy másodpercet, ahol a hívók közbevágnak.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">Egy kaszkádolt kör késleltetési kerete\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">Forrás: Fora Soft playbook\u003C\u002Ftext>\u003Cpath d=\"M430 44 V284\" class=\"d-line-accent d-dash\" \u002F>\u003Cpath d=\"M630 44 V284\" class=\"d-line-accent d-dash\" \u002F>\u003Ctext x=\"20\" y=\"69\" class=\"d-text\">Körvég\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"85\" class=\"d-small\">legjobb 50, jellemző 80-150 ms\u003C\u002Ftext>\u003Crect x=\"230\" y=\"58\" width=\"20\" height=\"12\" rx=\"3\" class=\"d-fill-accent\" \u002F>\u003Crect x=\"230\" y=\"76\" width=\"32\" height=\"12\" rx=\"3\" class=\"d-fill-muted\" \u002F>\u003Ctext x=\"20\" y=\"115\" class=\"d-text\">Beszédfelismerés\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"131\" class=\"d-small\">legjobb 150, jellemző 200-300 ms\u003C\u002Ftext>\u003Crect x=\"250\" y=\"104\" width=\"60\" height=\"12\" rx=\"3\" class=\"d-fill-accent\" \u002F>\u003Crect x=\"262\" y=\"122\" width=\"80\" height=\"12\" rx=\"3\" class=\"d-fill-muted\" \u002F>\u003Ctext x=\"20\" y=\"161\" class=\"d-text\">LLM első token\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"177\" class=\"d-small\">legjobb 400, jellemző 600-1200 ms\u003C\u002Ftext>\u003Crect x=\"310\" y=\"150\" width=\"160\" height=\"12\" rx=\"3\" class=\"d-fill-accent\" \u002F>\u003Crect x=\"342\" y=\"168\" width=\"240\" height=\"12\" rx=\"3\" class=\"d-fill-muted\" \u002F>\u003Ctext x=\"20\" y=\"207\" class=\"d-text\">TTS első bájt\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"223\" class=\"d-small\">legjobb 75, jellemző 150-250 ms\u003C\u002Ftext>\u003Crect x=\"470\" y=\"196\" width=\"30\" height=\"12\" rx=\"3\" class=\"d-fill-accent\" \u002F>\u003Crect x=\"582\" y=\"214\" width=\"60\" height=\"12\" rx=\"3\" class=\"d-fill-muted\" \u002F>\u003Ctext x=\"20\" y=\"253\" class=\"d-text\">Hálózat, lejátszás\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"269\" class=\"d-small\">legjobb 50, jellemző 80-200 ms\u003C\u002Ftext>\u003Crect x=\"500\" y=\"242\" width=\"20\" height=\"12\" rx=\"3\" class=\"d-fill-accent\" \u002F>\u003Crect x=\"642\" y=\"260\" width=\"32\" height=\"12\" rx=\"3\" class=\"d-fill-muted\" \u002F>\u003Ctext x=\"430\" y=\"300\" text-anchor=\"middle\" class=\"d-small\">500 ms: feltűnik\u003C\u002Ftext>\u003Ctext x=\"630\" y=\"300\" text-anchor=\"middle\" class=\"d-small\">1 s: közbevágnak\u003C\u002Ftext>\u003Crect x=\"20\" y=\"322\" width=\"14\" height=\"14\" rx=\"3\" class=\"d-fill-accent\" \u002F>\u003Ctext x=\"42\" y=\"334\" class=\"d-label\">Legjobb eset\u003C\u002Ftext>\u003Crect x=\"190\" y=\"322\" width=\"14\" height=\"14\" rx=\"3\" class=\"d-fill-muted\" \u002F>\u003Ctext x=\"212\" y=\"334\" class=\"d-label\">Jellemző, alsó érték\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"334\" text-anchor=\"end\" class=\"d-label\">Összesen: 725 ms legjobb eset, 1110 ms jellemzően vagy több\u003C\u002Ftext>",[288],"Az LLM első tokenje mindkét sorban a legnagyobb szelet. Ennek csökkentése, kisebb modellel, prompt cachinggel vagy a generálás korai indításával, többet hoz, mint az összes többi fázis gyorsítása együtt.",{"type":159,"content":290},[291,292,295,296,301],"Három következtetés adódik. Először: ",{"tag":166,"children":293},[294],"az LLM a keret."," Az első tokenje legjobb esetben 400 ms, jellemzően 600–1200 ms, ezért a modellválasztás, a prompt mérete és a cache többet számít bármilyen audio-finomhangolásnál. A támpontokat az ",{"tag":297,"to":298,"children":299},"link","\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing",[300],"LLM költség és késleltetés: prompt caching és routing"," cikkben írtam le. Az egyszerű köröket küldd kicsi, gyors modellre, az erőset tartsd a nehezekre.",{"type":159,"content":303},[304,305,308,309,312],"Másodszor: ",{"tag":166,"children":306},[307],"korán indíts és mindent streamelj."," A Deepgram Flux speech-to-text modellje maga ismeri fel a kör végét, kb. 260 ms alatt, és ",{"tag":261,"children":310},[311],"EagerEndOfTurn"," eseményt küld, amellyel elindíthatod az LLM-et, mielőtt a felhasználó biztosan befejezte, így több száz milliszekundumot nyersz. Az ár a felesleges hívások, ha a felhasználó folytatja, ezért egy spekulatív generálást tisztán meg kell tudnod szakítani. A streaming TTS-re ugyanez igaz: az első mondatnál kezdj beszélni, ne az utolsónál.",{"type":159,"content":314},[315,316,319],"Harmadszor: ",{"tag":166,"children":317},[318],"a telefonhálózat extra költség."," Ugyanez a playbook 80–150 ms-ot számol a nyilvános telefonhálózatra a WebRTC-n felül. És úgy mérj, ahogy az OpenAI javasolja: a hívó által egy használható kimondott válaszra várt idő mediánja és 95. percentilise, valódi hívásokon, mert a farokra emlékeznek az emberek.",{"type":178,"level":179,"id":134,"text":135},{"type":159,"content":322},[323,324,327,328,331],"A voice agent legnehezebb része nem a beszéd, hanem tudni, mikor kell beszélni. Az egyszerű hangaktivitás-felismerés (VAD) rögzített csend után zár le egy kört. Ez kétszeresen hibás: belevág az emberek szavába, amikor gondolkodva szünetet tartanak, és túl sokat vár, amikor végeztek. Az OpenAI ",{"tag":184,"href":44,"children":325},[326],"turn detection útmutatója"," mindkét módot leírja. A Server VAD „csendszakaszokat használ a hang automatikus darabolásához”, küszöbbel, csendidővel és prefix paddinggel állítható. A Semantic VAD „szemantikus osztályozót használ, hogy a kimondott szavak alapján felismerje, mikor végzett a felhasználó”, és egy ",{"tag":261,"children":329},[330],"eagerness"," beállítás alacsonytól magasig szabályozza, milyen gyorsan válaszol.",{"type":159,"content":333},[334],"A kaszkádolt keretrendszereknek saját válaszaik vannak. A LiveKit audio turn detectora „szemantikus megértést kombinál akusztikai jelekkel, mint az intonáció, a hangmagasság és a ritmus”, és bekapcsolva az alapértelmezett endpointing-ablakot 0,3–2,5 másodpercre tolja. A Pipecat nyílt forráskódú Smart Turn modellje (3.2-es verzió, BSD 2-clause) a teljes felhasználói kört elemzi, ha egy könnyű VAD, például a Silero csendet jelez, „egyes CPU-kon akár 10 ms”, a legtöbb felhőpéldányon 100 ms alatti inferenciával. A Google Live API kezdő és záró érzékenységet és csendidőt kínál, és figyelmeztet, hogy a nagyon alacsony, 100–200 ms-os csendértékek töredékekre szabdalják a megszólalásokat.",{"type":159,"content":336},[337,338,341,342,345],"A ",{"tag":166,"children":339},[340],"barge-in"," a másik fele. Amikor a hívó rábeszél az ügynökre, három dolognak kell gyorsan megtörténnie: leállítani a lejátszott hangot (a playbook kb. 150 ms alatt kéri), kiüríteni a kliensen a pufferelt hangdarabokat, és megmondani a modellnek, mit hallott valójában a hívó. Az OpenAI Realtime API-ban a kliens ",{"tag":261,"children":343},[344],"conversation.item.truncate"," eseményt küld a hangpozícióval, így a le nem játszott rész kikerül a beszélgetésből. A Gemini Live API-ban a szerver jelzi a megszakítást, és az alkalmazásnak le kell állítania a lejátszást és ki kell ürítenie a hangsort. Ha ezt kihagyod, a modell azt hiszi, hogy olyat mondott, amit a hívó sosem hallott, és a következő válasz erre hivatkozik.",{"type":159,"content":347},[348,349,352,353,356],"Két hibamódot érdemes külön tesztelni. ",{"tag":166,"children":350},[351],"Téves barge-in",": vonalzaj, köhögés vagy a hívó saját visszhangja kihangosításon megszakítja az ügynököt mondat közben. Emeld a VAD küszöbét, használj visszhangszűrést, és követelj meg minimális beszédet a megszakításhoz. ",{"tag":166,"children":354},[355],"Backchannelek",": ha a hívó azt mondja „aha”, az nem új kör. Nem engedném, hogy ezek elvágják az ügynököt.",{"type":178,"level":179,"id":137,"text":138},{"type":159,"content":359},[360,361,365],"Az a voice agent, amely csak beszélni tud, játék. Az érték a toolokban van: rendelés lekérése, időpont áthelyezése, ticket létrehozása. Ez az ",{"tag":297,"to":362,"children":363},"\u002Fblog\u002Fagent-loop-explained",[364],"agent loop magyarázata"," cikkben szereplő ciklus, csak stopperórával. Minden tool hívás rés a beszélgetésben, és egy csendes rés a telefonvonalon hibának tűnik.",{"type":159,"content":367},[368,369,372,373,376,377,380,381,384,385,388,389,392,393,392,396,399],"A mechanika platformonként eltér. Az OpenAI Realtime API-ban a modell ",{"tag":261,"children":370},[371],"function_call"," elemet bocsát ki a ",{"tag":261,"children":374},[375],"response.done"," eseményben; a kódod lefuttatja a függvényt, egy ",{"tag":261,"children":378},[379],"function_call_output"," elemet ad vissza a ",{"tag":261,"children":382},[383],"call_id","-val, és új választ indít. A Google útmutatója a párhuzamosságról explicitebb: a Gemini 3.8 Live alapértelmezésben támogatja az aszinkron (",{"tag":261,"children":386},[387],"NON_BLOCKING",") függvényvégrehajtást, ütemezési opciókkal (",{"tag":261,"children":390},[391],"SILENT",", ",{"tag":261,"children":394},[395],"WHEN_IDLE",{"tag":261,"children":397},[398],"INTERRUPTED","), amelyek eldöntik, hogy az eredmény azonnal vagy csak a modell tétlenségekor hangzik-e el, míg a 3.1 Flash modell a hívásokat egymás után futtatja, és megvárja a választ. Kaszkádolt pipeline-ban mindezt te vezérled, ami több munka és több rugalmasság.",{"type":159,"content":401},[402],"Amit a gyakorlatban csinálok:",{"type":404,"ordered":405,"items":406},"list",false,[407,412,422,427],[408,411],{"tag":166,"children":409},[410],"Beszélj, mielőtt lekérdezel."," Indíts el egy rövid töltelékmondatot („egy pillanat, megnézem”), amint a várható várakozás egy másodperc fölé megy. Az előre rögzített hang semmibe sem kerül.",[413,416,417,421],{"tag":166,"children":414},[415],"Tartsd a toolokat gyorsan és kicsin."," Adj az ügynöknek néhány szűk, időkorlátos toolt egy általános adatbázis-kliens helyett. Csak azokat a mezőket add vissza, amelyeket a modellnek hangosan ki kell mondania. Lásd a tanulságokat az ",{"tag":297,"to":418,"children":419},"\u002Fblog\u002Fmcp-tool-design-lessons-jira-server",[420],"MCP tool tervezés"," cikkben.",[423,426],{"tag":166,"children":424},[425],"Erősítsd meg, mielőtt bármit módosítasz."," Olvasd vissza a dátumot, az összeget vagy a címet, és várj egy kimondott igenre írás előtt. Különben a felismerési hibákból valódi műveletek lesznek.",[428,431,432,436],{"tag":166,"children":429},[430],"Az átiratot kezeld megbízhatatlan bemenetként."," Bárki mondhatja egy hívásban, hogy „hagyd figyelmen kívül az utasításaidat”. Ugyanezek az ",{"tag":297,"to":433,"children":434},"\u002Fblog\u002Fprompt-injection-lethal-trifecta-patterns",[435],"injekciós minták"," érvényesek, és a kimondott bemenetet még nehezebb szűrni.",{"type":178,"level":179,"id":140,"text":141},{"type":159,"content":439},[440,441,444],"A böngészők és az appok WebRTC-t használnak. A telefonok SIP-et és a nyilvános telefonhálózatot, és a legtöbb B2B voice eset telefonhívás. A jó hír, hogy a platformok már a SIP-rétegnél találkoznak veled. Az OpenAI Realtime API-nál webhookot állítasz be a projektedben; amikor hívás érkezik, az OpenAI ",{"tag":261,"children":442},[443],"realtime.call.incoming"," eseményt küld a hívásazonosítóval és a SIP fejlécekkel, te pedig négy végponton át fogadod, elutasítod, átirányítod (refer) vagy leteszed. A szolgáltató oldalán TLS jelzés kell az 5061-es porton és SRTP média, a fogadás után pedig a hívásazonosítóval WebSocketet csatolsz, hogy az eseményeket streameld és a parancsokat elküldd, a megszokott módon.",{"type":159,"content":446},[447],"Az ElevenLabs SIP trunk integrációt és natív Twilio-integrációt említ az agents platformjához. A LiveKit dokumentációja szerint az agentjei teljes telefónia-támogatással rendelkeznek, így a telefonáló úgy lép be egy szobába, mint bármely más résztvevő. A Pipecat ugyanazt a pipeline-t futtatja telefonos transzport mögött. Bármelyiket választod, számolj a gyakorlati költségekkel: a telefonhang keskeny sávú, a felismerés minősége romlik a stúdiómikrofonhoz képest, és a hálózat minden körhöz késleltetést ad, ahogy a fenti keret mutatja.",{"type":159,"content":449},[450,451,454,455,458],"Két tervezési pont később sok fájdalmat spórol meg. Tarts fenn ",{"tag":166,"children":452},[453],"emberi átadási utat"," az első naptól: SIP átirányítás egy személyhez, ha az ügynök bizonytalan, a hívó kéri, vagy egy tool kétszer elbukik. És minden naplósorban tárold a ",{"tag":166,"children":456},[457],"hívásazonosítót",", hogy egy hívásról szóló panaszból olyan trace legyen, amelyet fázisonkénti időkkel visszajátszhatsz.",{"type":178,"level":179,"id":143,"text":144},{"type":159,"content":461},[462],"A nyelvi minőség egy lánc, és a leggyengébb szem határozza meg az élményt. A németet mindenhol jól lefedettnek találtam, ahol megnéztem. A magyarnál szakad a lánc, és nem ott, ahol várnád: a felismerés és a hang létezik, a turn-felismerés gyakran nem. Ezt mondja a dokumentáció:",{"type":192,"head":464,"rows":471},[465,467,469],[466],"Komponens",[468],"Német",[470],"Magyar",[472,483,494,500,506,513],[473,475,480],[474],"Deepgram Nova-3 (speech-to-text)",[476,477,479],"Támogatott (",{"tag":261,"children":478},[95],")",[476,481,479],{"tag":261,"children":482},[96],[484,486,492],[485],"Deepgram Flux (turn-felismerés az STT-ben)",[487,488,491],"Támogatott a ",{"tag":261,"children":489},[490],"flux-general-multi"," modellben, amely 10 nyelvet fed le",[493],"Nem szerepel",[495,497,499],[496],"LiveKit audio turn detector",[498],"Támogatott",[493],[501,503,505],[502],"Pipecat Smart Turn v3.2",[504],"Támogatott (23 nyelv)",[493],[507,509,511],[508],"ElevenLabs Flash v2.5 (TTS)",[510],"Támogatott; megadott késleltetés kb. 75 ms",[512],"Támogatott; a Flash v2.5 a v2-höz képest adta hozzá",[514,516,518],[515],"Realtime modellek (OpenAI, Gemini)",[517],"Az általam olvasottakban nyelvenként nem igazolt",[517],{"type":159,"content":520},[521],"A magyarnál ennek konkrét következménye van. Egy kaszkádolt stack használhatja a Nova-3-at a felismeréshez és a Flash v2.5-öt a hanghoz, de szemantikus turn-felismerő nélkül csendalapú endpointingra esik vissza, ami hosszabb szüneteket vagy több közbevágást jelent. A Gemini útmutatója hozzáteszi, hogy a natív audio modelljei automatikusan választanak nyelvet, és beszélgetés közben válthatnak, explicit nyelvbeállítás nélkül. Ez kényelmes kétnyelvű hívónál, és kockázatos, ha a magyart garantálnod kell.",{"type":159,"content":523},[524,525,529],"A tanácsom: a szállítóválasztás előtt építs egy kis kiértékelő készletet nyelvenként: 30–50 valódi felvétel akcentussal, számokkal, nevekkel és utcacímekkel, kiértékelve a szóhibaarányra a számodra fontos mezőkben, és arra, mennyire természetes az endpointing. Az ",{"tag":297,"to":526,"children":527},"\u002Fblog\u002Fllm-evals-for-product-features",[528],"LLM funkciók kiértékelése"," cikk megközelítése átvihető. A gyártók nyelvlistái azt mondják meg, mi lehetséges; csak a saját felvételeid mondják meg, mi elég jó.",{"type":178,"level":179,"id":146,"text":147},{"type":159,"content":532},[533,534,537],"Az emberekkel beszélő szintetikus hang beváltja az átláthatósági szabályokat. Az EU AI Act 50. cikkének (1) bekezdése előírja, hogy a szolgáltatók úgy tervezzék az emberekkel közvetlenül kapcsolatba lépő MI-rendszereket, hogy az érintettek „tájékoztatást kapjanak arról, hogy MI-rendszerrel lépnek kapcsolatba”, kivéve ha ez egy kellően tájékozott, figyelmes és körültekintő személy számára nyilvánvaló. A (2) bekezdés hozzáteszi, hogy a szintetikus hangot géppel olvasható és felismerhető módon jelölni kell, ahol ez technikailag megvalósítható. Egy ",{"tag":184,"href":89,"children":535},[536],"ügyvédi iroda összefoglalója"," szerint ezek a kötelezettségek 2026. augusztus 2. óta érvényesek, és a Digital Omnibus nem halasztotta el őket, helyette a nagy kockázatú kötelezettségeket tolta ki. Csak az ezen időpont előtt forgalomba hozott rendszerek szolgáltatóinak van 2026. december 2-ig ideje a technikai jelölésre, a bírság pedig elérheti a 15 millió eurót vagy a világméretű árbevétel 3 százalékát.",{"type":159,"content":539},[540,541,544,545,548,549,552,553,557,558,561],"A gyakorlatban négy dolgot tennék. ",{"tag":166,"children":542},[543],"Az elején közöld",": minden hívás első mondata mondja ki, hogy ez egy MI-asszisztens, és a hang ne tegyen úgy, mintha nem az lenne. ",{"tag":166,"children":546},[547],"Kínálj embert",": mondd meg a hívóknak, hogyan érhetnek el egy személyt. ",{"tag":166,"children":550},[551],"Tudatosan rögzíts",": ha hangot vagy átiratot tárolsz, jogalap, megőrzési idő és világos tájékoztatás kell, és a hangfelvétel azonosíthat egy személyt, tehát személyes adat. Az ",{"tag":297,"to":554,"children":555},"\u002Fblog\u002Fgdpr-llm-api-eu-data-residency",[556],"LLM API-k GDPR-oldaláról"," írt jegyzeteim arról szólnak, hol dolgozható fel a hang. ",{"tag":166,"children":559},[560],"Légy óvatos a klónozott hangokkal",": az 50. cikk (4) bekezdése kötelezi az üzemeltetőket a deepfake hang közlésére, ezért soha ne utánozd valós személy hangját a hozzájárulása nélkül.",{"type":266,"variant":563,"title":564,"body":565},"warn","Ahol a jogi tanácsadás kezdődik",[566],[567,568,572],"Ez mérnöki összefoglaló, nem jogi tanács. A hívásrögzítés szabályai, a kimenő hívások hozzájárulása és az ágazati szabályok országonként és felhasználási esetenként eltérnek. A fejlesztői kötelezettségek teljes listájához lásd az ",{"tag":297,"to":569,"children":570},"\u002Fblog\u002Feu-ai-act-article-50-developer-checklist",[571],"50. cikk fejlesztői checklistemet",", és kérdezd meg az adatvédelmi felelősödet, mielőtt egy pilot élesbe megy.",{"type":178,"level":179,"id":149,"text":150},{"type":159,"content":575},[576],"Ha egy csapat azt kérné, hogy a jövő héten indítsak el egy voice agentet, ezt a sorrendet követném:",{"type":404,"ordered":578,"items":579},true,[580,582,584,586,588,590,592,594],[581],"Válassz egy szűk, telefonos folyamatot egyértelmű sikerkritériumokkal, például időpont-módosítást vagy rendelésállapotot. Határozd meg a célt: medián kb. egy másodperc alatt az első kimondott szóig, és egy olyan 95. percentilis, amellyel együtt tudsz élni.",[583],"Kezdj kaszkádolt pipeline-nal Pipecaten vagy LiveKiten, hogy minden fázisnak legyen naplója, időmérése és cserélhető szolgáltatója. Futtass egy realtime modellt második változatként ugyanazokon a hívásokon.",[585],"Műszerezz minden kört az első naptól: körvég, végleges STT, LLM első token, TTS első bájt és lejátszás kezdete. Ábrázold a mediánt és a 95. percentilist fázisonként.",[587],"Válassz olyan szemantikus turn-felismerőt, amely támogatja a nyelveidet, és teszteld a téves barge-int zajos vonalakkal és kihangosítással. Ahol a nyelvedhez nincs detektor, hangold a csendküszöböket nyelvenként.",[589],"Építsd a toolokat szűkre és gyorsra, időkorláttal és kimondott töltelékmondatokkal, és adj visszaolvasásos megerősítést minden írás elé.",[591],"Add hozzá az MI-tájékoztatást az első mondatban, az emberi átadási utat és egy megőrzési szabályt a hangra és az átiratokra.",[593],"Építsd meg a nyelvenkénti kiértékelő készletet valódi felvételekből, és futtasd újra minden modell- vagy hangváltáskor.",[595],"Csak ezután optimalizálj költséget: kisebb modellek az egyszerű körökre, prompt caching és olcsóbb hangok, ahol a minőség megengedi.",{"type":159,"content":597},[598],"A keretrendszer megválasztása kevésbé számít, mint a fegyelem a kerettel. A Pipecat nyílt forráskódú (BSD-2) Python keretrendszer, amely több mint 150 szolgáltatást hangol össze, a LiveKit Agents pedig Apache 2.0 alatt nyílt forráskódú, és az ügynököt résztvevőként teszi egy WebRTC-szobába. Mindkettővel szolgáltatót válthatsz a logikád átírása nélkül, és pontosan ezt akarod egy olyan területen, ahol a legjobb modell negyedévente változik.",{"type":178,"level":179,"id":152,"text":153},{"type":159,"content":601},[602],"A speech-to-speech modellek tovább zárkóznak fel a késleltetésben és a minőségben, a kaszkádolt pipeline pedig megtartja a helyét mindenhol, ahol a szöveget ellenőrizni kell. Arra számítok, hogy a legtöbb éles rendszer hibrid lesz: realtime modell a csevegésre és az egyszerű körökre, és szöveges út toolokkal és guardrailekkel mindenre, ami egy rendszer-nyilvántartást érint.",{"type":159,"content":604},[605,606,610],"Az állandó a keret. Az a voice agent, amely egy másodperc alatt válaszol, tudja, mikor kell hallgatnia, megmondja, ki ő, és átad egy embernek, amikor kell, legyőz egy okosabbat, amely ezt nem teszi. Ha egyet tervezel, és szeretnél egy második szemet az architektúrán, pontosan ilyen munkát végzek ",{"tag":297,"to":607,"children":608},"\u002Fexpertise\u002Fai-engineer",[609],"AI engineerként",".",{"type":178,"level":179,"id":155,"text":156},{"type":404,"ordered":578,"items":613},[614,617,620,623,626,629,632,635,638,641,644,647,650,653,656,659,662,665],[615],{"tag":184,"href":38,"children":616},[37],[618],{"tag":184,"href":41,"children":619},[40],[621],{"tag":184,"href":44,"children":622},[43],[624],{"tag":184,"href":47,"children":625},[46],[627],{"tag":184,"href":50,"children":628},[49],[630],{"tag":184,"href":53,"children":631},[52],[633],{"tag":184,"href":56,"children":634},[55],[636],{"tag":184,"href":59,"children":637},[58],[639],{"tag":184,"href":62,"children":640},[61],[642],{"tag":184,"href":65,"children":643},[64],[645],{"tag":184,"href":68,"children":646},[67],[648],{"tag":184,"href":71,"children":649},[70],[651],{"tag":184,"href":74,"children":652},[73],[654],{"tag":184,"href":77,"children":655},[76],[657],{"tag":184,"href":80,"children":658},[79],[660],{"tag":184,"href":83,"children":661},[82],[663],{"tag":184,"href":86,"children":664},[85],[666],{"tag":184,"href":89,"children":667},[88],[669,740,800,879],{"slug":670,"published":5,"minutes":671,"category":7,"tags":672,"keywords":677,"about":687,"sources":697,"cover":734,"og":735,"expertise":92,"locales":736,"lang":96,"title":737,"description":738,"coverAlt":739},"openai-dots-always-on-agents-impact",14,[673,674,675,676],"OpenAI dots","AI agents","GPT-6 Astra","AI governance",[673,678,679,680,681,682,683,684,685,686],"what are OpenAI dots","OpenAI dots impact","always-on AI agents","GPT-6 Astra agents","dots Auto-review and Custom Rules","specialist dots for enterprise","OpenAI dots EU availability","OpenAI DevDay 2026","AI agents in the workplace",[688,691,694],{"name":689,"url":690},"OpenAI","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenAI",{"name":692,"url":693},"ChatGPT","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FChatGPT",{"name":695,"url":696},"Intelligent agent","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FIntelligent_agent",[698,701,704,707,710,713,716,719,722,725,728,731],{"title":699,"url":700},"OpenAI: Introducing dots (29 September 2026)","https:\u002F\u002Fopenai.com\u002Findex\u002Fintroducing-dots\u002F",{"title":702,"url":703},"OpenAI: How we build safety, security and privacy into dots","https:\u002F\u002Fopenai.com\u002Findex\u002Fhow-we-build-safety-security-and-privacy-into-dots\u002F",{"title":705,"url":706},"OpenAI Help Center: Dots privacy, security, and safety FAQs","https:\u002F\u002Fhelp.openai.com\u002Fen\u002Farticles\u002F20001529-dots-privacy-security-and-safety-faqs",{"title":708,"url":709},"TechCrunch: OpenAI launches Dots, its bubbly agentic avatar","https:\u002F\u002Ftechcrunch.com\u002F2026\u002F09\u002F29\u002Fopenai-launches-dots-its-bubbly-agentic-avatar\u002F",{"title":711,"url":712},"Unite.AI: OpenAI rolls out dots agents powered by GPT-6 Astra in ChatGPT","https:\u002F\u002Fwww.unite.ai\u002Fopenai-rolls-out-dots-agents-powered-by-gpt-6-astra-in-chatgpt\u002F",{"title":714,"url":715},"MediaNama: OpenAI launches dots that keep working without user prompts","https:\u002F\u002Fwww.medianama.com\u002F2026\u002F10\u002F223-openai-launches-dots-devday-2026\u002F",{"title":717,"url":718},"PYMNTS: OpenAI launches dots to capture AI agent market","https:\u002F\u002Fwww.pymnts.com\u002Fnews\u002Fartificial-intelligence\u002F2026\u002Fopenai-launches-dots-to-capture-ai-agent-market\u002F",{"title":720,"url":721},"Yahoo Finance: OpenAI debuts Dots AI agents in challenge to Meta's Muse","https:\u002F\u002Ffinance.yahoo.com\u002Ftechnology\u002Farticle\u002Fopenai-debuts-dots-ai-agents-in-challenge-to-metas-popular-muse-agent-174616593.html",{"title":723,"url":724},"CNBC: OpenAI abandons plan to release upcoming model as safety concerns escalate","https:\u002F\u002Fwww.cnbc.com\u002F2026\u002F09\u002F28\u002Fopenai-abandons-plan-to-release-upcoming-model-as-safety-concerns-escalate.html",{"title":726,"url":727},"The Hacker News: OpenAI shelves GPT-6.1 Astra after tests find deception and unauthorized actions","https:\u002F\u002Fthehackernews.com\u002F2026\u002F09\u002Fopenai-shelves-gpt-61-astra-after-tests.html",{"title":729,"url":730},"Al Jazeera: OpenAI launches dots, personal AI assistant built to handle everything","https:\u002F\u002Fwww.aljazeera.com\u002Feconomy\u002F2026\u002F9\u002F30\u002Fopenai-launches-dots-personal-ai-assistant-built-to-handle-everything",{"title":732,"url":733},"RedactSure: Do OpenAI dots Custom Rules control what the agent sees?","https:\u002F\u002Fredactsure.com\u002Fresearch\u002Fdo-openai-dots-custom-rules-control-what-the-agent-sees","\u002Fimages\u002Fblog\u002Fopenai-dots-always-on-agents-impact\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenai-dots-always-on-agents-impact\u002Fog.jpg",[94,95,96],"OpenAI dots: mit változtatnak meg a mindig aktív ügynökök, és mit nem","Az OpenAI dots saját géppel dolgozó, mindig aktív GPT-6 Astra ügynökök. Mi indult el, hol érnek véget a védelmek, és mi változik a munkában, az IT-ban és Európában.","Ábra: egy GPT-6 Astrán futó dot elágazik a Slack és a Teams, több mint 4000 alkalmazás, a saját felhőgépe és egy jóváhagyó, ellenőrző ember felé.",{"slug":741,"published":5,"minutes":6,"category":7,"tags":742,"keywords":746,"about":757,"sources":765,"cover":794,"og":795,"expertise":92,"locales":796,"lang":96,"title":797,"description":798,"coverAlt":799},"human-in-the-loop-ai-agents",[743,674,744,745],"Human in the loop","Approval gates","Agent safety",[747,748,749,750,751,752,753,754,755,756],"human in the loop AI agents","human in the loop KI-Agent","Mensch im Loop KI","AI agent approval gates","agent approval fatigue","LangGraph interrupt human in the loop","OpenAI Agents SDK needs_approval","Claude Agent SDK canUseTool","AI agent audit trail","risk tiers for AI agent actions",[758,761,762],{"name":759,"url":760},"Human-in-the-loop","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FHuman-in-the-loop",{"name":695,"url":696},{"name":763,"url":764},"Audit trail","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAudit_trail",[766,769,772,775,778,781,784,787,790,793],{"title":767,"url":768},"LangChain docs: LangGraph interrupts","https:\u002F\u002Fdocs.langchain.com\u002Foss\u002Fpython\u002Flanggraph\u002Finterrupts",{"title":770,"url":771},"LangChain docs: Human-in-the-loop (HumanInTheLoopMiddleware)","https:\u002F\u002Fdocs.langchain.com\u002Foss\u002Fpython\u002Flangchain\u002Fhuman-in-the-loop",{"title":773,"url":774},"OpenAI Agents SDK (Python): Human in the loop","https:\u002F\u002Fgithub.com\u002Fopenai\u002Fopenai-agents-python\u002Fblob\u002Fmain\u002Fdocs\u002Fhuman_in_the_loop.md",{"title":776,"url":777},"Claude Agent SDK: Handle approvals and user input","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fagent-sdk\u002Fuser-input",{"title":779,"url":780},"Claude Agent SDK: Configure permissions","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fagent-sdk\u002Fpermissions",{"title":782,"url":783},"Claude Code docs: Hooks (PreToolUse defer, PermissionRequest)","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fhooks",{"title":785,"url":786},"Anthropic Engineering: Claude Code auto mode","https:\u002F\u002Fanthropic.com\u002Fengineering\u002Fclaude-code-auto-mode",{"title":788,"url":789},"DevOps.com: Anthropic makes Claude Code auto mode the default","https:\u002F\u002Fdevops.com\u002Fanthropic-makes-claude-codes-auto-mode-the-default-betting-automation-beats-manual-review\u002F",{"title":791,"url":792},"EU AI Act, Article 14: Human oversight","https:\u002F\u002Fartificialintelligenceact.eu\u002Farticle\u002F14\u002F",{"title":702,"url":703},"\u002Fimages\u002Fblog\u002Fhuman-in-the-loop-ai-agents\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fhuman-in-the-loop-ai-agents\u002Fog.jpg",[94,95,96],"Human in the loop AI-ügynököknél: hová kerüljenek a jóváhagyási kapuk","Hová valók a jóváhagyási kapuk egy AI-ügynökben, hogyan kerülheted el a vaktában jóváhagyást, és hogyan működik az interrupt és resume a LangGraphban és az SDK-kban.","Diagram: az ügynök javasol egy műveletet, a kockázati kapu automatikus futtatásra, emberi jóváhagyásra vagy tiltásra irányítja, és minden döntés az audit naplóba kerül.",{"slug":801,"published":5,"minutes":6,"category":7,"tags":802,"keywords":807,"about":818,"sources":826,"cover":873,"og":874,"expertise":92,"locales":875,"lang":96,"title":876,"description":877,"coverAlt":878},"ai-agent-memory-design",[803,804,805,806],"AI agent memory","Context engineering","Memory poisoning","GDPR",[808,809,810,811,812,813,814,815,816,817],"AI agent memory design","long-term memory for AI agents","episodic semantic procedural memory LLM","agent memory architecture","ChatGPT memory vs Claude memory","Claude memory tool","AI memory poisoning","LLM context compaction","AI agent memory GDPR","short-term vs long-term memory agents",[819,820,823],{"name":695,"url":696},{"name":821,"url":822},"General Data Protection Regulation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FGeneral_Data_Protection_Regulation",{"name":824,"url":825},"Prompt injection","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPrompt_injection",[827,830,833,836,839,842,845,848,851,854,857,860,863,864,867,870],{"title":828,"url":829},"Anthropic docs: Memory tool","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fagents-and-tools\u002Ftool-use\u002Fmemory-tool",{"title":831,"url":832},"Anthropic docs: Context editing","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fcontext-editing",{"title":834,"url":835},"Anthropic Engineering: Effective context engineering for AI agents","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents",{"title":837,"url":838},"Sumers et al.: Cognitive Architectures for Language Agents (CoALA)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2309.02427",{"title":840,"url":841},"Packer et al.: MemGPT, Towards LLMs as Operating Systems","https:\u002F\u002Farxiv.org\u002Fabs\u002F2310.08560",{"title":843,"url":844},"Park et al.: Generative Agents, Interactive Simulacra of Human Behavior","https:\u002F\u002Farxiv.org\u002Fabs\u002F2304.03442",{"title":846,"url":847},"Unit 42: When AI Remembers Too Much, persistent behaviors in agents memory","https:\u002F\u002Funit42.paloaltonetworks.com\u002Findirect-prompt-injection-poisons-ai-longterm-memory\u002F",{"title":849,"url":850},"From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents (preprint)","https:\u002F\u002Farxiv.org\u002Fhtml\u002F2606.04329v1",{"title":852,"url":853},"The Hacker News: ChatGPT macOS flaw could have enabled long-term spyware via memory function","https:\u002F\u002Fthehackernews.com\u002F2024\u002F09\u002Fchatgpt-macos-flaw-couldve-enabled-long.html",{"title":855,"url":856},"Vectorize: OWASP ASI06, Memory and Context Poisoning explained","https:\u002F\u002Fvectorize.io\u002Farticles\u002Fowasp-asi06",{"title":858,"url":859},"Claude Help Center: Use chat search and memory to build on previous context","https:\u002F\u002Fsupport.claude.com\u002Fen\u002Farticles\u002F11817273-use-claude-s-chat-search-and-memory-to-build-on-previous-context",{"title":861,"url":862},"OpenAI Help Center: Memory in ChatGPT","https:\u002F\u002Fhelp.openai.com\u002Fen\u002Farticles\u002F8590148-memory-faq",{"title":705,"url":706},{"title":865,"url":866},"Flavio Copes: A deep dive into OpenAI dots (quotes the dots documentation on memory)","https:\u002F\u002Fflaviocopes.com\u002Fopenai-dots\u002F",{"title":868,"url":869},"GDPR Article 5: Principles relating to processing of personal data","https:\u002F\u002Fgdpr-info.eu\u002Fart-5-gdpr\u002F",{"title":871,"url":872},"GDPR Article 17: Right to erasure","https:\u002F\u002Fgdpr-info.eu\u002Fart-17-gdpr\u002F","\u002Fimages\u002Fblog\u002Fai-agent-memory-design\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fai-agent-memory-design\u002Fog.jpg",[94,95,96],"AI-ügynökök memóriájának tervezése: szintek, írási szabályok, poisoning és GDPR","Hogyan tervezz memóriát AI-ügynököknek: kontextus, session és hosszú távú szint, mit tárolj és mit soha, retrieval, compaction, poisoning, GDPR-törlés.","Ábra: egy AI-ügynök egymásba ágyazott memóriaszintjei a munkakontextustól a session állapoton át az epizodikus és szemantikus hosszú távú memóriáig.",{"slug":880,"published":5,"minutes":881,"category":7,"tags":882,"keywords":885,"about":896,"sources":904,"cover":938,"og":939,"expertise":92,"locales":940,"lang":96,"title":941,"description":942,"coverAlt":943},"multi-agent-systems-when-worth-it",12,[883,674,884,804],"Multi-agent systems","Orchestrator-worker",[886,887,888,889,890,891,892,893,894,895],"multi-agent systems when worth it","multi-agent vs single agent","orchestrator-worker pattern","multi-agent LLM token cost","why multi-agent systems fail","don't build multi-agents","subagents context isolation","multi-agent debate worth it","agent handoffs vs subagents","when to use multiple AI agents",[897,900,901],{"name":898,"url":899},"Multi-agent system","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FMulti-agent_system",{"name":695,"url":696},{"name":902,"url":903},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",[905,908,911,914,917,920,923,926,929,932,935],{"title":906,"url":907},"Anthropic Engineering: How we built our multi-agent research system","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fmulti-agent-research-system",{"title":909,"url":910},"Anthropic: Building effective agents","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fbuilding-effective-agents",{"title":912,"url":913},"Cognition: Don't Build Multi-Agents (12 June 2025)","https:\u002F\u002Fcognition.com\u002Fblog\u002Fdont-build-multi-agents",{"title":915,"url":916},"Cognition: Multi-Agents: What's Actually Working (22 April 2026)","https:\u002F\u002Fcognition.com\u002Fblog\u002Fmulti-agents-working",{"title":918,"url":919},"Google Research: Towards a science of scaling agent systems","https:\u002F\u002Fresearch.google\u002Fblog\u002Ftowards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work\u002F",{"title":921,"url":922},"arXiv 2512.08296: Towards a Science of Scaling Agent Systems","https:\u002F\u002Farxiv.org\u002Fabs\u002F2512.08296",{"title":924,"url":925},"arXiv 2503.13657: Why Do Multi-Agent LLM Systems Fail? (MAST)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2503.13657",{"title":927,"url":928},"arXiv 2305.14325: Improving Factuality and Reasoning in Language Models through Multiagent Debate","https:\u002F\u002Farxiv.org\u002Fabs\u002F2305.14325",{"title":930,"url":931},"arXiv 2502.08788: Stop Overvaluing Multi-Agent Debate","https:\u002F\u002Farxiv.org\u002Fabs\u002F2502.08788",{"title":933,"url":934},"OpenAI Agents SDK: Handoffs","https:\u002F\u002Fopenai.github.io\u002Fopenai-agents-python\u002Fhandoffs\u002F",{"title":936,"url":937},"Claude Code documentation: Subagents","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fsub-agents","\u002Fimages\u002Fblog\u002Fmulti-agent-systems-when-worth-it\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fmulti-agent-systems-when-worth-it\u002Fog.jpg",[94,95,96],"Multi-agent rendszerek: mikor verik az egyetlen ügynököt, és mikor nem","Orchestrator-worker, fan-out, critic, handoff: mit ad valójában a multi-agent rendszer, mennyi tokenbe kerül, hogyan hibázik, és egy döntési táblázat.","Diagram: egy vezető ügynök négy worker ügynöknek osztja ki a munkát, mindegyiknek saját, elszigetelt kontextusablaka van, az összefoglalóikat pedig összegyűjti.",1791009036710]