Eszközök/LLMOps és értékelés
Helicone: observability, ami a kérés útjában ül
A Helicone Apache-2.0 licencű LLM gateway és observability platform. Mit ad a proxy architektúra, mit kér érte, és hogyan néz ki valójában a saját üzemeltetés.
- Típus
- LLM observability
- Ár
- Open core · from $20 per month
Balázs Csorba··10 perc olvasás
- LLM observability
- OpenTelemetry
- Cost tracking
- Proxy
- Gateway
A lényeg röviden
- A Helicone Apache-2.0 licencű, körülbelül 6 200 GitHub-csillaga van, és több mint 100 modellt fog össze egyetlen OpenAI-kompatibilis végpont mögött.
- Az integráció egy sor: más base URL, vagy az aszinkron OpenLLMetry út, ha a proxy nem lehet a kritikus úton.
- A proxy hoz cache-t, rate limiteket, fallbackeket és retry-kat, az aszinkron út mindegyikről lemond.
- A gyártói benchmark szerint az átlag 2,21 másodperc direkt és proxyn keresztül egyaránt, 500 összevált kérésen mérve, text-ada-001 modellel.
- A saját üzemeltetés öt komponenst jelent — web, worker, Jawn, Supabase és ClickHouse plusz MinIO —, és a Jawn már nem proxyz, a gateway külön szolgáltatás.
A Helicone Apache-2.0 licencű LLM gateway és observability platform, és a teszt álláspontja az, hogy az architektúra maga a történet: a Helicone úgy működik, hogy az alkalmazás és a modellszolgáltató közé kerül. Egyetlen módosított kódsorért hatalmas funkcionalitást vásárol, és egy hálózati ugrást, egy adatrezidencia-kérdést és egy szolgáltatót a kritikus úton fizet. Azoknak a csapatoknak, akiknek hétfőn kell egy dashboard, jó ez a csere. Azoknak, akiknek millisecondosban mért késleltetési budgetjük van vagy szabályuk szerint a promptok nem hagyhatják el a hálózatot, rossz az alak.
Két irányban is versenyez. A tiszta tracing backendekhez képest, mint a Langfuse, az Arize Phoenix és a LangSmith, nyer az első dashboardig eltelt időben és a proxyhoz kötött gateway funkciókban, veszít a natív OpenTelemetry instrumentációban és az értékelési eszközökben. Az API routerekhez képest, mint a LiteLLM vagy az OpenRouter, ez először observability, routing csak a toldalék.
Mi ez
Két termék osztozik egy kódbázison. A gateway OpenAI-kompatibilis végpont több mint 100 szolgáltató előtt, amit úgy ér el, hogy a base URL-t az ai-gateway.helicone.ai végpontra állítja. Az observability platform az, ami rögzíti az áthaladó kéréseket, ClickHouse-ban tárolja őket, és dashboardon, HQL nevű SQL-szerű lekérdezési nyelven, alerteken, riportokon és webhookokon keresztül válaszol a költség-, késleltetés-, session- és felhasználókérdésekre.
- Apache 2.0 licenc, körülbelül 6 200 GitHub-csillag, és az a tény, hogy a Helicone 2025-ben a Mintlifhez csatlakozott.
- Egysoros integráció: base URL-t állítani, vagy aszinkron naplót küldeni az OpenLLMetry instrumentáción át.
- Költségkövetés a tokenhasználatból és egy nyilvános adatbázisból, amely több mint 300 modellt és szolgáltatót fed le.
- Gateway funkciók a kérés útján: edge cache, egyedi rate limitek kérésszám, költség vagy property alapján, és automatikus fallbackek.
- Operatív felület: sessionök, felhasználói metrikák, custom property-k, score-ok, datasetek, webhookok és egy MCP szerver az adatok fölött.
- Saját üzemeltetés öt szolgáltatás: egy web frontend, egy Cloudflare Worker, a Jawn gyűjtő, a Supabase és a ClickHouse, plusz MinIO a tartalmakhoz.
Hogyan működik
A kérés útját szándékosan vékonyra tartják. Hacsak egy header nem kapcsol be funkciót, a worker változatlanul továbbítja a kérést és visszaadja a választ; a válasz befejezése után a proxy Kafka-ra küldi a naplókat egy külön szolgáltatás számára. A rendelkezésreállás-dokumentáció közvetlenül kimondja a szándékot: minden üzleti logika hiba esetén visszaesik a tiszta proxyzásra, így az observability egy hibája működő átviteli eszközzé minősül.
Egy következményt világosan ki kell mondani: proxy módban alapértelmezés szerint minden prompt és minden válasz átmegy egy külső edge hálózaton. A saját üzemeltetés megszünteti ezt, de éppen azt a részt is eltávolítja, ami a Heliconét könűenné teszi, mert a saját Jáwn már nem proxyz — a dokumentáció rögzíti, hogy a gateway route-okat eltávolították, és az AI Gateways-t külön kell telepíteni.
Első lépések
A teljes integráció egy base URL. Az alábbi példa az edge cache-et is bekapcsolja, ami a leggyorsabb módja annak, hogy a platform csináljon valami láthatót: a második azonos kérés a Cloudflare KV-tárolójából jön, nem a szolgáltatótól.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://ai-gateway.helicone.ai",
api_key=os.environ["HELICONE_API_KEY"],
default_headers={
"Helicone-Cache-Enabled": "true",
"Cache-Control": "max-age=3600",
"Helicone-Cache-Seed": "user-123",
"Helicone-Property-Env": "production",
},
)
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": "Summarise the refund policy."}],
)
print(response.choices[0].message.content)
# The next identical call returns Helicone-Cache: HIT and skips the provider.A cache kulcsa a cache seed, a kérés URL-je, a teljes request body és a releváns headerek hash-e, tehát pontos egyezés és nem szemantikus: egy szó vagy egy hőmérséklet megváltozása már találatlan. Az időtartam egy órától 365 napos maximumig terjed, a nem determinisztikus promptokhoz 20 eltárolt válasz enged bucket méret van, és a Helicone-Cache-Ignore-Keys kiveszi a kulcsból a request id-t vagy a szolgáltató saját prompt_cache_key mezőjét.
Proxy vagy async, válassz tudatosan
Ez a döntés formálja minden mást. A Helicone mindkét módot dokumentálja, és szokatlanul őszinte a köztük lévő hézagról, ami könnyűvé teszi a választás végigvezetését, akkor is, ha a válasz ritkán kényelmes.
| Képesség | Proxy mód | Async mód |
|---|---|---|
| A kritikus úton | igen | nem |
| Gateway cache és bucketek | igen | nem érhető el |
| Egyedi rate limitek | igen | nem érhető el |
| Automatikus retry-k | igen | nem érhető el |
| Automatikus prompt-formázás | igen | nem érhető el |
| Beállítási ráfordítás | egy base URL | instrumentálás OpenLLMetryvel |
| Sessionök és felhasználói metrikák | igen | igen |
| Custom property-k és score-ok | igen | igen |
| Adatút | a promptok átmennek a Helicone edge-én | a promptok a szolgáltatónál maradnak |
| Akkor válassz, ha | a cache és a rate limitek számítanak | a propagációs késés elfogadhatatlan |
A reális következtetés: ez két termék egy néven. A proxy egy gateway, amihez analitika van akasztva; az aszinkron integráció egy naplzókönyvtár webes felülettel. Aki a proxyt választja, cache-t, rate limiteket és fallbackeket kap, amiket különben maguknak kellene megépíteniük, és egy plusz ugrással és egy adatrezidencia-döntéssel fizet. Aki az aszinkron utat választja, megtartja a késleltetési budgetjét és a hálózati határát, és maga építi meg a gatewayt, vagy lemond róla.
Késleltetés és egy ugrás ára
A közzétett benchmark kicsi, de szokásosan jól leírt: 500 egyedi prompttal küldött kérés az OpenAI és a Helicone között ugyanabban az egy másodperces ablakban összeváltva, váltakozva, hogy melyik végpontot hívták először, maximális prompt kontextussal, text-ada-001-en, a két halmaz körbejárási késleltetését naplózva.
| Statisztika | OpenAI direkt (s) | Helicone proxyn (s) |
|---|---|---|
| Átlag | 2.21 | 2.21 |
| Medián | 2.87 | 2.90 |
| Szórás | 1.12 | 1.12 |
| p90 | 3.27 | 3.29 |
| Maximum | 3.56 | 3.76 |
| Módszer | 500 összevált kérés | azonos promotok, váltakozó sorrend |
| Modell | text-ada-001 | text-ada-001, maximális kontextus |
| Többlet | alapvonal | csak a maximumban látható |
| Ki futtatta | a gyártó | a gyártó |
Olvasd el figyelmesen a maximum sort. Kétszáz millisekundum különbség egy másfél másodperces válaszon 6 százalék, és ugyanez az abszolút ugrás egy 300 milliszekundumos modellhíváson vagy egy 40 milliszekundumos eszközhíváson uralkodna. A benchmark ráadásul egy gyártói teszt egy visszavonott modellen: azt mutatja, hogy a többlet korlátos, nem azt, hogy egy adott terhelésnél mekkora lesz.
Árak és melyik számláló számít
Az ingyenes Hobby csomag havi 10 000 kérést, egy helyet, egy szervezetet, egy gigabájtot és hét nap megőrzést tartalmaz. A Pro havi 79 $ korlátlan hellyel, egy szervezettel, alertekkel, riportokkal, HQL-lel, egy hónap megőrzéssel és percenként 1 000 beolvasott naplóval. A Team 799 $ öt szervezetért, SOC 2 és HIPAA opcióval, három hónap megőrzéssel és percenként 15 000 naplóval. Az Enterprise korlátlan szervezetet, SAML SSO-t és on-prem telepítést ad.
A szám, amelyre figyelni kell, egyiket sem árazza előkelően: az ingestion. Egy Hobby munkatér percenként 10 naplót olvas be, a Pro 1 000-et, a Team 15 000-et. Egy termelési alkalmazás felhasználónkénti kérésre több naplót is kiadhat — modellhívás, retrieval lépés, eszközhívás —, így egy mérsékelten forgalmas termék a Pro plafonját a kéréskeret kimerítése előtt elfogyasztja, és az a csomag, ami ezt megoldja, havi 799 $. A tárolás az első gigabájt felett külön számlálódik.
| CsomagDíjKérésekIngestionMegőrzés | Hobby0 $10 000 havonta10 napló percenként7 nap | Pro79 $ havontahasználatalapú1 000 napló percenként1 hónap | Team799 $ havontahasználatalapú15 000 napló percenként3 hónap | Enterpriseegyénihasználatalapú30 000 napló percenkéntkorlátlan |
|---|---|---|---|---|
| Helyek | 1 | korlátlan | korlátlan | korlátlan |
| Szervezetek | 1 | 1 | 5 | korlátlan |
| Fontos kiegészítések | semmi | HQL, alertek, riportok | SOC 2, HIPAA | SAML SSO, on-prem |
| Saját üzemeltetés | ingyenes | ingyenes | ingyenes | Helm chart kérésre |
Az egész stack saját üzemeltetése
Az Apache-2.0 repository a teljes platformot tartalmazza, és a README közvetlenül megnevezi az üzemeltetési alakot: öt szolgáltatás, és egy kézi telepítés, amelyet nem ajánlottként jelöl a Docker compose fájl vagy egy Enterprise Helm chart javára.
- Web: a dashboard frontendje, egy Next.js alkalmazás.
- Worker: a proxy, a hosztolt változatban Cloudflare Workersként.
- Jawn: a naplógyűjtő, egy Express szolgáltatás Tsoa-generált route-okkal.
- Supabase: az alkalmazás-adatbázis és a hitelesítés.
- ClickHouse: az analitikai tároló, amely a költség- és késleltetéskérdésekre válaszol.
- MinIO: objektumtároló a request és response body-khoz.
Hol gyengül
Az őszinte gyengeségek strukturálisak, nem kozmetikaiak. A Helicone adatmodellje azokra a kérésekre van építve, amelyek áthaladnak a gatewayén; egy csapat, amely már OpenTelemetry spanekkel trace-el, két instrumentációs modell között kell döntsön. Az értékelési történet a Langfuse-hoz vagy a Braintrusthoz képest vékony: vannak promptok, playground és score-ok, de nincs első osztályú kísérleti munkafolyamat. És a tulajdonosi kérdés élő: a Helicone 2025-ben csatlakozott a Mintlifyhez, ami leveszi az open-core lock-in kockázatot, de hozzáadja a szokásos szolgáltatói függést.
| Helicone | Langfuse | Arize Phoenix | |
|---|---|---|---|
| Licenc | Apache 2.0 | MIT mag, enterprise extrák | Elastic License 2.0 |
| Instrumentáció | proxy vagy OpenLLMetry | natív OpenTelemetry | OpenInference OTel-en |
| Legerősebb oldal | egysoros indulás, gateway funkciók | értékelési és prompt munkafolyamatok | lokális, notebook-szerű értékelés |
| Leggyengébb oldal | nem OTel-natív a tracinghez | nehezebb elindítani mint egy base URL-t | az ELv2 nem permisszív |
| Gateway funkciók | cache, limitek, fallbackek | nincs | nincs |
| Saját üzemeltetés | Apache 2.0, öt szolgáltatás | MIT, Docker Compose vagy Helm | ELv2, saját üzemeltetés |
| Költségkövetés | beépített | modellenként konfigurálható | külön termék |
| Legjobb illeszkedés | csapatok, akiknek idényen láthatóság kell | csapatok, akik értékelnek | csapatok, akik lokálisan trace-elnek és értékelnek |
A Langfuse MIT-licencű, 2026 januárjában megvásárolta a ClickHouse, a licenc és a saját üzemeltetés kifejezetten változatlan maradt, és szintén ClickHouse-ban tárolja a trace-eket; ha a döntő kritérium a permisszívebb licenc egy valódi értékelési stackkel, az az erősebb eszköz. Az Arize Phoenix az OpenInference konvencióira épül, és bárhol fut, air-gapped módban is, de az Elastic License 2.0 nem permisszív. A Helicone érvelése nem a képességek, hanem az idő: a repositorytól a költség-dashboardig, felhasználónkénti kérésben mérve, egy kódsor.
Ítélethoz
A Helicone akkor a jó eszköz, ha senki nem tudja megmondani, mennyibe került az LLM-elköltség a múlt kedden, és rossz, ha a késleltetés, az adatrezidencia vagy a tracing sztenderdek döntik el az architektúrát. A mérnöki munkája unalmas a legjobb értelemben: a proxy vékony, a naplók a válasz után mennek ki, és a termék a gatewaytől a dashboardig Apache-2.0. A gyengesége ugyanilyen világos: a te gatewayed akar lenni, és minden, ami kényelmessé teszi, ennek következménye.
- Válaszd, ha a csapatnak heteken belül kell költség-, késleltetés- és hibavisszajelzés kérésenként, és még nincs tracing stackje.
- Válaszd, ha az edge cache, az egyedi rate limitek és az automatikus fallbackek megérik a kérés útján.
- Válaszd az aszinkron OpenLLMetry utat, ha a Helicone analitikáját proxy ugrás nélkül akarod, és fogadd el a gateway funkciók hiányát.
- Kerüld el, ha a promptok nem hagyhatják el a hálózatot, vagy ha a proxy ugrás megeszi a kemény késleltetési budgetet.
- Kerüld el, ha a platform már OpenTelemetryvel trace-el, és egy második instrumentációs modell feldarabolná az adatot.
- Gondolj újra körülbelül 1 000 beolvasott napló percenként felett, vagy ha a kéréskeret már nagyon értékes.
- Gondolj újra, ha a saját üzemeltetéshez nem akarod a Cloudflare-függést, mert a proxyréteg a hosztolt termék magja.
Források
Gyakori kérdések
Nyílt forráskódú a Helicone?
Igen, Apache 2.0 licenc alatt. A körülbelül 6 200 csillagos repository a gatewayt, a naplógyűjtőt és a dashboardot tartalmazza. A hosztolt csomagok olyan funkciókat adnak hozzá, mint SOC 2 riport, HIPAA opciók, SAML SSO és on-prem szerződés.
Okoz késleltetést a Helicone proxy?
A gyártó saját benchmarkja 500 összevált kérést küld közvetlenül az OpenAI-nak és a Heliconén keresztül, és mindkét esetben 2,21 másodperces átlagot mér, p90 esetén 3,27 kontra 3,29 másodpercet. Ez egy gyártói teszt text-ada-001-en, tehát bizonyítja, hogy az többlet kicsi, nem pedig olyan szám, amelyre tervezni lehet.
Kikerülhető-e a Helicone a kritikus útból?
Igen, az aszinkron OpenLLMetry integrációval, amely a válasz után logol, és soha nem áll az alkalmazás és a szolgáltató között. A dokumentáció explicit módon megnevezi a cserearányt: az aszinkron út elveszíti a bucket cache-t, az egyedi rate limiteket és a retry-kat.
Hogyan működik a Helicone több szolgáltatóval?
Az AI Gateway egyetlen OpenAI-kompatibilis végponton keresztül 100-nál több modellt kínál, és lefordítja a kérést az adott szolgáltató formátumára. Credit használatakor a Helicone tartja a szolgáltatói kulcsokat, és nulla felemet nevez meg; saját kulcsok is használhatók.