Eszközök/LLMOps és értékelés

Helicone: observability, ami a kérés útjában ül

A Helicone Apache-2.0 licencű LLM gateway és observability platform. Mit ad a proxy architektúra, mit kér érte, és hogyan néz ki valójában a saját üzemeltetés.

Típus
LLM observability
Ár
Open core · from $20 per month

··10 perc olvasás

  • LLM observability
  • OpenTelemetry
  • Cost tracking
  • Proxy
  • Gateway
Címlap: Helicone, LLM-observability platform, a kérés útja az alkalmazástól az edge proxyn át a szolgáltatóig és vissza a naplótárba

A lényeg röviden

  • A Helicone Apache-2.0 licencű, körülbelül 6 200 GitHub-csillaga van, és több mint 100 modellt fog össze egyetlen OpenAI-kompatibilis végpont mögött.
  • Az integráció egy sor: más base URL, vagy az aszinkron OpenLLMetry út, ha a proxy nem lehet a kritikus úton.
  • A proxy hoz cache-t, rate limiteket, fallbackeket és retry-kat, az aszinkron út mindegyikről lemond.
  • A gyártói benchmark szerint az átlag 2,21 másodperc direkt és proxyn keresztül egyaránt, 500 összevált kérésen mérve, text-ada-001 modellel.
  • A saját üzemeltetés öt komponenst jelent — web, worker, Jawn, Supabase és ClickHouse plusz MinIO —, és a Jawn már nem proxyz, a gateway külön szolgáltatás.

A Helicone Apache-2.0 licencű LLM gateway és observability platform, és a teszt álláspontja az, hogy az architektúra maga a történet: a Helicone úgy működik, hogy az alkalmazás és a modellszolgáltató közé kerül. Egyetlen módosított kódsorért hatalmas funkcionalitást vásárol, és egy hálózati ugrást, egy adatrezidencia-kérdést és egy szolgáltatót a kritikus úton fizet. Azoknak a csapatoknak, akiknek hétfőn kell egy dashboard, jó ez a csere. Azoknak, akiknek millisecondosban mért késleltetési budgetjük van vagy szabályuk szerint a promptok nem hagyhatják el a hálózatot, rossz az alak.

Két irányban is versenyez. A tiszta tracing backendekhez képest, mint a Langfuse, az Arize Phoenix és a LangSmith, nyer az első dashboardig eltelt időben és a proxyhoz kötött gateway funkciókban, veszít a natív OpenTelemetry instrumentációban és az értékelési eszközökben. Az API routerekhez képest, mint a LiteLLM vagy az OpenRouter, ez először observability, routing csak a toldalék.

Mi ez

Két termék osztozik egy kódbázison. A gateway OpenAI-kompatibilis végpont több mint 100 szolgáltató előtt, amit úgy ér el, hogy a base URL-t az ai-gateway.helicone.ai végpontra állítja. Az observability platform az, ami rögzíti az áthaladó kéréseket, ClickHouse-ban tárolja őket, és dashboardon, HQL nevű SQL-szerű lekérdezési nyelven, alerteken, riportokon és webhookokon keresztül válaszol a költség-, késleltetés-, session- és felhasználókérdésekre.

  • Apache 2.0 licenc, körülbelül 6 200 GitHub-csillag, és az a tény, hogy a Helicone 2025-ben a Mintlifhez csatlakozott.
  • Egysoros integráció: base URL-t állítani, vagy aszinkron naplót küldeni az OpenLLMetry instrumentáción át.
  • Költségkövetés a tokenhasználatból és egy nyilvános adatbázisból, amely több mint 300 modellt és szolgáltatót fed le.
  • Gateway funkciók a kérés útján: edge cache, egyedi rate limitek kérésszám, költség vagy property alapján, és automatikus fallbackek.
  • Operatív felület: sessionök, felhasználói metrikák, custom property-k, score-ok, datasetek, webhookok és egy MCP szerver az adatok fölött.
  • Saját üzemeltetés öt szolgáltatás: egy web frontend, egy Cloudflare Worker, a Jawn gyűjtő, a Supabase és a ClickHouse, plusz MinIO a tartalmakhoz.

Hogyan működik

A kérés útját szándékosan vékonyra tartják. Hacsak egy header nem kapcsol be funkciót, a worker változatlanul továbbítja a kérést és visszaadja a választ; a válasz befejezése után a proxy Kafka-ra küldi a naplókat egy külön szolgáltatás számára. A rendelkezésreállás-dokumentáció közvetlenül kimondja a szándékot: minden üzleti logika hiba esetén visszaesik a tiszta proxyzásra, így az observability egy hibája működő átviteli eszközzé minősül.

A Helicone kérés útjaFelső sor: az alkalmazás chat completiont küld az OpenAI SDK-val a Helicone gatewayhez, amely Cloudflare Workersen fut, és vagy cache találatot ad vissza, vagy továbbít a szolgáltatónak és visszaadja a választ. Alsó sor: a válasz befejezése után a naplók Kafka-ra, majd ClickHouseba (analitika) és MinIOba (request és response body) kerülnek, ahonnan a dashboard, a HQL, az alertek és a riportok olvasnak. Alatta egy sáv: az aszinkron út teljesen megkerüli a gatewayt, az alkalmazás maga logol a válasz után, és cserébe lemond a cache-ről, a rate limitekről és a retry-król. Hiba esetén a worker visszaesik a tiszta proxyzásra, így az observability átviteli eszközzé degrádálódik.A Helicone kérés útjaelőbb proxy, utána naplókAlkalmazásodOpenAI SDK, egy sorkérésGatewayCloudflare Workers, edgetovábbításSzolgáltató100+ modell, egy APIválaszcsak a válasz utánnaplók a Kafka-raedge cacherate limitek, fallbackekClickHouse az analitikáhozMinIO a request body-khozDashboard, HQL, alertek, riportok, MCPAszinkron út gateway nélkül: napló a válasz után, cache, rate limitek és retry nélkülHiba esetén a worker visszaesik a tiszta proxyzásra, az observability átviteli eszközzé degrádálódik
A gateway csak proxy módban van a kritikus úton, a naplózás viszont mindkét módban a válasz után történik.

Egy következményt világosan ki kell mondani: proxy módban alapértelmezés szerint minden prompt és minden válasz átmegy egy külső edge hálózaton. A saját üzemeltetés megszünteti ezt, de éppen azt a részt is eltávolítja, ami a Heliconét könűenné teszi, mert a saját Jáwn már nem proxyz — a dokumentáció rögzíti, hogy a gateway route-okat eltávolították, és az AI Gateways-t külön kell telepíteni.

Első lépések

A teljes integráció egy base URL. Az alábbi példa az edge cache-et is bekapcsolja, ami a leggyorsabb módja annak, hogy a platform csináljon valami láthatót: a második azonos kérés a Cloudflare KV-tárolójából jön, nem a szolgáltatótól.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gateway.helicone.ai",
    api_key=os.environ["HELICONE_API_KEY"],
    default_headers={
        "Helicone-Cache-Enabled": "true",
        "Cache-Control": "max-age=3600",
        "Helicone-Cache-Seed": "user-123",
        "Helicone-Property-Env": "production",
    },
)

response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[{"role": "user", "content": "Summarise the refund policy."}],
)

print(response.choices[0].message.content)
# The next identical call returns Helicone-Cache: HIT and skips the provider.

A cache kulcsa a cache seed, a kérés URL-je, a teljes request body és a releváns headerek hash-e, tehát pontos egyezés és nem szemantikus: egy szó vagy egy hőmérséklet megváltozása már találatlan. Az időtartam egy órától 365 napos maximumig terjed, a nem determinisztikus promptokhoz 20 eltárolt válasz enged bucket méret van, és a Helicone-Cache-Ignore-Keys kiveszi a kulcsból a request id-t vagy a szolgáltató saját prompt_cache_key mezőjét.

Proxy vagy async, válassz tudatosan

Ez a döntés formálja minden mást. A Helicone mindkét módot dokumentálja, és szokatlanul őszinte a köztük lévő hézagról, ami könnyűvé teszi a választás végigvezetését, akkor is, ha a válasz ritkán kényelmes.

KépességProxy módAsync mód
A kritikus útonigennem
Gateway cache és bucketekigennem érhető el
Egyedi rate limitekigennem érhető el
Automatikus retry-kigennem érhető el
Automatikus prompt-formázásigennem érhető el
Beállítási ráfordításegy base URLinstrumentálás OpenLLMetryvel
Sessionök és felhasználói metrikákigenigen
Custom property-k és score-okigenigen
Adatúta promptok átmennek a Helicone edge-éna promptok a szolgáltatónál maradnak
Akkor válassz, haa cache és a rate limitek számítanaka propagációs késés elfogadhatatlan

A reális következtetés: ez két termék egy néven. A proxy egy gateway, amihez analitika van akasztva; az aszinkron integráció egy naplzókönyvtár webes felülettel. Aki a proxyt választja, cache-t, rate limiteket és fallbackeket kap, amiket különben maguknak kellene megépíteniük, és egy plusz ugrással és egy adatrezidencia-döntéssel fizet. Aki az aszinkron utat választja, megtartja a késleltetési budgetjét és a hálózati határát, és maga építi meg a gatewayt, vagy lemond róla.

Késleltetés és egy ugrás ára

A közzétett benchmark kicsi, de szokásosan jól leírt: 500 egyedi prompttal küldött kérés az OpenAI és a Helicone között ugyanabban az egy másodperces ablakban összeváltva, váltakozva, hogy melyik végpontot hívták először, maximális prompt kontextussal, text-ada-001-en, a két halmaz körbejárási késleltetését naplózva.

StatisztikaOpenAI direkt (s)Helicone proxyn (s)
Átlag2.212.21
Medián2.872.90
Szórás1.121.12
p903.273.29
Maximum3.563.76
Módszer500 összevált kérésazonos promotok, váltakozó sorrend
Modelltext-ada-001text-ada-001, maximális kontextus
Többletalapvonalcsak a maximumban látható
Ki futtattaa gyártóa gyártó

Olvasd el figyelmesen a maximum sort. Kétszáz millisekundum különbség egy másfél másodperces válaszon 6 százalék, és ugyanez az abszolút ugrás egy 300 milliszekundumos modellhíváson vagy egy 40 milliszekundumos eszközhíváson uralkodna. A benchmark ráadásul egy gyártói teszt egy visszavonott modellen: azt mutatja, hogy a többlet korlátos, nem azt, hogy egy adott terhelésnél mekkora lesz.

Árak és melyik számláló számít

Az ingyenes Hobby csomag havi 10 000 kérést, egy helyet, egy szervezetet, egy gigabájtot és hét nap megőrzést tartalmaz. A Pro havi 79 $ korlátlan hellyel, egy szervezettel, alertekkel, riportokkal, HQL-lel, egy hónap megőrzéssel és percenként 1 000 beolvasott naplóval. A Team 799 $ öt szervezetért, SOC 2 és HIPAA opcióval, három hónap megőrzéssel és percenként 15 000 naplóval. Az Enterprise korlátlan szervezetet, SAML SSO-t és on-prem telepítést ad.

A szám, amelyre figyelni kell, egyiket sem árazza előkelően: az ingestion. Egy Hobby munkatér percenként 10 naplót olvas be, a Pro 1 000-et, a Team 15 000-et. Egy termelési alkalmazás felhasználónkénti kérésre több naplót is kiadhat — modellhívás, retrieval lépés, eszközhívás —, így egy mérsékelten forgalmas termék a Pro plafonját a kéréskeret kimerítése előtt elfogyasztja, és az a csomag, ami ezt megoldja, havi 799 $. A tárolás az első gigabájt felett külön számlálódik.

CsomagDíjKérésekIngestionMegőrzésHobby0 $10 000 havonta10 napló percenként7 napPro79 $ havontahasználatalapú1 000 napló percenként1 hónapTeam799 $ havontahasználatalapú15 000 napló percenként3 hónapEnterpriseegyénihasználatalapú30 000 napló percenkéntkorlátlan
Helyek1korlátlankorlátlankorlátlan
Szervezetek115korlátlan
Fontos kiegészítéseksemmiHQL, alertek, riportokSOC 2, HIPAASAML SSO, on-prem
Saját üzemeltetésingyenesingyenesingyenesHelm chart kérésre

Az egész stack saját üzemeltetése

Az Apache-2.0 repository a teljes platformot tartalmazza, és a README közvetlenül megnevezi az üzemeltetési alakot: öt szolgáltatás, és egy kézi telepítés, amelyet nem ajánlottként jelöl a Docker compose fájl vagy egy Enterprise Helm chart javára.

  • Web: a dashboard frontendje, egy Next.js alkalmazás.
  • Worker: a proxy, a hosztolt változatban Cloudflare Workersként.
  • Jawn: a naplógyűjtő, egy Express szolgáltatás Tsoa-generált route-okkal.
  • Supabase: az alkalmazás-adatbázis és a hitelesítés.
  • ClickHouse: az analitikai tároló, amely a költség- és késleltetéskérdésekre válaszol.
  • MinIO: objektumtároló a request és response body-khoz.

Hol gyengül

Az őszinte gyengeségek strukturálisak, nem kozmetikaiak. A Helicone adatmodellje azokra a kérésekre van építve, amelyek áthaladnak a gatewayén; egy csapat, amely már OpenTelemetry spanekkel trace-el, két instrumentációs modell között kell döntsön. Az értékelési történet a Langfuse-hoz vagy a Braintrusthoz képest vékony: vannak promptok, playground és score-ok, de nincs első osztályú kísérleti munkafolyamat. És a tulajdonosi kérdés élő: a Helicone 2025-ben csatlakozott a Mintlifyhez, ami leveszi az open-core lock-in kockázatot, de hozzáadja a szokásos szolgáltatói függést.

HeliconeLangfuseArize Phoenix
LicencApache 2.0MIT mag, enterprise extrákElastic License 2.0
Instrumentációproxy vagy OpenLLMetrynatív OpenTelemetryOpenInference OTel-en
Legerősebb oldalegysoros indulás, gateway funkciókértékelési és prompt munkafolyamatoklokális, notebook-szerű értékelés
Leggyengébb oldalnem OTel-natív a tracingheznehezebb elindítani mint egy base URL-taz ELv2 nem permisszív
Gateway funkciókcache, limitek, fallbackeknincsnincs
Saját üzemeltetésApache 2.0, öt szolgáltatásMIT, Docker Compose vagy HelmELv2, saját üzemeltetés
Költségkövetésbeépítettmodellenként konfigurálhatókülön termék
Legjobb illeszkedéscsapatok, akiknek idényen láthatóság kellcsapatok, akik értékelnekcsapatok, akik lokálisan trace-elnek és értékelnek

A Langfuse MIT-licencű, 2026 januárjában megvásárolta a ClickHouse, a licenc és a saját üzemeltetés kifejezetten változatlan maradt, és szintén ClickHouse-ban tárolja a trace-eket; ha a döntő kritérium a permisszívebb licenc egy valódi értékelési stackkel, az az erősebb eszköz. Az Arize Phoenix az OpenInference konvencióira épül, és bárhol fut, air-gapped módban is, de az Elastic License 2.0 nem permisszív. A Helicone érvelése nem a képességek, hanem az idő: a repositorytól a költség-dashboardig, felhasználónkénti kérésben mérve, egy kódsor.

Ítélethoz

A Helicone akkor a jó eszköz, ha senki nem tudja megmondani, mennyibe került az LLM-elköltség a múlt kedden, és rossz, ha a késleltetés, az adatrezidencia vagy a tracing sztenderdek döntik el az architektúrát. A mérnöki munkája unalmas a legjobb értelemben: a proxy vékony, a naplók a válasz után mennek ki, és a termék a gatewaytől a dashboardig Apache-2.0. A gyengesége ugyanilyen világos: a te gatewayed akar lenni, és minden, ami kényelmessé teszi, ennek következménye.

  1. Válaszd, ha a csapatnak heteken belül kell költség-, késleltetés- és hibavisszajelzés kérésenként, és még nincs tracing stackje.
  2. Válaszd, ha az edge cache, az egyedi rate limitek és az automatikus fallbackek megérik a kérés útján.
  3. Válaszd az aszinkron OpenLLMetry utat, ha a Helicone analitikáját proxy ugrás nélkül akarod, és fogadd el a gateway funkciók hiányát.
  4. Kerüld el, ha a promptok nem hagyhatják el a hálózatot, vagy ha a proxy ugrás megeszi a kemény késleltetési budgetet.
  5. Kerüld el, ha a platform már OpenTelemetryvel trace-el, és egy második instrumentációs modell feldarabolná az adatot.
  6. Gondolj újra körülbelül 1 000 beolvasott napló percenként felett, vagy ha a kéréskeret már nagyon értékes.
  7. Gondolj újra, ha a saját üzemeltetéshez nem akarod a Cloudflare-függést, mert a proxyréteg a hosztolt termék magja.

Források

  1. Helicone gyorsindítás
  2. Helicone AI Gateway áttekintés
  3. Helicone: késleltetéshatás és benchmark
  4. Helicone: proxy versus async integráció
  5. Helicone: LLM cache
  6. Helicone: saját üzemeltetés Dockerral
  7. Helicone: hogyan számítunk költséget
  8. Helicone árak
  9. Helicone repository GitHubon

Gyakori kérdések

Nyílt forráskódú a Helicone?

Igen, Apache 2.0 licenc alatt. A körülbelül 6 200 csillagos repository a gatewayt, a naplógyűjtőt és a dashboardot tartalmazza. A hosztolt csomagok olyan funkciókat adnak hozzá, mint SOC 2 riport, HIPAA opciók, SAML SSO és on-prem szerződés.

Okoz késleltetést a Helicone proxy?

A gyártó saját benchmarkja 500 összevált kérést küld közvetlenül az OpenAI-nak és a Heliconén keresztül, és mindkét esetben 2,21 másodperces átlagot mér, p90 esetén 3,27 kontra 3,29 másodpercet. Ez egy gyártói teszt text-ada-001-en, tehát bizonyítja, hogy az többlet kicsi, nem pedig olyan szám, amelyre tervezni lehet.

Kikerülhető-e a Helicone a kritikus útból?

Igen, az aszinkron OpenLLMetry integrációval, amely a válasz után logol, és soha nem áll az alkalmazás és a szolgáltató között. A dokumentáció explicit módon megnevezi a cserearányt: az aszinkron út elveszíti a bucket cache-t, az egyedi rate limiteket és a retry-kat.

Hogyan működik a Helicone több szolgáltatóval?

Az AI Gateway egyetlen OpenAI-kompatibilis végponton keresztül 100-nál több modellt kínál, és lefordítja a kérést az adott szolgáltató formátumára. Credit használatakor a Helicone tartja a szolgáltatói kulcsokat, és nulla felemet nevez meg; saját kulcsok is használhatók.

Pont erre van szükséged?

Írj a projektedről vagy a pozícióról – szívesen hallok felőled.