Dieser Post ist die Landkarte, die wir gerne gehabt haetten, als wir mit Grepture anfingen. Wir bauen selbst ein Tool in diesem Bereich, das kennzeichnen wir klar. Der Grossteil dieses Beitrags handelt aber von den anderen Tools, weil du diesen Kontext zuerst brauchst.
Aktualisiert im August 2026. Die erste Version dieses Posts verglich acht Tools. Seitdem hat sich die Kategorie hart konsolidiert: Helicone wurde uebernommen und ist im Maintenance-Modus, Humanloop wurde nach dem Wechsel zu Anthropic eingestellt, und Langfuse gehoert jetzt zu ClickHouse. Wir haben den Vergleich neu geschrieben, um abzubilden, wer noch steht, und eine Dimension ergaenzt, die die urspruengliche Version unterschaetzt hat: ob dein Anbieter naechstes Jahr noch shippt.
Was du eigentlich evaluierst
Vor dem Tool-fuer-Tool-Durchgang die sechs Dimensionen, auf die es ankommt. Die meisten Vergleichstabellen im Netz uebergehen sie.
Architektur. Ist es ein Proxy (Requests fliessen hindurch), ein SDK (du instrumentierst deinen Code) oder beides? Proxies liefern Abdeckung ohne Code-Aenderungen, kosten aber einen Netzwerk-Hop. SDKs sind latenzfrei, brauchen aber Integration in jedem Service.
Standardmaessig erfasste Daten. Manche Tools loggen komplette Prompts und Completions. Andere erfassen nur Metadaten (Tokens, Latenz, Fehler). Das ist eine Datenschutzfrage: Wenn deine Prompts PII enthalten, schafft ein Log-alles-Tool eine Compliance-Haftung, die du wahrscheinlich nicht eingeplant hast. Dazu haben wir einen eigenen Beitrag geschrieben.
Evals- vs. Monitoring-Orientierung. Manche Plattformen sind um Experimente und LLM-as-Judge-Evals gebaut; Observability ist sekundaer. Andere sind Production-Monitoring zuerst, mit angeflanschten Evals. Beides ist legitim. Waehle das, was du im Alltag wirklich tust.
Granularitaet des Cost-Trackings. Token-Zaehlung ist Grundausstattung. Die echte Frage: Kannst du Ausgaben einem Team, einem Feature, einer Umgebung oder einem Nutzer zuordnen? Und kannst du Budget-Alerts setzen, bevor es dem CFO auffaellt?
Deployment-Modell. Open Source self-hosted, Cloud oder beides? Das ist meist eine Compliance-Frage, keine Kostenfrage. EU-regulierte Teams brauchen oft Self-Hosting; US-Startups selten.
Anbieter-Trajektorie. Neu in diesem Update, und auf die harte Tour gelernt von allen, die auf Helicone oder Humanloop standardisiert hatten. Observability ist Infrastruktur: Du verdrahtest sie in jeden Service und baust Dashboards, Alerts und Workflows darauf. Eine Uebernahme, die das Produkt einfriert, kostet dich eine ungeplante Migration. Schau vor der Entscheidung auf Finanzierung, Eigentuemer und Shipping-Kadenz der letzten sechs Monate, nicht auf die Feature-Liste.
Die Konsolidierungswelle, kurz
Innerhalb von rund einem Jahr hat die Kategorie ein Drittel ihrer Player verloren oder umsortiert:
- Humanloop ging zu Anthropic, die Plattform wurde im September 2025 eingestellt. Sie nimmt keine Kunden mehr an.
- Langfuse gehoert seit Januar 2026 zu ClickHouse. Anders als bei den anderen sieht das nach Investment statt Exit aus: Das Produkt wird aktiv weiterentwickelt und bleibt Open Source.
- Helicone wurde im Maerz 2026 von Mintlify uebernommen und ist im Maintenance-Modus. Bestehende Deployments laufen weiter; die Feature-Entwicklung ist gestoppt.
- Lunary ist still geworden, mit wenig sichtbarer Entwicklung oder Kommunikation seit 2024.
Das Muster zaehlt mehr als die einzelnen Deals. Punktloesungen mit einer einzigen Feature-Flaeche (nur Tracing, nur Prompt-Management) waren die, die ausgestiegen sind. Die Tools, die noch shippen, sind entweder Plattformen mit mehreren Flaechen oder Open-Source-Projekte mit tragfaehigem Sponsor.
Die Tools, die noch stehen
1. Langfuse
Langfuse ist die am weitesten verbreitete Open-Source-Plattform fuer LLM-Observability. MIT-lizenziert, self-hostbar, mit grosszuegigem Cloud-Free-Tier. Seit Januar 2026 gehoert es zu ClickHouse, was die Nachhaltigkeitsfrage in die richtige Richtung aufgeloest hat: Das Team shippt weiter (Eval-Tooling und Code-Evaluator-Runtime sind dieses Jahr vorangekommen), und die Open-Source-Lizenz bleibt.
Architektur: SDK-basiertes Tracing. Du rufst langfuse.trace() im Code auf oder nutzt die OpenAI/Anthropic-Wrapper. Kein Proxy.
Staerken: Open Source mit aktiver Community. Reiches Tracing-Modell fuer verschachtelte Spans, Generations und Scores. Eingebautes Prompt-Management und Evals. Self-Hosting ist wirklich nutzbar (braucht aber PostgreSQL, ClickHouse, Redis und Blob-Storage).
Schwaechen: Instrumentierungsaufwand, denn jeder Service mit LLM-Calls braucht das SDK. Keine nativen Multi-Provider-Gateway-Features wie Routing oder Fallback. Prompt-Management ist ordentlich, aber nicht so tief wie bei dedizierten Tools.
Waehle Langfuse, wenn: Du Open Source willst, dein Team gerne Code instrumentiert und du keine Proxy-Schicht brauchst. Den vollen Vergleich gibt es in Grepture vs. Langfuse.
2. Arize (Phoenix + AX)
Arize kommt aus klassischer ML-Observability und hat auf LLMs erweitert. Phoenix ist die Open-Source-Tracing-Bibliothek; Arize AX die bezahlte Enterprise-Plattform.
Architektur: OpenTelemetry-basiertes SDK. Phoenix laeuft lokal/self-hosted; AX ist das gehostete Enterprise-Produkt.
Staerken: Tiefes Eval- und Drift-Detection-Erbe aus der ML-Vergangenheit. Erste Wahl fuer Teams, die neben LLMs auch klassische ML-Modelle ueberwachen. OTel-Kompatibilitaet fuegt sich in bestehende Observability-Stacks.
Schwaechen: Enterprise-orientierte Preise und Sales-Motion. Overkill fuer die meisten Startups. Die LLM-Features sind juenger als die ML-Features.
Waehle Arize, wenn: Du eine groessere Organisation bist, die ML bereits in Produktion betreibt und LLM-Observability im selben Fenster will.
3. Braintrust
Braintrust ist Evals-first. Observability ist da, aber das Produkt ist um Experimente, Scoring und Prompt-Iteration organisiert. Die Series B Anfang 2026 und ein stetiger Strom von Modell-Benchmark-Reports sprechen gegen Trajektorie-Sorgen.
Architektur: SDK mit Tracing, plus eine starke Web-UI fuer Evals und Experiment-Vergleiche.
Staerken: Der beste Eval-Workflow auf dieser Liste, mit Abstand. Playground, Dataset-Management und LLM-as-Judge-Scoring greifen eng ineinander. Schnelles Produkt.
Schwaechen: Wenn du nur Production-Traffic beobachten willst, ist es mehr Produkt, als du brauchst. Closed Source, nur Cloud.
Waehle Braintrust, wenn: Dein Team stark an Prompts und Evals iteriert und Observability und Evals ein Tool sein sollen.
4. LangSmith
LangSmith ist LangChains offizielle Observability- und Eval-Plattform. Wer LangChain oder LangGraph nutzt, hat hier den Weg des geringsten Widerstands.
Architektur: SDK-basiertes Tracing, eng mit LangChains Framework-Primitiven integriert.
Staerken: Reibungslos, wenn du schon im LangChain-Oekosystem bist. Tiefe Unterstuetzung fuer Agent-Traces, Tool-Calls und Chain-Runs. Ordentliche Evals.
Schwaechen: Erste Wahl nur fuer LangChain-Shops. Wirkt angeflanscht bei rohen SDKs oder anderen Frameworks. Closed Source, und das Preismodell hat sich mehrfach geaendert.
Waehle LangSmith, wenn: Du auf LangChain/LangGraph festgelegt bist und die integrierteste Erfahrung willst.
5. Portkey
Portkey fehlte in der ersten Version dieses Posts, was schon damals eine Luecke war. Es ist zuerst ein AI Gateway (Routing, Fallback, Guardrails-Konfiguration) mit Observability auf dem Proxy obendrauf, und shippt seit der Series A Anfang 2026 schnell, zuletzt mit Fokus auf Agent-Governance und MCP.
Architektur: HTTP-Proxy. Requests laufen durch Portkeys Gateway; Logs, Kosten und Traces entstehen aus dem proxied Traffic.
Staerken: Gateway und Observability in einem, also teilen sich Routing, Fallback und Logging eine Integration. Breite Modell-Unterstuetzung. Aktive Entwicklung.
Schwaechen: Evals sind duenn im Vergleich zu Braintrust oder Langfuse. Datenschutz ist policy-orientiert (Allow/Block-Regeln) statt inhaltstransformierend: keine eingebaute PII-Redaktion der Payloads. US-zentrierte Hosting-Story.
Waehle Portkey, wenn: Dein Hauptbedarf ein Gateway ist (Routing, Fallback, virtuelle Keys) und Observability das Nebenprodukt, das du gratis mitnehmen willst. Den vollen Vergleich gibt es in Grepture vs. Portkey.
6. Grepture
Offenlegung: Das sind wir. Grepture startete als inhaltssensitives AI Gateway mit PII-Redaktion und hat auf volle Observability erweitert. Wir sind konkret beim Fit, damit du keine Zeit mit uns verschwendest, wenn wir nicht passen.
Architektur: Beides. Proxy fuer Vollabdeckung ohne Code-Aenderungen, plus ein latenzfreier Trace-Modus, in dem das SDK asynchron loggt und Requests direkt zum Provider gehen. Die Begruendung der dualen Architektur steht in Trace Mode: volle Observability ohne Proxy-Hop.
Staerken: Observability + AI Gateway + PII-Redaktion in einem. Multi-Provider-Routing und Fallback. Prompt-Management mit Versionierung. Evals auf echtem Production-Traffic. EU-gehostete Option mit DSGVO-konformen Defaults.
Schwaechen: Kleinerer Eval-Workflow als Braintrust (wir koennen Production-Evals gut, nicht experimentlastige Iteration). Juengeres Produkt als Langfuse. Nicht die richtige Wahl, wenn du nur Tracing brauchst und null Interesse an Gateway-Features hast.
Waehle Grepture, wenn: Du Observability, PII-Handling, Cost-Tracking und Multi-Provider-Routing aus einem Tool willst, besonders als EU-Team oder mit Compliance-Anforderungen.
Die Tools, die nicht mehr auf die Shortlist gehoeren
Helicone
Helicone war das klarste Beispiel fuer "Observability als Proxy": Base-URL aendern, Logging, Cost-Tracking und Caching bekommen. Es war ein gutes Produkt, deshalb existiert dieser Abschnitt. Nach der Mintlify-Uebernahme im Maerz 2026 ist es im Maintenance-Modus. Bestehende Deployments laufen weiter und der Open-Source-Code bleibt verfuegbar, aber die Feature-Entwicklung ist gestoppt und der Horizont fuer Security-Updates unklar.
Wenn du Helicone heute betreibst, brennt nichts an, aber plane eine Migration, statt die Integration zu vertiefen. Weil Helicone proxy-basiert war, ist der Wechsel zu einem anderen proxy-basierten Tool der Weg mit dem geringsten Aufwand: derselbe Base-URL-Tausch wie bei der Einfuehrung. Wir haben einen Helicone-Alternative-Guide mit den Migrationsdetails geschrieben.
Humanloop
Humanloop war in der ersten Version dieses Posts die Prompt-Management-first-Option. Die Plattform wurde im September 2025 nach dem Wechsel des Teams zu Anthropic eingestellt und nimmt keine Kunden mehr an. Wenn du wegen Prompt-Versionierung, Deployment und Zusammenarbeit mit Nicht-Entwicklern hier bist: Diesen Job decken heute Langfuse, Braintrust und Grepture ab, oder dedizierte Prompt-Management-Tools. Unsere Sicht auf den Workflow steht in Prompt-Management und Versionskontrolle fuer LLMs.
Der direkte Vergleich
Nur aktive Tools:
| Tool | Architektur | Open Source | Evals | Gateway-Features | Cost-Tracking | Am besten fuer |
|---|---|---|---|---|---|---|
| Langfuse | SDK | Ja (MIT) | Stark | Nein | Gut | Open-Source-Tracing |
| Arize | SDK (OTel) | Teilweise (Phoenix) | Stark | Nein | Gut | Enterprise ML + LLM |
| Braintrust | SDK | Nein | Klassenbester | Nein | Basis | Eval-lastige Workflows |
| LangSmith | SDK | Nein | Stark | Nein | Gut | LangChain-Nutzer |
| Portkey | Proxy | Teilweise (Gateway) | Basis | Voll | Stark | Gateway-first-Teams |
| Grepture | Proxy + SDK | Nein | Production-fokussiert | Voll | Stark | Obs + Gateway + PII |
Wie du entscheidest
Die Kategorie ist fragmentiert, weil Teams wirklich unterschiedliche Beduerfnisse haben. Ein brauchbarer Trichter:
Starte mit deiner Integrations-Beschraenkung. Wenn du nicht jeden Service anfassen kannst, brauchst du einen Proxy. Nach der Konsolidierung heisst die Shortlist Portkey oder Grepture. Wenn du instrumentieren kannst, oeffnet sich der Rest.
Dann filtere auf Evals vs. Monitoring. Iteriert dein Team taeglich an Prompts mit strukturierten Experimenten, liegt Braintrust vorn. Beobachtest du hauptsaechlich Produktion, passen Langfuse, LangSmith oder Grepture besser.
Dann Compliance. Brauchst du Self-Hosting oder EU-Datenresidenz, ist die Shortlist Langfuse, Phoenix (Arize) oder Greptures EU-Deployment. Der Rest ist Cloud-only oder standardmaessig US-gehostet.
Dann die Trajektorie des Anbieters. Finanzierung oder tragfaehiger Eigentuemer, sichtbares Shipping in den letzten zwei Quartalen, und eine plausible Antwort auf "Was passiert mit meinen Daten und meiner Integration, wenn das Produkt stoppt?" Vor achtzehn Monaten hatte diese Liste zwei glaubwuerdige Eintraege mehr als heute.
Zuletzt: Scope Creep. Reine Observability-Tools expandieren mit der Zeit in Prompt-Management, Evals und Routing. Wenn du weisst, dass du das brauchst, nimm ein Tool, das es schon hat, statt vier Produkte zusammenzustecken.
Wie Grepture hilft
Wenn du bis hier gelesen hast und wirklich nur Observability brauchst, ist ein reines Tracing-Tool wahrscheinlich die richtige Wahl. Langfuse ist der Default fuer Open Source; Braintrust fuer den besten Eval-Workflow.
Grepture ergibt Sinn, wenn du mehr als Tracing brauchst: ein AI Gateway fuer Multi-Provider-Routing und Fallback, inhaltssensitives PII-Redigieren, bevor Requests deine Infrastruktur verlassen, oder einheitliches Cost-Tracking ueber Provider hinweg. Der Trace-Modus liefert volle Observability ohne Proxy-Latenz, und du schaltest auf vollen Gateway-Modus, wenn du Routing oder Redaktion brauchst.
Fuer EU-Teams sind die DSGVO-konformen Defaults und das EU-Hosting meist der entscheidende Faktor. Die meisten Tools auf dieser Liste sind US-gehostet und loggen standardmaessig komplette Prompt/Completion-Paare, was eine DSFA-Baustelle schafft.