Xcellerate AIG bringt Ihren KI-Verkehr in die Monitoring-Tools, die Sie bereits betreiben: Prometheus und Grafana für Metriken, jeden OpenTelemetry-Trace-Speicher für Traces pro Anfrage, JSON-Container-Logs für Ihren Log-Shipper und signierte Webhooks für Ihr SIEM, SOAR oder ITSM. Alerting informiert die richtigen Personen per E-Mail, Slack oder Webhook, wenn ein Budget aufgebraucht ist, ein Provider-Schlüssel nicht mehr funktioniert oder eine Guardrail einen Prompt blockiert.
TL;DR
- Prometheus scrapt
/metrics, Traces gehen per OTLP/HTTP hinaus, Logs sind JSON auf stderr.- Signierte Webhooks (HMAC-SHA256) speisen Ihr SIEM, SOAR oder ITSM. Einen eigenen SIEM-Connector gibt es nicht.
- Alerts gehen per E-Mail, Slack oder Webhook hinaus.
Bevor Sie beginnen
- Sie haben in AIG die Rolle Admin. Metrics & tracing, Webhooks und Alerting sind Admin-Bildschirme.
- Prometheus erreicht
https://<your-gateway>/metricsin Ihrem internen Netz. Der Endpoint ist über den öffentlichen Einstiegspunkt nicht erreichbar. - Für Traces: ein OTLP/HTTP-Endpoint (Tempo, Jaeger, OpenTelemetry Collector oder gehostetes APM), meist mit
/v1/tracesam Ende, plus ggf. Ingest-Header oder Token. - Für Webhooks: ein HTTPS-Empfänger (intern ist in Ordnung), der HMAC-Signaturen prüft. Für Slack: eine Incoming-Webhook-URL. Für E-Mail-Alerts: ausgehende Mail in den allgemeinen Einstellungen.
Monitoring anbinden
1. Metriken für Prometheus und Grafana
Öffnen Sie All screens → General settings → Metrics & tracing (Alle Bildschirme → Allgemeine Einstellungen → Metriken und Tracing) und aktivieren Sie die Metriken. Das Scrapen lässt sich auf IP-Adressen oder CIDR-Bereiche, auf Basic Auth oder beides beschränken. Legen Sie in Prometheus einen Scrape-Job für /metrics an. Importieren Sie das Grafana-Dashboard aus den Deployment-Dateien und tragen Sie seine Adresse unter Dashboard URL (Dashboard-URL) ein.
2. Traces über OpenTelemetry
Schalten Sie auf derselben Seite Export traces (Traces exportieren) ein. Tragen Sie den OTLP/HTTP endpoint (OTLP/HTTP-Endpoint) und bei Bedarf ein Ingest-Token unter Extra request headers (zusätzliche Request-Header) ein. Setzen Sie Service name (Servicename) und Sample (%) (Stichprobe). Füllen Sie Trace link template (Vorlage für Trace-Link) mit {trace_id}, damit die Log-Ansicht direkt auf den Trace verlinkt.
3. Webhooks für SIEM, SOAR oder ITSM
Öffnen Sie All screens → Webhooks und klicken Sie auf Add endpoint (Endpoint hinzufügen). Geben Sie Name und URL an und wählen Sie die benötigten Events; standardmäßig ist nichts abonniert. Kopieren Sie das Signatur-Secret (nur einmal angezeigt), klicken Sie auf Test und verfolgen Sie Recent deliveries (letzte Zustellungen).
4. Alerts per E-Mail, Slack oder Webhook
Öffnen Sie All screens → Alerting (Benachrichtigungen) und klicken Sie auf Add a channel (Kanal hinzufügen): eine E-Mail-Liste, ein Slack-Incoming-Webhook oder eine URL. Klicken Sie auf Send a test (Test senden). Aktivieren Sie dann eine der fünf vorbereiteten Regeln (alle standardmäßig aus) oder legen Sie eine eigene an: Event, optionale Bedingung, Throttle in Minuten und Kanäle.
5. Health-Checks für selbst gehostetes AIG
Lassen Sie Ihren Load Balancer oder Ihr Uptime-Monitoring /up (Liveness) und /up/ready (Readiness) prüfen.
Was nach dem Verbinden passiert
- Metriken: Anfrage- und Fehlerraten, Histogramme für Latenz und ersten Token, Tokens, Kosten, Retries, Schlüsselrotationen und Schlüsselzustand, laufende Anfragen, Warteschlangentiefe, Cache-Trefferquote, Circuit-Status, Guardrail-Auswertungen und Tool-Aufrufe. Die Label-Kardinalität ist begrenzt.
- Traces: ein Span pro Anfrage (Modell, Provider, Tokens, Kosten, Schlüssel, Team), mit Child-Spans pro Upstream-Versuch, Tool-Aufruf und Guardrail-Urteil. Ein eingehender
traceparentwird fortgeführt. - Logs: eine JSON-Zeile auf stderr mit Knoten und Request-ID.
X-Request-Idverbindet Aufrufer, Ihre Logs und das Request-Log von AIG. - Webhooks: ein JSON-POST mit
X-XC-Event,X-XC-Delivery,X-XC-TimestampundX-XC-Signature: sha256=…, einem HMAC-SHA256 über<timestamp>.<body>. Fehlgeschlagene Zustellungen werden in wachsenden Abständen wiederholt und dann als Given up markiert; danach können Sie sie selbst erneut senden. - Live-Diagramme finden Sie unter Traffic → Observability (Datenverkehr → Beobachtbarkeit).
Gut zu wissen
- Es gibt keinen eigenen Connector für Splunk, Microsoft Sentinel oder Elastic. Ihr SIEM übernimmt AIG über diese Standardausgaben.
- Alert-Kanäle sind E-Mail, Slack und Webhook; einen Kanal für Microsoft Teams gibt es nicht.
- Ist der Trace-Speicher nicht erreichbar, verwirft AIG diese Batches und erzeugt ein Event, auf das Sie alarmieren können. Anfragen werden nie langsamer.
- Das Rotieren eines Webhook-Secrets hat keine Übergangsfrist: Aktualisieren Sie zuerst den Empfänger. Loopback- und Cloud-Metadaten-Adressen werden als Ziel immer abgelehnt.
- Eine Regel mit nicht lesbarer Bedingung löst nie aus. Throttle 0 bedeutet: bei jedem Vorkommen.
Fehlerbehebung
/metricsliefert 404 „metrics are disabled“ (Metriken einschalten), 403 „forbidden“ (IP nicht erlaubt) oder 401 „unauthorised“ (Basic Auth prüfen).- Observability zeigt „Nothing sampled yet…“: Prüfen Sie, ob der Scheduler-Container läuft und die Metriken aktiv sind.
- Eine Regel zeigt „No channels — nobody would be told“: Fügen Sie mindestens einen Kanal hinzu.
- Ein Webhook bleibt auf Retrying oder Given up: Prüfen Sie den Empfänger und nutzen Sie dann Retry.
Mehr über Observability, das Audit-Log und Request-Logs.
Sie möchten AIG in Ihrem eigenen Grafana und SIEM sehen? Sprechen Sie mit uns über AIG.
