Xcellerate AIG lleva su tráfico de IA a las herramientas de monitorización que ya usa: Prometheus y Grafana para métricas, cualquier almacén de trazas OpenTelemetry para trazas por petición, logs JSON de contenedor para su recolector de logs y webhooks firmados para su SIEM, SOAR o ITSM. Las alertas avisan a las personas adecuadas por correo, Slack o webhook cuando se agota un presupuesto, una clave de proveedor deja de funcionar o un guardrail bloquea un prompt.
TL;DR
- Prometheus recoge
/metrics, las trazas salen por OTLP/HTTP y los logs son JSON en stderr.- Los webhooks firmados (HMAC-SHA256) alimentan su SIEM, SOAR o ITSM. No hay conector SIEM dedicado.
- Las alertas salen por correo, Slack o webhook.
Antes de empezar
- Tiene el rol Admin en AIG. Metrics & tracing, Webhooks y Alerting son pantallas de administración.
- Prometheus llega a
https://<your-gateway>/metricsen su red interna. Ese endpoint no se enruta por el punto de entrada público. - Para trazas: un endpoint OTLP/HTTP (Tempo, Jaeger, OpenTelemetry Collector o un APM alojado), que suele acabar en
/v1/traces, más la cabecera o el token de ingesta si hace falta. - Para webhooks: un receptor HTTPS (puede ser interno) que verifique firmas HMAC. Para Slack: una URL de incoming webhook. Para alertas por correo: el correo saliente configurado en la configuración general.
Conectar su monitorización
1. Métricas para Prometheus y Grafana
Abra All screens → General settings → Metrics & tracing (Todas las pantallas → Configuración general → Métricas y trazas) y active las métricas. Puede limitar la recogida por IP o rango CIDR, por basic auth o por ambos. Añada en Prometheus un scrape job para /metrics. Importe el panel de Grafana que viene con los archivos de despliegue y pegue su dirección en Dashboard URL (URL del panel).
2. Trazas con OpenTelemetry
En la misma página, active Export traces (exportar trazas). Pegue el OTLP/HTTP endpoint y, si hace falta, un token de ingesta en Extra request headers (cabeceras adicionales). Defina Service name (nombre del servicio) y Sample (%) (muestreo). Rellene Trace link template (plantilla de enlace a la traza) con {trace_id} para que el panel de logs enlace directamente con la traza.
3. Webhooks para su SIEM, SOAR o ITSM
Vaya a All screens → Webhooks y haga clic en Add endpoint (añadir endpoint). Indique nombre y URL y marque los eventos que necesite; por defecto no hay nada suscrito. Copie el secreto de firma (se muestra una vez), pulse Test (probar) y siga Recent deliveries (entregas recientes).
4. Alertas por correo, Slack o webhook
Vaya a All screens → Alerting (alertas) y haga clic en Add a channel (añadir canal): una lista de correo, un incoming webhook de Slack o una URL. Pulse Send a test (enviar prueba). Después active una de las cinco reglas incluidas (todas desactivadas por defecto) o cree una: evento, condición opcional, throttle en minutos y canales.
5. Comprobaciones de estado para AIG autoalojado
Apunte su balanceador o su monitor de disponibilidad a /up (liveness) y /up/ready (readiness).
Qué ocurre después de conectar
- Métricas: volumen de peticiones y errores, histogramas de latencia y primer token, tokens, gasto, reintentos, rotaciones y salud de claves, peticiones en curso, profundidad de cola, aciertos de caché, estado de circuito, evaluaciones de guardrails y llamadas a herramientas. La cardinalidad de etiquetas está limitada.
- Trazas: un span por petición (modelo, proveedor, tokens, coste, clave, equipo), con spans hijos por intento al proveedor, llamada a herramienta y veredicto de guardrail. Un
traceparententrante se continúa. - Logs: una línea JSON en stderr con nodo e ID de petición.
X-Request-Idenlaza a quien llama, sus logs y el registro de peticiones de AIG. - Webhooks: un POST JSON con
X-XC-Event,X-XC-Delivery,X-XC-TimestampyX-XC-Signature: sha256=…, un HMAC-SHA256 de<timestamp>.<body>. Las entregas fallidas se reintentan con intervalos crecientes y luego pasan a Given up; entonces puede reenviarlas usted. - Los gráficos en directo están en Traffic → Observability (Tráfico → Observabilidad).
Conviene saber
- No hay conector dedicado para Splunk, Microsoft Sentinel ni Elastic. Su SIEM recibe AIG a través de estas salidas estándar.
- Los canales de alerta son correo, Slack y webhook; no hay canal de Microsoft Teams.
- Si el almacén de trazas cae, AIG descarta esos lotes y genera un evento sobre el que puede alertar. Las peticiones nunca se ralentizan.
- Rotar un secreto de webhook no tiene periodo de gracia: actualice primero el receptor. Las direcciones loopback y de metadatos de la nube siempre se rechazan como destino.
- Una regla con una condición ilegible nunca se dispara. Throttle 0 significa: en cada ocurrencia.
Solución de problemas
/metricsdevuelve 404 «metrics are disabled» (active las métricas), 403 «forbidden» (IP no permitida) o 401 «unauthorised» (revise el basic auth).- Observability muestra «Nothing sampled yet…»: compruebe que el contenedor scheduler está en marcha y que las métricas están activadas.
- Una regla muestra «No channels — nobody would be told»: añada al menos un canal.
- Un webhook se queda en Retrying o Given up: revise el receptor y use Retry.
Más información sobre observabilidad, el registro de auditoría y los registros de peticiones.
¿Quiere ver AIG en su propio Grafana y su SIEM? Hable con nosotros sobre AIG.
