RMM Labs
Integrationen 3 Min. Lesezeit 28. September 2026 Von Fred

Lokale Modelle mit Ollama, vLLM oder einem OpenAI-kompatiblen Server in Xcellerate AIG

Betreiben Sie Modelle auf eigener Hardware hinter demselben kontrollierten Gateway wie die Cloud-Anbieter, mit Budgets, Guardrails und Protokollen.

Mit Xcellerate AIG stellen Sie Modelle, die Sie selbst betreiben, auf einem Laptop, einem GPU-Server oder einem Kubernetes-Cluster, hinter dasselbe kontrollierte Gateway wie die Cloud-Anbieter. Prompts bleiben in Ihrem Netzwerk, und Budgets, Guardrails und Protokolle gelten weiterhin. Diese Anleitung richtet sich an Admins in MSPs, KMU und Dienstleistungsunternehmen, die KI lokal halten wollen.

Kurz gesagt

  • Ollama hat einen eigenen Providertyp; vLLM, SGLang, Triton, KServe und ähnliche Server nutzen den Typ OpenAI-compatible.
  • Sie brauchen eine Basis-URL, die auf /v1 endet, und meist keinen Schlüssel.
  • Haken Sie an, was der Server wirklich liefert, tragen Sie die Modellnamen in Allowed models ein und legen Sie einen eigenen Preis fest.

Bevor Sie beginnen

  • Einen laufenden Server, den AIG über das Netzwerk erreicht:
    • Ollama: die OpenAI-Schnittstelle unter /v1, zum Beispiel http://<your-host>:11434/v1.
    • vLLM, SGLang, Triton (OpenAI-Frontend) oder KServe: eine Basis-URL, die auf /v1 endet, zum Beispiel http://vllm:8000/v1.
  • Wurde der Server mit einem API-Schlüssel gestartet (zum Beispiel vLLM mit --api-key), diesen Schlüssel. Sonst nichts.
  • Empfehlung: Starten Sie vLLM oder SGLang mit --served-model-name <name>, damit die Modell-ID ein lesbarer Name ist.
  • Die Rolle Admin in AIG oder eine eigene Rolle mit dem Recht, Provider anzulegen und zu bearbeiten.

Lokalen Provider einrichten

1. Typ wählen

Gehen Sie zu Connect → Providers (Verbinden → Provider) und klicken Sie auf Connect a provider (Provider verbinden) oder Add provider (Provider hinzufügen). Wählen Sie Ollama oder OpenAI-compatible (OpenAI-kompatibel).

2. Base URL eintragen

Für OpenAI-compatible ist die Base URL (Basis-URL) Pflicht: Dieser Typ hat keine Standardadresse. Für Ollama tragen Sie die /v1-URL Ihres eigenen Hosts ein.

3. Schlüssel leer lassen, wenn der Server keinen hat

Hat Ihr Server keinen Schlüssel, lassen Sie das Feld leer. AIG sendet dann überhaupt keinen Authorization-Header.

4. Leistungsumfang eingrenzen

Haken Sie unter What this provider serves (was dieser Provider liefert) nur an, was der Server wirklich anbietet, zum Beispiel nur Chat. Andere Anfragen werden dann abgelehnt, bevor sie AIG verlassen.

5. Modelle und Preise

Tragen Sie die Namen der bereitgestellten Modelle am Schlüssel unter Allowed models (erlaubte Modelle) ein. Legen Sie eine Preisüberschreibung an, pro Token oder pro Anfrage: Eigene Modelle stehen in keiner öffentlichen Preisliste.

6. Testen und aktivieren

Klicken Sie auf Test connection (Verbindung testen) und danach auf Enable provider (Provider aktivieren). Aufrufer verwenden <provider-name>/<bereitgestellter-modellname>.

Was nach dem Verbinden passiert

  • Ollama: Chat und Embeddings.
  • OpenAI-compatible: Chat, Embeddings, Bilder, Sprachausgabe, Transkription und Rerank, soweit Sie sie anhaken.
  • AIG wurde mit vLLM, SGLang, dem OpenAI-Frontend von Triton und der Hugging-Face-Runtime von KServe getestet. Deren Fehlerformate werden in lesbare Meldungen umgesetzt.
  • Der Verkehr bleibt in Ihrem Netzwerk, Governance und Protokollierung gelten wie gewohnt.

Gut zu wissen

  • Gestreamte Anfragen werden mit null bepreist, außer der Aufrufer sendet stream_options: {"include_usage": true}.
  • Triton meldet keinen Tokenverbrauch. Bepreisen Sie Triton-Modelle deshalb pro Anfrage. Triton-Embeddings über das KServe-v2-Protokoll sind nicht erreichbar.
  • vLLM auf einer CPU braucht --dtype float32.
  • Die native (nicht-/v1) API von Ollama wird nicht unterstützt. Verwenden Sie immer die /v1-URL.
  • Ohne Lizenz läuft AIG im kostenlosen Modus: 5 virtuelle Schlüssel mit je 5 Anfragen pro Tag.

Fehlerbehebung

  • This provider type has no default endpoint — a base URL is required. Tragen Sie die Base URL für den Typ OpenAI-compatible ein.
  • No model to try. Sync the catalog first… Ihr eigenes Modell steht nicht im öffentlichen Katalog. Tragen Sie es unter Allowed models ein und legen Sie eine Preisüberschreibung an.
  • Validierungsfehler von KServe erscheinen zum Beispiel als Field required: body.messages.
  • Eine Anfrage wird sofort abgelehnt? Der Client fordert eine Funktion an, die Sie nicht angehakt haben. Die Meldung nennt einen Provider, der sie liefern kann.

Sprechen Sie mit uns über AIG

Sie möchten lokale und Cloud-Modelle unter gemeinsame Regeln stellen? Sprechen Sie mit uns über AIG. Mehr dazu: alle Anbieter in einem Katalog und AIG selbst hosten.

Häufig gestellte Fragen

Verlassen meine Prompts das Netzwerk?
Nein. Der Verkehr läuft zwischen AIG und Ihrem eigenen Server, innerhalb Ihres Netzwerks.
Brauche ich einen API-Schlüssel?
Nur wenn der Server mit einem Schlüssel gestartet wurde. Sonst lassen Sie das Feld leer, und AIG sendet keinen Authorization-Header.
Welche Server kann ich nutzen?
Ollama und jeden OpenAI-kompatiblen Server wie vLLM, SGLang, das OpenAI-Frontend von Triton oder KServe.
Quellen: Verified against the Xcellerate AIG source code by the product team on 2026-09-28. Feature pages: https://rmmlabs.io/de/contact; https://rmmlabs.io/de/products/aig/features/providers; https://rmmlabs.io/de/products/aig/features/self-hosted.

Bereit, die Zeiterfassungs-Compliance zu lösen?

Xcellerate OPS deckt die belgischen Zeiterfassungsvorgaben ab 2027 standardmäßig ab — ohne zusätzliches Modul.

Verwandte Artikel