RMM Labs
Integraties 3 min lezen 28 september 2026 Door Fred

Lokale modellen met Ollama, vLLM of een OpenAI-compatibele server in Xcellerate AIG

Draai modellen op je eigen hardware en zet ze achter dezelfde beheerde gateway als de cloudleveranciers, met budgetten, guardrails en logs.

Met Xcellerate AIG zet je modellen die je zelf draait, op een laptop, een GPU-server of een Kubernetes-cluster, achter dezelfde beheerde gateway als de cloudleveranciers. Prompts blijven in je eigen netwerk, en budgetten, guardrails en logs blijven gelden. Deze gids is voor beheerders van MSP's, kmo's en dienstverleners die AI lokaal willen houden.

Kort samengevat

  • Ollama heeft een eigen providertype; vLLM, SGLang, Triton, KServe en vergelijkbare servers gebruiken het type OpenAI-compatibel.
  • Je hebt een Basis-URL nodig die eindigt op /v1, en meestal geen sleutel.
  • Vink aan wat de server echt levert, zet de modelnamen in Allowed models en voeg je eigen prijs toe.

Voor je begint

  • Een draaiende server die AIG via het netwerk kan bereiken:
    • Ollama: de OpenAI-interface onder /v1, bijvoorbeeld http://<your-host>:11434/v1.
    • vLLM, SGLang, Triton (OpenAI-frontend) of KServe: een Basis-URL die eindigt op /v1, bijvoorbeeld http://vllm:8000/v1.
  • Is de server gestart met een API-sleutel (bijvoorbeeld vLLM met --api-key), dan heb je die sleutel nodig. Anders niets.
  • Aanrader: start vLLM of SGLang met --served-model-name <naam>, zodat de model-ID een leesbare naam is.
  • De rol Admin in AIG, of een eigen rol met het recht om providers aan te maken en te bewerken.

De lokale provider instellen

1. Kies het type

Ga naar Verbinden → Providers en klik op Een provider verbinden (of Provider toevoegen). Kies Ollama of OpenAI-compatibel.

2. Vul de Basis-URL in

Voor OpenAI-compatibel is de Basis-URL verplicht: dit type heeft geen standaardadres. Voor Ollama vul je de /v1-URL van je eigen host in.

3. Laat de sleutel leeg als de server er geen heeft

Heeft je server geen sleutel, laat het veld dan leeg. AIG stuurt dan helemaal geen Authorization-header mee.

4. Beperk wat de provider levert

Vink onder Wat deze provider levert alleen aan wat de server echt aanbiedt, bijvoorbeeld alleen chat. Andere aanvragen worden dan geweigerd voor ze AIG verlaten.

5. Modellen en prijzen

Zet de namen van de geserveerde modellen in Allowed models (toegestane modellen) op de sleutel. Voeg een prijsoverschrijving toe, per token of per aanvraag: je eigen modellen staan in geen enkele publieke prijslijst.

6. Test en schakel in

Klik op Verbinding testen en daarna op Enable provider (provider inschakelen). Aanroepers gebruiken <provider-naam>/<geserveerde-modelnaam>.

Wat er gebeurt na het koppelen

  • Ollama: chat en embeddings.
  • OpenAI-compatibel: chat, embeddings, afbeeldingen, spraak, transcriptie en rerank, voor zover je ze aanvinkt.
  • AIG is getest met vLLM, SGLang, de OpenAI-frontend van Triton en de Hugging Face-runtime van KServe. Hun foutformaten worden omgezet naar leesbare meldingen.
  • Het verkeer blijft binnen je netwerk, terwijl governance en logging gewoon van toepassing zijn.

Goed om te weten

  • Gestreamde aanvragen krijgen kostprijs nul, tenzij de aanroeper stream_options: {"include_usage": true} meestuurt.
  • Triton rapporteert geen tokengebruik. Geef Triton-modellen daarom een prijs per aanvraag. Embeddings van Triton via het KServe v2-protocol zijn niet bereikbaar.
  • vLLM op een CPU heeft --dtype float32 nodig.
  • De eigen (niet-/v1) API van Ollama wordt niet ondersteund. Gebruik altijd de /v1-URL.
  • Zonder licentie draait AIG in de gratis modus: 5 virtuele sleutels met elk 5 aanvragen per dag.

Problemen oplossen

  • This provider type has no default endpoint — a base URL is required. Vul de Basis-URL in voor het type OpenAI-compatibel.
  • No model to try. Sync the catalog first… Je eigen model staat niet in de publieke catalogus. Voeg het toe in Allowed models en maak een prijsoverschrijving aan.
  • Validatiefouten van KServe verschijnen bijvoorbeeld als Field required: body.messages.
  • Een aanvraag wordt meteen geweigerd? Dan vraagt de client een functie die je niet hebt aangevinkt. De melding noemt een provider die ze wel kan leveren.

Praat met ons over AIG

Wil je lokale en cloudmodellen onder één beheer brengen? Praat met ons over AIG. Lees ook meer over alle providers in één catalogus en AIG zelf hosten.

Veelgestelde vragen

Verlaten mijn prompts het netwerk?
Nee. Het verkeer loopt tussen AIG en je eigen server, binnen je netwerk.
Heb ik een API-sleutel nodig?
Alleen als de server met een sleutel is gestart. Anders laat je het veld leeg en stuurt AIG geen Authorization-header.
Welke servers kan ik gebruiken?
Ollama, en elke OpenAI-compatibele server zoals vLLM, SGLang, de OpenAI-frontend van Triton of KServe.
Bronnen: Verified against the Xcellerate AIG source code by the product team on 2026-09-28. Feature pages: https://rmmlabs.io/nl/contact; https://rmmlabs.io/nl/products/aig/features/providers; https://rmmlabs.io/nl/products/aig/features/self-hosted.

Klaar om tijdregistratie-compliance op te lossen?

Xcellerate OPS dekt de Belgische tijdregistratieplicht van 2027 standaard — geen extra module nodig.

Gerelateerde artikelen