Met Xcellerate AIG zet je modellen die je zelf draait, op een laptop, een GPU-server of een Kubernetes-cluster, achter dezelfde beheerde gateway als de cloudleveranciers. Prompts blijven in je eigen netwerk, en budgetten, guardrails en logs blijven gelden. Deze gids is voor beheerders van MSP's, kmo's en dienstverleners die AI lokaal willen houden.
Kort samengevat
- Ollama heeft een eigen providertype; vLLM, SGLang, Triton, KServe en vergelijkbare servers gebruiken het type OpenAI-compatibel.
- Je hebt een Basis-URL nodig die eindigt op
/v1, en meestal geen sleutel.- Vink aan wat de server echt levert, zet de modelnamen in Allowed models en voeg je eigen prijs toe.
Voor je begint
- Een draaiende server die AIG via het netwerk kan bereiken:
- Ollama: de OpenAI-interface onder
/v1, bijvoorbeeldhttp://<your-host>:11434/v1. - vLLM, SGLang, Triton (OpenAI-frontend) of KServe: een Basis-URL die eindigt op
/v1, bijvoorbeeldhttp://vllm:8000/v1.
- Ollama: de OpenAI-interface onder
- Is de server gestart met een API-sleutel (bijvoorbeeld vLLM met
--api-key), dan heb je die sleutel nodig. Anders niets. - Aanrader: start vLLM of SGLang met
--served-model-name <naam>, zodat de model-ID een leesbare naam is. - De rol Admin in AIG, of een eigen rol met het recht om providers aan te maken en te bewerken.
De lokale provider instellen
1. Kies het type
Ga naar Verbinden → Providers en klik op Een provider verbinden (of Provider toevoegen). Kies Ollama of OpenAI-compatibel.
2. Vul de Basis-URL in
Voor OpenAI-compatibel is de Basis-URL verplicht: dit type heeft geen standaardadres. Voor Ollama vul je de /v1-URL van je eigen host in.
3. Laat de sleutel leeg als de server er geen heeft
Heeft je server geen sleutel, laat het veld dan leeg. AIG stuurt dan helemaal geen Authorization-header mee.
4. Beperk wat de provider levert
Vink onder Wat deze provider levert alleen aan wat de server echt aanbiedt, bijvoorbeeld alleen chat. Andere aanvragen worden dan geweigerd voor ze AIG verlaten.
5. Modellen en prijzen
Zet de namen van de geserveerde modellen in Allowed models (toegestane modellen) op de sleutel. Voeg een prijsoverschrijving toe, per token of per aanvraag: je eigen modellen staan in geen enkele publieke prijslijst.
6. Test en schakel in
Klik op Verbinding testen en daarna op Enable provider (provider inschakelen). Aanroepers gebruiken <provider-naam>/<geserveerde-modelnaam>.
Wat er gebeurt na het koppelen
- Ollama: chat en embeddings.
- OpenAI-compatibel: chat, embeddings, afbeeldingen, spraak, transcriptie en rerank, voor zover je ze aanvinkt.
- AIG is getest met vLLM, SGLang, de OpenAI-frontend van Triton en de Hugging Face-runtime van KServe. Hun foutformaten worden omgezet naar leesbare meldingen.
- Het verkeer blijft binnen je netwerk, terwijl governance en logging gewoon van toepassing zijn.
Goed om te weten
- Gestreamde aanvragen krijgen kostprijs nul, tenzij de aanroeper
stream_options: {"include_usage": true}meestuurt. - Triton rapporteert geen tokengebruik. Geef Triton-modellen daarom een prijs per aanvraag. Embeddings van Triton via het KServe v2-protocol zijn niet bereikbaar.
- vLLM op een CPU heeft
--dtype float32nodig. - De eigen (niet-
/v1) API van Ollama wordt niet ondersteund. Gebruik altijd de/v1-URL. - Zonder licentie draait AIG in de gratis modus: 5 virtuele sleutels met elk 5 aanvragen per dag.
Problemen oplossen
This provider type has no default endpoint — a base URL is required.Vul de Basis-URL in voor het type OpenAI-compatibel.No model to try. Sync the catalog first…Je eigen model staat niet in de publieke catalogus. Voeg het toe in Allowed models en maak een prijsoverschrijving aan.- Validatiefouten van KServe verschijnen bijvoorbeeld als
Field required: body.messages. - Een aanvraag wordt meteen geweigerd? Dan vraagt de client een functie die je niet hebt aangevinkt. De melding noemt een provider die ze wel kan leveren.
Praat met ons over AIG
Wil je lokale en cloudmodellen onder één beheer brengen? Praat met ons over AIG. Lees ook meer over alle providers in één catalogus en AIG zelf hosten.
