RMM Labs
Intégrations 3 min de lecture 28 septembre 2026 Par Fred

Modèles locaux avec Ollama, vLLM ou un serveur compatible OpenAI dans Xcellerate AIG

Faites tourner des modèles sur votre propre matériel, derrière la même passerelle gouvernée que les fournisseurs cloud, avec budgets, garde-fous et journaux.

Avec Xcellerate AIG, vous placez les modèles que vous faites tourner vous-même, sur un portable, un serveur GPU ou un cluster Kubernetes, derrière la même passerelle gouvernée que les fournisseurs cloud. Les prompts restent dans votre réseau, et les budgets, garde-fous et journaux continuent de s'appliquer. Ce guide s'adresse aux administrateurs de MSP, de PME et d'entreprises de services qui veulent garder l'IA en local.

En bref

  • Ollama a son propre type de fournisseur ; vLLM, SGLang, Triton, KServe et les serveurs similaires utilisent le type Compatible OpenAI.
  • Il vous faut une URL de base qui se termine par /v1, et généralement aucune clé.
  • Cochez ce que le serveur fournit réellement, listez les noms de modèles dans Allowed models et ajoutez votre propre prix.

Avant de commencer

  • Un serveur en fonctionnement, joignable par AIG sur le réseau :
    • Ollama : l'interface OpenAI sous /v1, par exemple http://<your-host>:11434/v1.
    • vLLM, SGLang, Triton (frontend OpenAI) ou KServe : une URL de base qui se termine par /v1, par exemple http://vllm:8000/v1.
  • Si le serveur a été démarré avec une clé API (par exemple vLLM avec --api-key), cette clé. Sinon, rien.
  • Conseil : démarrez vLLM ou SGLang avec --served-model-name <nom>, pour que l'identifiant du modèle soit un nom lisible.
  • Le rôle Admin dans AIG, ou un rôle personnalisé autorisé à créer et modifier des fournisseurs.

Configurer le fournisseur local

1. Choisissez le type

Allez dans Connexion → Fournisseurs et cliquez sur Connecter un fournisseur (ou Ajouter un fournisseur). Choisissez Ollama ou Compatible OpenAI.

2. Renseignez l'URL de base

Pour Compatible OpenAI, l'URL de base est obligatoire : ce type n'a pas d'adresse par défaut. Pour Ollama, saisissez l'URL /v1 de votre propre hôte.

3. Laissez la clé vide si le serveur n'en a pas

Si votre serveur n'a pas de clé, laissez le champ vide. AIG n'envoie alors aucun en-tête Authorization.

4. Limitez ce que le fournisseur sert

Sous Ce que ce fournisseur sert, cochez uniquement ce que le serveur propose réellement, par exemple le chat seul. Les autres requêtes sont alors refusées avant de quitter AIG.

5. Modèles et prix

Indiquez les noms des modèles servis dans Allowed models (modèles autorisés) sur la clé. Ajoutez un tarif personnalisé, par jeton ou par requête : vos propres modèles ne figurent dans aucune grille tarifaire publique.

6. Testez et activez

Cliquez sur Tester la connexion, puis sur Enable provider (activer le fournisseur). Les appelants utilisent <nom-du-fournisseur>/<nom-du-modèle-servi>.

Ce qui se passe après la connexion

  • Ollama : chat et embeddings.
  • Compatible OpenAI : chat, embeddings, images, voix, transcription et rerank, selon ce que vous cochez.
  • AIG a été testé avec vLLM, SGLang, le frontend OpenAI de Triton et le runtime Hugging Face de KServe. Leurs formats d'erreur sont convertis en messages lisibles.
  • Le trafic reste dans votre réseau, et la gouvernance comme la journalisation s'appliquent normalement.

Bon à savoir

  • Les requêtes en streaming sont valorisées à zéro, sauf si l'appelant envoie stream_options: {"include_usage": true}.
  • Triton ne remonte pas l'utilisation des jetons. Tarifez donc les modèles Triton par requête. Les embeddings Triton via le protocole KServe v2 ne sont pas accessibles.
  • vLLM sur CPU nécessite --dtype float32.
  • L'API native d'Ollama (hors /v1) n'est pas prise en charge. Utilisez toujours l'URL /v1.
  • Sans licence, AIG fonctionne en mode gratuit : 5 clés virtuelles, 5 requêtes par clé et par jour.

Dépannage

  • This provider type has no default endpoint — a base URL is required. Renseignez l'URL de base pour le type Compatible OpenAI.
  • No model to try. Sync the catalog first… Votre modèle ne figure pas dans le catalogue public. Ajoutez-le dans Allowed models et créez un tarif personnalisé.
  • Les erreurs de validation de KServe apparaissent par exemple sous la forme Field required: body.messages.
  • Une requête est refusée immédiatement ? Le client demande une fonction que vous n'avez pas cochée. Le message indique un fournisseur capable de la servir.

Parlons d'AIG

Vous voulez réunir modèles locaux et modèles cloud sous une même gouvernance ? Parlez-nous d'AIG. Pour aller plus loin : tous les fournisseurs dans un catalogue et AIG auto-hébergé.

Questions fréquemment posées

Mes prompts quittent-ils le réseau ?
Non. Le trafic circule entre AIG et votre propre serveur, à l'intérieur de votre réseau.
Ai-je besoin d'une clé API ?
Seulement si le serveur a été démarré avec une clé. Sinon, laissez le champ vide : AIG n'envoie aucun en-tête Authorization.
Quels serveurs puis-je utiliser ?
Ollama, et tout serveur compatible OpenAI comme vLLM, SGLang, le frontend OpenAI de Triton ou KServe.
Sources: Verified against the Xcellerate AIG source code by the product team on 2026-09-28. Feature pages: https://rmmlabs.io/fr/contact; https://rmmlabs.io/fr/products/aig/features/providers; https://rmmlabs.io/fr/products/aig/features/self-hosted.

Prêt à régler la conformité de l'enregistrement du temps de travail ?

Xcellerate OPS couvre les exigences belges d'enregistrement du temps de 2027 d'origine — sans module supplémentaire.

Articles connexes