
En bref — Xcellerate OPS utilise désormais la génération augmentée par récupération (RAG) en s'appuyant sur un index vectoriel de vos propres connaissances. Votre base de connaissances, vos playbooks, votre documentation client, votre catalogue de produits, vos solutions relues et vos catégories de tickets sont transformés en embeddings par le modèle d'embedding de Mistral, puis stockés dans la base de données propre à votre espace de travail. Lorsqu'un collègue IA fait une recherche, OPS combine la recherche classique par mots-clés et la recherche par le sens : il trouve l'article qui répond à la question, même quand le ticket emploie d'autres mots. Le texte est caviardé avant d'être transformé en embedding, la documentation propre à un client n'apparaît que pour ce client, et la recherche par mots-clés continue de fonctionner si quoi que ce soit échoue du côté vectoriel.
Qu'est-ce que le RAG ?
Un grand modèle de langage en sait beaucoup sur le monde, mais rien sur vos clients, vos imprimantes ou le contournement que votre technicien senior a trouvé au printemps dernier. Posez-lui une question sur votre environnement et il répondra quand même, parfois de manière convaincante… et fausse.
La génération augmentée par récupération (RAG, pour retrieval-augmented generation) règle ce problème en scindant le travail en deux :
- Récupérer. Avant que le modèle ne réponde, le système recherche dans votre propre contenu les passages les plus pertinents pour la question.
- Générer. Le modèle rédige sa réponse en s'appuyant sur ces passages comme matière première.
Voyez cela comme un examen à livre ouvert. Le modèle continue de raisonner et de rédiger, mais il travaille à partir de votre livre plutôt que de mémoire. La réponse s'améliore dès que la bonne page est trouvée, et vous pouvez voir de quelle page il s'agit.
Que sont les embeddings et une base de données vectorielle ?
La partie difficile du RAG, c'est la première étape : trouver le bon passage. La recherche classique compare des mots. Un ticket qui dit « personne au deuxième étage ne peut imprimer » ne trouvera pas un article de base de connaissances intitulé « Le spouleur d'impression se bloque après une mise à jour du pilote », alors que c'est exactement la solution.
Les embeddings résolvent ce problème. Un modèle d'embedding lit un morceau de texte et le transforme en une longue liste de nombres, un vecteur, qui capture ce que le texte veut dire plutôt que les mots qu'il utilise. Les textes qui parlent de la même chose se retrouvent proches les uns des autres dans cet espace, même s'ils n'ont aucun mot en commun. « Impossible d'imprimer », « imprimante hors ligne pour tout le monde » et « spouleur bloqué » se retrouvent côte à côte ; « facture en retard » atterrit bien plus loin.
Une base de données vectorielle (ou index vectoriel) stocke ces vecteurs et répond très rapidement à une seule question : quels vecteurs stockés sont les plus proches de celui-ci ? La proximité se mesure généralement avec la similarité cosinus, c'est-à-dire l'angle entre deux vecteurs. La requête de recherche est transformée en vecteur avec le même modèle, et les passages les plus proches sont les candidats que le modèle de langage pourra lire.
Pourquoi c'est important pour un service desk
- Chacun décrit les problèmes avec ses propres mots. Les clients décrivent des symptômes, les techniciens notent des solutions. La recherche par le sens fait le pont entre les deux.
- Vos connaissances sont dispersées. Articles de base de connaissances, playbooks, documentation par client, notes produits et solutions que votre équipe a déjà trouvées. Le RAG permet à un collègue IA de tout lire au moment où il en a besoin.
- Des réponses ancrées sont vérifiables. Quand une réponse est construite à partir d'un article ou d'un playbook identifié, un technicien peut ouvrir la source et la vérifier. C'est toute la différence entre un assistant auquel on peut se fier et un assistant qu'il faut tout revérifier depuis le début.
- Moins de suppositions, moins de questions répétées. Quand l'IA retrouve la solution précédente, votre technicien senior ne se voit pas poser la même question pour la troisième fois du mois.
Ce que nous avons intégré à Xcellerate OPS
Un index sémantique par espace de travail
OPS tient un index sémantique de six types de contenu :
- les articles de base de connaissances (les dossiers sont ignorés) ;
- les playbooks, y compris leur note « s'applique quand » et la procédure ;
- la documentation que vous tenez par client ;
- les produits de votre catalogue, avec leur description et leurs instructions pour l'IA ;
- les solutions distillées à partir des tickets résolus (une solution qu'un chef d'équipe a marquée comme erronée est exclue) ;
- les catégories de tickets et les indications pour l'IA que vous avez rédigées pour elles.
Chaque élément est découpé en fragments qui se chevauchent, d'environ 800 tokens chacun : un long article devient ainsi plusieurs passages consultables, et c'est le meilleur passage qui l'emporte. L'index se trouve dans la base de données propre à votre espace de travail, à côté des données qu'il décrit. La documentation qui appartient à un client n'est renvoyée que lorsque l'IA travaille pour ce client.
Des embeddings signés Mistral
Les vecteurs sont produits par le modèle d'embedding de Mistral, mistral-embed, qui génère des vecteurs de 1 024 dimensions. Deux garde-fous comptent ici :
- Caviardé d'abord. Chaque texte passe par la même étape de caviardage que tous les autres appels IA dans OPS avant de quitter la plateforme. Les données personnelles, comme les adresses e-mail, sont remplacées par des marqueurs.
- Un modèle, un espace. Les vecteurs de deux modèles différents ne peuvent pas être comparés. Si un fournisseur de secours devait un jour être nécessaire, OPS ne bascule que vers un fournisseur qui propose le même modèle, de sorte que l'index n'est jamais mélangé.
Recherche hybride : mots-clés et sens réunis
OPS ne s'appuie jamais uniquement sur les vecteurs. Chaque recherche emprunte deux chemins :
- la recherche par mots-clés sur les titres et les mots-clés extraits, qui est toujours exécutée ;
- la recherche vectorielle, pour les passages dont le sens est le plus proche de la question.
Les deux listes de résultats sont fusionnées par reciprocal rank fusion (fusion par rang réciproque) : un élément bien classé dans l'une des deux listes remonte, un élément bien classé dans les deux remonte le plus. Les correspondances vectorielles trop faibles (similarité cosinus inférieure à 0,2) sont écartées comme du bruit, et chaque document n'apparaît qu'une fois, représenté par son meilleur passage. Un code produit ou un numéro d'erreur que seule la recherche par mots-clés repère n'est jamais perdu, et un symptôme reformulé que seul le sens permet de repérer est trouvé lui aussi.
Recherche vectorielle native, avec un filet de sécurité
Lorsque la base de données prend en charge la recherche vectorielle native, OPS l'utilise (distance cosinus en SQL). Dans le cas contraire, un moteur intégré calcule lui-même la similarité. Si le chemin natif échoue pour une raison quelconque, la recherche se rabat sur le moteur intégré pour cette requête. La récupération ne tombe jamais en panne à cause de la couche vectorielle.
Toujours à jour, jamais payé deux fois
- Lorsque quelqu'un enregistre un article de base de connaissances, un playbook, un document, un produit, une solution ou une catégorie, OPS le réindexe peu après l'enregistrement. Sa suppression retire ses vecteurs.
- Seuls les passages dont le contenu a changé sont à nouveau transformés en embeddings ; chaque fragment porte une empreinte (hash) de son contenu. Un texte identique réutilise un vecteur existant au lieu d'en payer un nouveau.
- Le vecteur d'une question de recherche est lui aussi mis en cache : une même question n'est transformée en embedding qu'une seule fois.
- Pendant un import de données, rien n'est mis en file d'attente ; une réconciliation nocturne rattrape le retard ensuite.
Là où votre équipe le remarque
- Les collègues IA cherchent mieux. Leurs recherches dans la base de connaissances, les playbooks, la documentation et les produits placent les correspondances sémantiques en premier, et gardent les correspondances par mots-clés juste derrière.
- Du contenu associé sur chaque ticket. Pour la catégorie du ticket, un collègue IA reçoit le contenu que vous y avez lié, les solutions qui ont résolu des tickets similaires auparavant et les documents dont le sens est le plus proche du titre du ticket.
- Une mémoire de solutions plus propre. Une nouvelle solution presque identique (similarité cosinus de 0,92 ou plus) à une solution déjà enregistrée pour la même catégorie est considérée comme la même solution : votre liste ne se remplit pas de doublons.
Capture d'écran réelle de notre environnement de démonstration, avec des données fictives.
Confidentialité et contrôle
- Le texte est caviardé avant d'être transformé en embedding, et les solutions stockées conservent les marqueurs.
- L'index se trouve dans la base de données propre à votre espace de travail ; la documentation client est limitée au client concerné.
- Un chef d'équipe peut marquer une solution comme erronée (elle quitte alors l'index) ou la supprimer ; la suppression de tout élément indexé retire ses vecteurs.
- L'interrupteur d'arrêt de l'IA stoppe les embeddings, comme tous les autres appels IA.
- L'AI Transparency Center répertorie la mémoire de l'IA dans votre registre AI Act (« Conservé jusqu'à effacement ; stocké pseudonymisé »), et Paramètres → Mémoire de l'IA montre ce que contient la mémoire. Pour en savoir plus sur le registre, consultez notre page consacrée à l'encadrement de l'IA dans Xcellerate OPS.
Capture d'écran réelle de notre environnement de démonstration ; une colonne est floutée.
Ce que cela coûte
Les embeddings consomment des crédits IA dans la catégorie Mémoire de l'IA, et chaque appel est journalisé comme n'importe quelle autre action IA. Comme les passages inchangés et les questions répétées ne sont jamais transformés deux fois en embeddings, le coût suit le rythme auquel vos connaissances évoluent, et non la fréquence des recherches de votre équipe. La page Oversight de l'AI Transparency Center montre ce que la réutilisation vous a fait économiser.
Pour commencer
Il n'y a rien à activer : l'indexation démarre d'elle-même et suit l'évolution de votre contenu. Plus vous consignez de choses dans vos articles, vos playbooks et votre documentation client, et plus vous résolvez de tickets, plus vos collègues IA ont de matière sur laquelle s'appuyer.
Si vous découvrez Xcellerate OPS, la page consacrée aux collègues IA explique ce qu'ils font, et notre article Chaque ticket que vous clôturez rend le suivant moins cher présente la mémoire de l'IA dont cet index fait partie.



