
W skrócie: Xcellerate OPS stosuje teraz RAG (retrieval-augmented generation, czyli generowanie wspomagane wyszukiwaniem) na indeksie wektorowym Państwa własnej wiedzy. Baza wiedzy, playbooki, dokumentacja klientów, katalog produktów, zweryfikowane rozwiązania i kategorie zgłoszeń są zamieniane na embeddingi przez model embeddingów Mistral i przechowywane we własnej bazie danych Państwa przestrzeni roboczej. Gdy współpracownik AI czegoś szuka, OPS łączy klasyczne wyszukiwanie po słowach kluczowych z wyszukiwaniem po znaczeniu. Dzięki temu znajduje artykuł, który odpowiada na pytanie, nawet jeśli zgłoszenie używa innych słów. Tekst jest maskowany, zanim powstanie z niego embedding, dokumentacja konkretnego klienta pojawia się tylko przy pracy dla tego klienta, a wyszukiwanie po słowach kluczowych działa dalej, jeśli cokolwiek na ścieżce wektorowej zawiedzie.
Czym jest RAG?
Duży model językowy wie wiele o świecie, ale nic o Państwa klientach, Państwa drukarkach ani o obejściu, które starszy technik znalazł zeszłej wiosny. Zapytany o Państwa środowisko i tak odpowie – czasem przekonująco, a jednak błędnie.
Generowanie wspomagane wyszukiwaniem (RAG) rozwiązuje ten problem, dzieląc pracę na dwa etapy:
- Wyszukanie. Zanim model odpowie, system odnajduje w Państwa własnych treściach fragmenty najbardziej trafne dla danego pytania.
- Generowanie. Model pisze odpowiedź, opierając się na tych fragmentach jako materiale źródłowym.
To jak egzamin z otwartą książką. Model nadal sam rozumuje i pisze, ale korzysta z Państwa książki zamiast z pamięci. Odpowiedź staje się lepsza, gdy tylko zostanie znaleziona właściwa strona – i widać, która to była strona.
Czym są embeddingi i baza wektorowa?
Najtrudniejszy w RAG jest pierwszy krok: znalezienie właściwego fragmentu. Klasyczne wyszukiwanie dopasowuje słowa. Zgłoszenie „nikt na drugim piętrze nie może drukować” nie znajdzie artykułu bazy wiedzy zatytułowanego „Bufor wydruku zawiesza się po aktualizacji sterownika”, choć to dokładnie właściwe rozwiązanie.
Embeddingi rozwiązują ten problem. Model embeddingów czyta fragment tekstu i zamienia go w długą listę liczb – wektor – który oddaje znaczenie tekstu, a nie użyte w nim słowa. Teksty o tym samym trafiają w tej przestrzeni blisko siebie, nawet jeśli nie mają ani jednego wspólnego słowa. „Nie mogę drukować”, „drukarka offline u wszystkich” i „bufor wydruku zawieszony” lądują obok siebie; „zaległa faktura” ląduje daleko.
Baza wektorowa (lub indeks wektorowy) przechowuje te wektory i bardzo szybko odpowiada na jedno pytanie: które zapisane wektory są najbliżej tego jednego? Bliskość mierzy się zwykle podobieństwem kosinusowym, czyli kątem między dwoma wektorami. Zapytanie jest zamieniane na wektor tym samym modelem, a najbliższe fragmenty stają się kandydatami, które przeczyta model językowy.
Dlaczego to ważne dla service desku
- Ludzie opisują problemy własnymi słowami. Klienci piszą o objawach, technicy o rozwiązaniach. Wyszukiwanie po znaczeniu łączy jedno z drugim.
- Wiedza jest rozproszona. Artykuły bazy wiedzy, playbooki, dokumentacja poszczególnych klientów, opisy produktów i rozwiązania, które zespół już znalazł. Dzięki RAG współpracownik AI może przeczytać to wszystko dokładnie wtedy, gdy tego potrzebuje.
- Odpowiedzi oparte na źródłach można sprawdzić. Gdy odpowiedź powstaje na podstawie wskazanego artykułu lub playbooka, technik może otworzyć źródło i ją zweryfikować. Na tym polega różnica między asystentem, któremu można ufać, a takim, którego trzeba sprawdzać od zera.
- Mniej zgadywania, mniej powtarzanych pytań. Gdy AI znajdzie wcześniejsze rozwiązanie, starszy technik nie dostaje tego samego pytania trzeci raz w miesiącu.
Co wbudowaliśmy w Xcellerate OPS
Jeden indeks semantyczny na przestrzeń roboczą
OPS utrzymuje indeks semantyczny sześciu rodzajów treści:
- artykuły bazy wiedzy (foldery są pomijane);
- playbooki, razem z notatką „kiedy stosować” i procedurą;
- dokumentacja, którą prowadzą Państwo dla każdego klienta;
- produkty z katalogu, z opisem i instrukcjami dla AI;
- rozwiązania wyodrębnione z rozwiązanych zgłoszeń (rozwiązanie oznaczone przez lidera zespołu jako błędne jest pomijane);
- kategorie zgłoszeń i napisane dla nich wskazówki dla AI.
Każdy element jest dzielony na nakładające się fragmenty o długości około 800 tokenów, więc długi artykuł staje się kilkoma przeszukiwalnymi fragmentami i wygrywa ten najlepszy. Indeks znajduje się we własnej bazie danych Państwa przestrzeni roboczej, obok danych, które opisuje. Dokumentacja należąca do jednego klienta jest zwracana tylko wtedy, gdy AI pracuje dla tego klienta.
Embeddingi od Mistral
Wektory tworzy model embeddingów Mistral, mistral-embed, który generuje wektory o 1024 wymiarach. Ważne są tu dwa zabezpieczenia:
- Najpierw maskowanie. Każdy tekst, zanim opuści platformę, przechodzi przez ten sam krok maskowania co każde inne wywołanie AI w OPS. Dane osobowe, takie jak adresy e-mail, są zastępowane symbolami zastępczymi.
- Jeden model, jedna przestrzeń. Wektorów z dwóch różnych modeli nie da się porównać. Jeśli kiedykolwiek potrzebny będzie dostawca zapasowy, OPS przełączy się wyłącznie na dostawcę udostępniającego ten sam model, więc indeks nigdy się nie wymiesza.
Wyszukiwanie hybrydowe: słowa kluczowe i znaczenie razem
OPS nigdy nie polega wyłącznie na wektorach. Każde wyszukiwanie biegnie dwiema ścieżkami:
- Wyszukiwanie po słowach kluczowych w tytułach i wyodrębnionych słowach kluczowych – uruchamiane zawsze;
- Wyszukiwanie wektorowe fragmentów najbliższych pytaniu pod względem znaczenia.
Obie listy wyników są łączone metodą reciprocal rank fusion: element wysoko na którejkolwiek liście awansuje, a element wysoko na obu awansuje najbardziej. Zbyt słabe dopasowania wektorowe (podobieństwo kosinusowe poniżej 0,2) są odrzucane jako szum, a każdy dokument pojawia się raz, reprezentowany przez swój najlepszy fragment. Kod produktu czy numer błędu, który wychwytuje tylko wyszukiwanie po słowach kluczowych, nigdy nie przepada – a objaw opisany innymi słowami, który wychwytuje tylko znaczenie, również zostaje znaleziony.
Natywne wyszukiwanie wektorowe z siatką bezpieczeństwa
Tam, gdzie baza danych obsługuje natywne wyszukiwanie wektorowe, OPS z niego korzysta (odległość kosinusowa w SQL). Tam, gdzie nie, wbudowany silnik sam oblicza podobieństwo. Jeśli ścieżka natywna z jakiegokolwiek powodu zawiedzie, wyszukiwanie dla tego zapytania przełącza się na wbudowany silnik. Wyszukiwanie nigdy nie przestaje działać z powodu warstwy wektorowej.
Zawsze aktualne, nigdy nie płacą Państwo dwa razy
- Gdy ktoś zapisuje artykuł bazy wiedzy, playbook, dokument, produkt, rozwiązanie lub kategorię, OPS indeksuje go ponownie krótko po zapisie. Usunięcie elementu usuwa jego wektory.
- Ponownie przetwarzane są tylko fragmenty, których treść się zmieniła; każdy fragment ma skrót (hash) swojej treści. Identyczny tekst korzysta z istniejącego wektora, zamiast płacić za nowy.
- Wektor zapytania również trafia do pamięci podręcznej: to samo pytanie jest zamieniane na embedding tylko raz.
- Podczas importu danych nic nie trafia do kolejki; nocna synchronizacja nadrabia zaległości po imporcie.
Gdzie zespół to zauważy
- Współpracownicy AI wyszukują lepiej. Przy wyszukiwaniu w bazie wiedzy, playbookach, dokumentacji i produktach na pierwszym miejscu stawiają dopasowania semantyczne, a dopasowania po słowach kluczowych zachowują tuż za nimi.
- Powiązane treści przy zgłoszeniu. Dla kategorii zgłoszenia współpracownik AI otrzymuje treści, które Państwo z nią powiązali, rozwiązania, które wcześniej rozwiązały podobne zgłoszenia, oraz dokumenty najbliższe znaczeniowo tytułowi zgłoszenia.
- Czystsza pamięć rozwiązań. Nowe rozwiązanie niemal identyczne (podobieństwo kosinusowe 0,92 lub więcej) z rozwiązaniem już zapisanym dla tej samej kategorii jest traktowane jako to samo rozwiązanie, więc lista nie zapełnia się duplikatami.
Prawdziwy zrzut ekranu z naszego środowiska demonstracyjnego, z fikcyjnymi danymi.
Prywatność i kontrola
- Tekst jest maskowany, zanim powstanie z niego embedding, a zapisane rozwiązania zachowują symbole zastępcze.
- Indeks znajduje się we własnej bazie danych Państwa przestrzeni roboczej; dokumentacja klienta jest ograniczona do tego klienta.
- Lider zespołu może oznaczyć rozwiązanie jako błędne (wypada wtedy z indeksu) lub je usunąć; usunięcie dowolnego zindeksowanego elementu usuwa jego wektory.
- Wyłącznik awaryjny AI zatrzymuje tworzenie embeddingów razem z każdym innym wywołaniem AI.
- Centrum przejrzystości AI wymienia pamięć AI w Państwa rejestrze AI Act („przechowywana do momentu wymazania lub usunięcia; przechowywana w postaci zamaskowanej”), a Ustawienia → Pamięć AI pokazują, co zawiera pamięć. Więcej o rejestrze na naszej stronie o nadzorze nad AI.
Prawdziwy zrzut ekranu z naszego środowiska demonstracyjnego; jedna kolumna jest rozmyta.
Ile to kosztuje
Tworzenie embeddingów zużywa kredyty AI w kategorii pamięci AI, a każde wywołanie jest rejestrowane jak każde inne działanie AI. Ponieważ niezmienione fragmenty i powtarzane pytania nigdy nie są przetwarzane dwa razy, koszt zależy od tego, jak bardzo zmienia się Państwa wiedza, a nie od tego, jak często zespół wyszukuje. Strona Oversight w Centrum przejrzystości AI pokazuje, ile zaoszczędziło ponowne wykorzystanie.
Jak zacząć
Nie trzeba niczego włączać: indeksowanie startuje samo i nadąża za zmianami w treściach. Im więcej zapiszą Państwo w artykułach, playbookach i dokumentacji klientów i im więcej zgłoszeń rozwiąże zespół, tym więcej materiału mają do pracy współpracownicy AI.
Jeśli dopiero poznają Państwo Xcellerate OPS, strona o współpracownikach AI wyjaśnia, co robią współpracownicy, a nasz artykuł o tym, jak każde zamknięte zgłoszenie obniża koszt następnego, opisuje pamięć AI, której częścią jest ten indeks.



