Z Xcellerate AIG modele, które uruchamiasz sam, na laptopie, serwerze GPU lub w klastrze Kubernetes, działają za tą samą kontrolowaną bramką co dostawcy chmurowi. Prompty zostają w Twojej sieci, a budżety, zabezpieczenia i logi nadal obowiązują. Ten poradnik jest dla administratorów w MSP, małych firmach i firmach usługowych, którzy chcą trzymać AI lokalnie.
W skrócie
- Ollama ma własny typ providera; vLLM, SGLang, Triton, KServe i podobne serwery używają typu OpenAI-compatible.
- Potrzebujesz bazowego URL kończącego się na
/v1i zwykle żadnego klucza.- Zaznacz, co serwer naprawdę oferuje, wpisz nazwy modeli w Allowed models i dodaj własną cenę.
Zanim zaczniesz
- Działający serwer osiągalny dla AIG przez sieć:
- Ollama: interfejs OpenAI pod
/v1, np.http://<your-host>:11434/v1. - vLLM, SGLang, Triton (frontend OpenAI) lub KServe: bazowy URL kończący się na
/v1, np.http://vllm:8000/v1.
- Ollama: interfejs OpenAI pod
- Jeśli serwer uruchomiono z kluczem API (np. vLLM z
--api-key), ten klucz. W przeciwnym razie nic. - Zalecenie: uruchamiaj vLLM lub SGLang z
--served-model-name <nazwa>, aby ID modelu było czytelną nazwą. - Rola Admin w AIG lub własna rola z uprawnieniem do tworzenia i edycji providerów.
Konfiguracja lokalnego providera
1. Wybierz typ
Przejdź do Connect → Providers (Połącz → Providerzy) i kliknij Connect a provider (połącz providera) lub Add provider (dodaj providera). Wybierz Ollama lub OpenAI-compatible (zgodny z OpenAI).
2. Wpisz Base URL
Dla OpenAI-compatible pole Base URL (bazowy URL) jest wymagane: ten typ nie ma domyślnego adresu. Dla Ollama wpisz adres /v1 własnego hosta.
3. Zostaw klucz pusty, jeśli serwer go nie ma
Jeśli Twój serwer nie ma klucza, zostaw pole puste. AIG nie wysyła wtedy żadnego nagłówka Authorization.
4. Zawęź, co obsługuje provider
W What this provider serves (co obsługuje ten provider) zaznacz tylko to, co serwer naprawdę oferuje, np. tylko czat. Inne zapytania zostaną odrzucone, zanim opuszczą AIG.
5. Modele i ceny
Wpisz nazwy udostępnianych modeli w Allowed models (dozwolone modele) na kluczu. Dodaj własną cenę, za token lub za zapytanie: Twoich modeli nie ma w żadnym publicznym cenniku.
6. Przetestuj i włącz
Kliknij Test connection (testuj połączenie), a potem Enable provider (włącz providera). Wywołujący używają <nazwa-providera>/<nazwa-udostępnianego-modelu>.
Co dzieje się po połączeniu
- Ollama: czat i embeddings.
- OpenAI-compatible: czat, embeddings, obrazy, mowa, transkrypcja i rerank, o ile je zaznaczysz.
- AIG przetestowano z vLLM, SGLang, frontendem OpenAI Tritona i runtime Hugging Face w KServe. Ich formaty błędów są zamieniane na czytelne komunikaty.
- Ruch zostaje w Twojej sieci, a zarządzanie i logowanie działają jak zwykle.
Dobrze wiedzieć
- Strumieniowane zapytania są wyceniane na zero, chyba że wywołujący wyśle
stream_options: {"include_usage": true}. - Triton nie raportuje zużycia tokenów, więc wyceniaj modele Tritona za zapytanie. Embeddings Tritona przez protokół KServe v2 są niedostępne.
- vLLM na CPU wymaga
--dtype float32. - Natywne (spoza
/v1) API Ollama nie jest obsługiwane. Zawsze używaj adresu/v1. - Bez licencji AIG działa w trybie darmowym: 5 kluczy wirtualnych, po 5 zapytań na klucz dziennie.
Rozwiązywanie problemów
This provider type has no default endpoint — a base URL is required.Wpisz Base URL dla typu OpenAI-compatible.No model to try. Sync the catalog first…Twojego modelu nie ma w publicznym katalogu. Dodaj go w Allowed models i utwórz własną cenę.- Błędy walidacji KServe wyglądają np. tak:
Field required: body.messages. - Zapytanie od razu odrzucone? Klient prosi o funkcję, której nie zaznaczyłeś. Komunikat wskazuje providera, który ją obsługuje.
Porozmawiaj z nami o AIG
Chcesz objąć modele lokalne i chmurowe wspólnymi zasadami? Porozmawiaj z nami o AIG. Więcej o wszystkich dostawcach w jednym katalogu i AIG na własnej infrastrukturze.
