# Hosting AI inference
> Self-hosted AI inference oznacza uruchamianie modeli open-weight na sprzęcie GPU, który wynajmujesz, zamiast wywoływania hostowanego API. Incognito VPS dostarcza serwery RTX 4090, RTX 5090, A100 i H100 z CUDA 13 i PyTorch preinstalowanymi, nieograniczonym transferem i bez logowania tego, co uruchamiasz.
**Source:** https://incognitovps.com/pl/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

32 GB VRAM wystarczy do uruchomienia modelu 32B w 4-bit lub 13B w pełnej precyzji z zapasem na kontekst. Amsterdam utrzymuje niskie opóźnienia pierwszego tokenu dla użytkowników w Europie.

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| 7–8B, 4-bit | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-bit | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-bit | 1 × RTX 5090 (32 GB) |
| 70B, 4-bit | 1 × H100 (80 GB) |
| 70B full precision | 4 × H100 (320 GB) |

## Kiedy self-hosting bije API

Hostowane API są tańsze za token, dopóki nie przestaną być. Przecięcie wypada mniej więcej przy ciągłym użytkowaniu: jeśli GPU jest zajęte przez większość dnia, miesięczny wynajem kosztuje mniej niż równoważne wydatki na API, a różnica rośnie wraz ze wzrostem wolumenu.

Inne powody są strukturalne, a nie ekonomiczne. Twoje prompty nie opuszczają serwera. Nie ma polityki treści zastosowanej do żądań. Nie ma limitu szybkości, nie ma wycofania modelu, na którym zbudowałeś aplikację, i nie ma dostawcy decydującego, że Twój przypadek użycia nie jest już mile widziany. Dla niektórych prac to ważniejsze niż cena.

## VRAM to jedyna specyfikacja, która się liczy na początku

Rozmiar modelu w parametrach razy bajty na parametr daje minimum, a do tego potrzebujesz zapasu na KV cache, który rośnie z długością kontekstu i rozmiarem partii. Model 7B w kwantyzacji 4-bit to około 4 GB; 70B w 4-bit to około 40 GB.

Praktyczne mapowanie: 24 GB wygodnie uruchamia 7B do 13B. 32 GB sięga 32B w 4-bit. 80 GB uruchamia 70B w 4-bit z dużym kontekstem. Poza tym potrzebujesz wielu kart i równoległości tensorowej.

## Stos oprogramowania

vLLM to właściwy domyślny wybór do serwowania — ciągłe przetwarzanie wsadowe i PagedAttention dają mu znaczną przewagę przepustowości nad prostymi implementacjami, i mówi w formacie OpenAI API, więc większość kodu klienckiego działa bez zmian. Ollama jest prostszy, jeśli eksperymentujesz i nie potrzebujesz przepustowości. TGI i SGLang są warte uwagi dla konkretnych obciążeń.

Wszystkie są jedno polecenie od Ciebie na naszych obrazach, które mają preinstalowane CUDA 13, cuDNN 9 i PyTorch 2.6.


## Często zadawane pytania

### Który GPU dla modelu 70B?

Pojedynczy H100 z 80 GB uruchamia 70B w kwantyzacji 4-bit z dużym kontekstem. Pełna precyzja potrzebuje około 140 GB, więc cztery H100 za NVLink.

### Czy logujecie to, co uruchamiam?

Nie. Nie ma inspekcji obciążeń GPU, logowania promptów ani polityki treści zastosowanej do obliczeń. Nasz AUP reguluje to, co dystrybuujesz z serwera, a nie to, co na nim obliczasz.

### Czy GPU jest współdzielone z innymi klientami?

Nie. Fizyczna karta jest przekazywana i dedykowana Twojej maszynie wirtualnej na czas trwania umowy — bez dzielenia czasu, bez partycjonowania MIG, pełny VRAM i pełna przepustowość.

### Czy mogę dostrajać, a nie tylko inferować?

Tak. Fine-tuning LoRA modelu 7B wygodnie mieści się na 4090. Pełny fine-tuning większych modeli wymaga A100 lub H100. Nieograniczony transfer oznacza, że przenoszenie danych wejściowych i punktów kontrolnych nic nie kosztuje.


---

Incognito VPS — Offshore VPS, serwery bare-metal i GPU w 16 lokalizacjach, 8 z nich wybranych ze względu na właściwości prawne. Bez identyfikacji, płatności tylko kryptowalutą, wdrożenie w 55 sekund.
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt