Hosting AI inference
Odpowiedź
Self-hosted AI inference oznacza uruchamianie modeli open-weight na sprzęcie GPU, który wynajmujesz, zamiast wywoływania hostowanego API. Incognito VPS dostarcza serwery RTX 4090, RTX 5090, A100 i H100 z CUDA 13 i PyTorch preinstalowanymi, nieograniczonym transferem i bez logowania tego, co uruchamiasz.
| Scenariusz | Minimum |
|---|---|
| 7–8B, 4-bit | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-bit | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-bit | 1 × RTX 5090 (32 GB) |
| 70B, 4-bit | 1 × H100 (80 GB) |
| 70B full precision | 4 × H100 (320 GB) |
Kiedy self-hosting bije API
Hostowane API są tańsze za token, dopóki nie przestaną być. Przecięcie wypada mniej więcej przy ciągłym użytkowaniu: jeśli GPU jest zajęte przez większość dnia, miesięczny wynajem kosztuje mniej niż równoważne wydatki na API, a różnica rośnie wraz ze wzrostem wolumenu.
Inne powody są strukturalne, a nie ekonomiczne. Twoje prompty nie opuszczają serwera. Nie ma polityki treści zastosowanej do żądań. Nie ma limitu szybkości, nie ma wycofania modelu, na którym zbudowałeś aplikację, i nie ma dostawcy decydującego, że Twój przypadek użycia nie jest już mile widziany. Dla niektórych prac to ważniejsze niż cena.
VRAM to jedyna specyfikacja, która się liczy na początku
Rozmiar modelu w parametrach razy bajty na parametr daje minimum, a do tego potrzebujesz zapasu na KV cache, który rośnie z długością kontekstu i rozmiarem partii. Model 7B w kwantyzacji 4-bit to około 4 GB; 70B w 4-bit to około 40 GB.
Praktyczne mapowanie: 24 GB wygodnie uruchamia 7B do 13B. 32 GB sięga 32B w 4-bit. 80 GB uruchamia 70B w 4-bit z dużym kontekstem. Poza tym potrzebujesz wielu kart i równoległości tensorowej.
Stos oprogramowania
vLLM to właściwy domyślny wybór do serwowania — ciągłe przetwarzanie wsadowe i PagedAttention dają mu znaczną przewagę przepustowości nad prostymi implementacjami, i mówi w formacie OpenAI API, więc większość kodu klienckiego działa bez zmian. Ollama jest prostszy, jeśli eksperymentujesz i nie potrzebujesz przepustowości. TGI i SGLang są warte uwagi dla konkretnych obciążeń.
Wszystkie są jedno polecenie od Ciebie na naszych obrazach, które mają preinstalowane CUDA 13, cuDNN 9 i PyTorch 2.6.
Często zadawane pytania
01 Który GPU dla modelu 70B?
Pojedynczy H100 z 80 GB uruchamia 70B w kwantyzacji 4-bit z dużym kontekstem. Pełna precyzja potrzebuje około 140 GB, więc cztery H100 za NVLink.
02 Czy logujecie to, co uruchamiam?
Nie. Nie ma inspekcji obciążeń GPU, logowania promptów ani polityki treści zastosowanej do obliczeń. Nasz AUP reguluje to, co dystrybuujesz z serwera, a nie to, co na nim obliczasz.
03 Czy GPU jest współdzielone z innymi klientami?
Nie. Fizyczna karta jest przekazywana i dedykowana Twojej maszynie wirtualnej na czas trwania umowy — bez dzielenia czasu, bez partycjonowania MIG, pełny VRAM i pełna przepustowość.
04 Czy mogę dostrajać, a nie tylko inferować?
Tak. Fine-tuning LoRA modelu 7B wygodnie mieści się na 4090. Pełny fine-tuning większych modeli wymaga A100 lub H100. Nieograniczony transfer oznacza, że przenoszenie danych wejściowych i punktów kontrolnych nic nie kosztuje.
Powiązane