Bijgewerkt August 8, 2026

AI inference hosting

Antwoord

Self-hosted AI-inferentie betekent het draaien van open-weight-modellen op GPU-hardware die u huurt in plaats van het aanroepen van een gehoste API. Incognito VPS biedt RTX 4090, RTX 5090, A100 en H100 servers met CUDA 13 en PyTorch vooraf geïnstalleerd, onbeperkt dataverkeer en geen logging van wat u draait.

Resource guidance for AI inference hosting
Scenario Minimum
7–8B, 4-bit 1 × RTX 4090 (24 GB)
13–14B, 8-bit 1 × RTX 5090 (32 GB)
32–34B, 4-bit 1 × RTX 5090 (32 GB)
70B, 4-bit 1 × H100 (80 GB)
70B full precision 4 × H100 (320 GB)

Wanneer self-hosting beter is dan een API

Gehoste API's zijn goedkoper per token totdat ze dat niet meer zijn. Het omslagpunt is ongeveer continu gebruik: als een GPU het grootste deel van de dag bezig is, kost een maandelijkse huur minder dan de equivalente API-uitgaven, en de kloof wordt groter naarmate het volume groeit.

De andere redenen zijn structureel in plaats van economisch. Uw prompts verlaten uw server niet. Er is geen inhoudsbeleid dat op uw verzoeken wordt toegepast. Er is geen limiet, geen veroudering van het model waartegen u hebt gebouwd, en geen provider die beslist dat uw gebruik niet langer welkom is. Voor sommige werkzaamheden wegen deze zwaarder dan de prijs.

VRAM is de enige specificatie die er in eerste instantie toe doet

Modelgrootte in parameters maal bytes per parameter geeft u het minimum, en u hebt extra ruimte nodig voor de KV-cache, die groeit met de contextlengte en batchgrootte. Een 4-bit gekwantiseerd 7B-model is ongeveer 4 GB; een 4-bit 70B is ongeveer 40 GB.

De praktische mapping: 24 GB draait 7B tot 13B comfortabel. 32 GB bereikt 32B op 4-bit. 80 GB draait 70B op 4-bit met royale context. Daarboven hebt u meerdere kaarten en tensor-parallelisme nodig.

The software stack

vLLM is de juiste standaard voor serving — continuous batching en PagedAttention geven het een groot doorvoervoordeel ten opzichte van naïeve implementaties, en het spreekt het OpenAI API-formaat, zodat de meeste clientcode ongewijzigd werkt. Ollama is eenvoudiger als u experimenteert en geen doorvoer nodig hebt. TGI en SGLang zijn beide de moeite waard voor specifieke workloads.

Ze zijn allemaal een commando verwijderd op onze images, die worden geleverd met CUDA 13, cuDNN 9 en PyTorch 2.6 al geïnstalleerd.

FAQ

Veelgestelde vragen

01 Welke GPU voor een 70B-model?

Een enkele H100 met 80 GB draait 70B op 4-bit kwantisering met royale context. Volledige precisie vereist ongeveer 140 GB, dus vier H100's achter NVLink.

02 Logt u wat ik draai?

Nee. Er is geen inspectie van GPU-workloads, geen prompt-logging en geen inhoudsbeleid dat op berekening wordt toegepast. Onze AUP heeft betrekking op wat u vanaf de server verspreidt, niet op wat u erop berekent.

03 Wordt de GPU gedeeld met andere klanten?

Nee. De fysieke kaart wordt doorgeschakeld en toegewezen aan uw VM voor de termijn — geen time-slicing, geen MIG-partitionering, volledige VRAM en volledige doorvoer.

04 Kan ik fine-tunen, niet alleen infereren?

Ja. LoRA-finetuning van een 7B-model past comfortabel op een 4090. Volledige finetuning van grotere modellen vereist een A100 of H100. Onbeperkte dataoverdracht betekent dat het verplaatsen van datasets en checkpoints niets kost.

Gerelateerd

In 55 seconden geïmplementeerd

Kies een rechtsgebied. Betaal in crypto. Binnen een minuut actief.

Geen account om te maken, geen e-mail om te bevestigen, geen kaart om in te voeren.