INCOGNITO VPS
Mis à jour August 8, 2026

Hébergement d'inférence IA

Réponse

L'inférence IA auto-hébergée signifie exécuter des modèles à poids ouverts sur du matériel GPU que vous louez plutôt que d'appeler une API hébergée. Incognito VPS fournit des serveurs RTX 4090, RTX 5090, A100 et H100 avec CUDA 13 et PyTorch préinstallés, transfert non mesuré et aucune journalisation de ce que vous exécutez.

Resource guidance for Hébergement d'inférence IA
Scénario Minimum
7–8B, 4 bits 1 × RTX 4090 (24 Go)
13–14B, 8 bits 1 × RTX 5090 (32 Go)
32–34B, 4 bits 1 × RTX 5090 (32 Go)
70B, 4 bits 1 × H100 (80 Go)
70B pleine précision 4 × H100 (320 Go)

Quand l'auto-hébergement bat une API

Les API hébergées sont moins chères par token jusqu'à ce qu'elles ne le soient plus. Le point de bascule est approximativement une utilisation continue : si un GPU est occupé la plupart de la journée, une location mensuelle coûte moins cher que les dépenses API équivalentes, et l'écart se creuse à mesure que le volume augmente.

Les autres raisons sont structurelles plutôt qu'économiques. Vos invitations ne quittent pas votre serveur. Aucune politique de contenu n'est appliquée à vos demandes. Il n'y a ni limite de débit, ni dépréciation du modèle sur lequel vous avez construit, ni fournisseur décidant que votre cas d'utilisation n'est plus le bienvenu. Pour certains travaux, cela compte plus que le prix.

La VRAM est la seule spécification qui compte au début

La taille du modèle en paramètres multipliée par les octets par paramètre vous donne le plancher, et vous avez besoin de marge en plus pour le cache KV, qui croît avec la longueur du contexte et la taille du lot. Un modèle 7B quantifié en 4 bits fait environ 4 Go ; un 70B en 4 bits fait environ 40 Go.

La cartographie pratique : 24 Go exécutent confortablement 7B à 13B. 32 Go atteignent 32B en 4 bits. 80 Go exécutent 70B en 4 bits avec un contexte généreux. Au-delà, vous avez besoin de plusieurs cartes et d'un parallélisme tensoriel.

La pile logicielle

vLLM est la bonne valeur par défaut pour le service — le batching continu et PagedAttention lui donnent un avantage de débit important sur les implémentations naïves, et il parle le format API OpenAI, donc la plupart des codes clients fonctionnent sans modification. Ollama est plus simple si vous expérimentez et n'avez pas besoin de débit. TGI et SGLang valent tous deux le coup d'œil pour des charges de travail spécifiques.

Tous sont à une commande sur nos images, qui sont livrées avec CUDA 13, cuDNN 9 et PyTorch 2.6 déjà installés.

FAQ

Questions fréquentes

01 Quel GPU pour un modèle 70B ?

Un seul H100 avec 80 Go exécute 70B en quantification 4 bits avec un contexte généreux. La pleine précision nécessite environ 140 Go, donc quatre H100 derrière NVLink.

02 Enregistrez-vous ce que j'exécute ?

Non. Il n'y a aucune inspection des charges de travail GPU, aucune journalisation des invitations et aucune politique de contenu appliquée au calcul. Notre AUP régit ce que vous distribuez depuis le serveur, pas ce que vous calculez dessus.

03 Le GPU est-il partagé avec d'autres clients ?

Non. La carte physique est transmise et dédiée à votre VM pour la durée du contrat — pas de découpage temporel, pas de partitionnement MIG, pleine VRAM et plein débit.

04 Puis-je affiner, pas seulement inférer ?

Oui. L'affinage LoRA d'un modèle 7B tient confortablement sur une 4090. Les affinages complets de modèles plus grands veulent un A100 ou un H100. Le transfert non mesuré signifie que le déplacement des ensembles de données et des points de contrôle ne coûte rien.

Liés

Déploiement en 55 secondes

Choisissez une juridiction. Payez en crypto. En ligne.

Aucun compte à créer, aucun e-mail à confirmer, aucune carte à saisir.