Hosting per inferenza AI
Risposta
L'inferenza AI self-hosted significa eseguire modelli open-weight su hardware GPU che affitti anziché chiamare un'API ospitata. Incognito VPS fornisce server RTX 4090, RTX 5090, A100 e H100 con CUDA 13 e PyTorch preinstallati, trasferimento senza limiti e nessun log di ciò che esegui.
| Scenario | Minimo |
|---|---|
| 7-8B, 4-bit | 1 × RTX 4090 (24 GB) |
| 13-14B, 8-bit | 1 × RTX 5090 (32 GB) |
| 32-34B, 4-bit | 1 × RTX 5090 (32 GB) |
| 70B, 4-bit | 1 × H100 (80 GB) |
| 70B piena precisione | 4 × H100 (320 GB) |
Quando il self-hosting batte un'API
Le API ospitate sono più economiche per token finché non lo sono più. Il punto di pareggio è circa con uso continuo: se una GPU è occupata per la maggior parte del giorno, un noleggio mensile costa meno della spesa API equivalente, e il divario si allarga con il volume.
Le altre ragioni sono strutturali, non economiche. Le tue richieste non lasciano il tuo server. Non c'è una policy sui contenuti applicata alle tue richieste. Non ci sono limiti di frequenza, nessuna deprecazione del modello su cui hai costruito e nessun provider che decide che il tuo caso d'uso non è più benvenuto. Per alcuni lavori queste contano più del prezzo.
La VRAM è l'unica specifica che conta all'inizio
La dimensione del modello in parametri moltiplicata per i byte per parametro dà il minimo, e serve margine in più per la cache KV, che cresce con la lunghezza del contesto e la dimensione del batch. Un modello 7B quantizzato in 4-bit è circa 4 GB; un 70B in 4-bit è circa 40 GB.
La mappatura pratica: 24 GB eseguono 7B-13B comodamente. 32 GB arrivano a 32B in 4-bit. 80 GB eseguono 70B in 4-bit con contesto generoso. Oltre serve più schede e parallelismo tensoriale.
Lo stack software
vLLM è la scelta giusta di default per il serving — il batching continuo e PagedAttention gli danno un grande vantaggio in throughput rispetto alle implementazioni ingenue, e parla il formato API OpenAI, quindi la maggior parte del codice client funziona senza modifiche. Ollama è più semplice se stai sperimentando e non ti serve throughput. TGI e SGLang meritano uno sguardo per carichi specifici.
Tutti sono a un comando di distanza sulle nostre immagini, che includono già CUDA 13, cuDNN 9 e PyTorch 2.6.
Domande frequenti
01 Quale GPU per un modello 70B?
Una singola H100 con 80 GB esegue 70B in quantizzazione 4-bit con contesto generoso. La piena precisione richiede circa 140 GB, quindi quattro H100 dietro NVLink.
02 Registrate ciò che eseguo?
No. Non c'è ispezione dei carichi GPU, nessun log dei prompt e nessuna policy sui contenuti applicata al calcolo. La nostra AUP regola ciò che distribuisci dal server, non ciò che calcoli su di esso.
03 La GPU è condivisa con altri clienti?
No. La scheda fisica è passata attraverso e dedicata alla tua VM per la durata del contratto — nessuna suddivisione temporale, nessuna partizione MIG, piena VRAM e pieno throughput.
04 Posso fare fine-tuning, non solo inferenza?
Sì. Il fine-tuning LoRA di un modello 7B sta comodamente su una 4090. I fine-tuning completi di modelli più grandi richiedono A100 o H100. Il trasferimento senza limiti significa che spostare dataset e checkpoint non costa nulla.
Correlati