# Hospedagem de inferência de IA
> Inferência de IA auto-hospedada significa executar modelos de pesos abertos em hardware GPU que você aluga em vez de chamar uma API hospedada. A Incognito VPS fornece servidores RTX 4090, RTX 5090, A100 e H100 com CUDA 13 e PyTorch pré-instalados, transferência sem medição e sem registro do que você executa.
**Source:** https://incognitovps.com/pt/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

32 GB de VRAM executam um modelo de 32B em 4-bit ou um de 13B em precisão total com espaço para contexto. Amsterdã mantém a latência de primeiro token baixa para usuários europeus.

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| 7–8B, 4-bit | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-bit | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-bit | 1 × RTX 5090 (32 GB) |
| 70B, 4-bit | 1 × H100 (80 GB) |
| 70B precisão total | 4 × H100 (320 GB) |

## Quando auto-hospedar é melhor que uma API

APIs hospedadas são mais baratas por token até deixarem de ser. O ponto de equilíbrio é aproximadamente o uso contínuo: se uma GPU está ocupada a maior parte do dia, um aluguel mensal custa menos do que o gasto equivalente em API, e a diferença aumenta conforme o volume cresce.

As outras razões são estruturais, não econômicas. Seus prompts não saem do seu servidor. Não há política de conteúdo aplicada às suas solicitações. Não há limite de taxa, nem descontinuação do modelo contra o qual você desenvolveu, nem provedor decidindo que seu caso de uso não é mais bem-vindo. Para alguns trabalhos, isso importa mais do que o preço.

## VRAM é a única especificação que importa no início

O tamanho do modelo em parâmetros vezes bytes por parâmetro fornece o mínimo, e você precisa de espaço livre no topo para o KV cache, que cresce com o comprimento do contexto e o tamanho do lote. Um modelo 7B quantizado em 4-bit é cerca de 4 GB; um 70B em 4-bit é cerca de 40 GB.

O mapeamento prático: 24 GB executa 7B a 13B confortavelmente. 32 GB alcança 32B em 4-bit. 80 GB executa 70B em 4-bit com contexto generoso. Além disso, você precisa de múltiplas placas e paralelismo tensorial.

## A pilha de software

vLLM é o padrão certo para servir — batching contínuo e PagedAttention dão a ele uma grande vantagem de throughput sobre implementações ingênuas, e ele fala o formato de API da OpenAI, então a maioria dos códigos de cliente funciona sem modificação. Ollama é mais simples se você está experimentando e não precisa de throughput. TGI e SGLang também valem a pena para cargas de trabalho específicas.

Todos eles estão a um comando de distância em nossas imagens, que vêm com CUDA 13, cuDNN 9 e PyTorch 2.6 já instalados.


## Perguntas frequentes

### Qual GPU para um modelo de 70B?

Uma única H100 com 80 GB executa 70B em quantização de 4-bit com contexto generoso. Precisão total precisa de aproximadamente 140 GB, então quatro H100s atrás de NVLink.

### Vocês registram o que eu executo?

Não. Não há inspeção de cargas de trabalho GPU, nem registro de prompts, nem política de conteúdo aplicada à computação. Nosso AUP rege o que você distribui do servidor, não o que você computa nele.

### A GPU é compartilhada com outros clientes?

Não. A placa física é passada diretamente e dedicada à sua VM pelo prazo — sem divisão de tempo, sem particionamento MIG, VRAM total e throughput total.

### Posso fazer fine-tuning, não apenas inferência?

Sim. O fine-tuning LoRA de um modelo de 7B cabe confortavelmente em uma 4090. Fine-tunes completos de modelos maiores querem uma A100 ou H100. Transferência sem medição significa que mover conjuntos de dados para dentro e checkpoints para fora não custa nada.


---

Incognito VPS — VPS offshore, servidores bare-metal e GPU em 16 localidades, 8 delas escolhidas por suas propriedades legais. Sem identidade, pagamento apenas em cripto, deploy em 55 segundos.
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt