INCOGNITO VPS
Actualizado August 8, 2026

Alojamiento de inferencia de IA

Respuesta

La inferencia de IA autoalojada significa ejecutar modelos de pesos abiertos en hardware GPU que alquilas en lugar de llamar a una API alojada. Incognito VPS proporciona servidores RTX 4090, RTX 5090, A100 y H100 con CUDA 13 y PyTorch preinstalados, transferencia sin medir y sin registro de lo que ejecutas.

Resource guidance for Alojamiento de inferencia de IA
Escenario Mínimo
7–8B, 4 bits 1 × RTX 4090 (24 GB)
13–14B, 8 bits 1 × RTX 5090 (32 GB)
32–34B, 4 bits 1 × RTX 5090 (32 GB)
70B, 4 bits 1 × H100 (80 GB)
70B precisión completa 4 × H100 (320 GB)

Cuándo el autoalojamiento supera a una API

Las API alojadas son más baratas por token hasta que no lo son. El punto de equilibrio es aproximadamente el uso continuo: si una GPU está ocupada la mayor parte del día, un alquiler mensual cuesta menos que el gasto equivalente en API, y la brecha se amplía a medida que crece el volumen.

Las otras razones son estructurales más que económicas. Tus avisos no salen de tu servidor. No hay política de contenido aplicada a tus solicitudes. No hay límite de velocidad, ni desaprobación del modelo contra el que construiste, ni un proveedor que decida que tu caso de uso ya no es bienvenido. Para algunos trabajos, esto importa más que el precio.

La VRAM es la única especificación que importa al principio

El tamaño del modelo en parámetros multiplicado por los bytes por parámetro te da el mínimo, y necesitas espacio adicional para la caché KV, que crece con la longitud del contexto y el tamaño del lote. Un modelo de 7B cuantizado en 4 bits ocupa unos 4 GB; un 70B en 4 bits unos 40 GB.

El mapeo práctico: 24 GB ejecutan 7B a 13B cómodamente. 32 GB alcanza 32B en 4 bits. 80 GB ejecuta 70B en 4 bits con contexto generoso. Más allá de eso necesitas varias tarjetas y paralelismo de tensores.

La pila de software

vLLM es el valor predeterminado correcto para servir: el batching continuo y PagedAttention le dan una gran ventaja de rendimiento sobre implementaciones ingenuas, y habla el formato de API de OpenAI, por lo que la mayoría del código de cliente funciona sin modificaciones. Ollama es más simple si estás experimentando y no necesitas rendimiento. TGI y SGLang merecen un vistazo para cargas de trabajo específicas.

Todos están a un comando de distancia en nuestras imágenes, que vienen con CUDA 13, cuDNN 9 y PyTorch 2.6 ya instalados.

FAQ

Preguntas frecuentes

01 ¿Qué GPU para un modelo de 70B?

Un solo H100 con 80 GB ejecuta 70B en cuantización de 4 bits con contexto generoso. La precisión completa necesita alrededor de 140 GB, por lo que cuatro H100 detrás de NVLink.

02 ¿Registran lo que ejecuto?

No. No hay inspección de cargas de trabajo de GPU, ni registro de avisos, ni política de contenido aplicada a la computación. Nuestra AUP rige lo que distribuyes desde el servidor, no lo que calculas en él.

03 ¿La GPU se comparte con otros clientes?

No. La tarjeta física se pasa directamente y está dedicada a tu VM durante el plazo: sin división de tiempo, sin partición MIG, VRAM completa y rendimiento completo.

04 ¿Puedo ajustar, no solo inferir?

Sí. El ajuste fino LoRA de un modelo de 7B cabe cómodamente en una 4090. Los ajustes finos completos de modelos más grandes quieren un A100 o H100. La transferencia sin medir significa que mover conjuntos de datos y puntos de control no cuesta nada.

Relacionado

Despliegue en 55 segundos

Paga con cripto. Activo en un minuto.

Sin cuenta que crear, sin correo que confirmar, sin tarjeta que introducir.