# Хостинг для AI-инференса
> Самостоятельный AI-инференс — это запуск моделей с открытыми весами на арендованном GPU вместо вызова внешнего API. Incognito VPS предоставляет серверы с RTX 4090, RTX 5090, A100 и H100 с предустановленными CUDA 13 и PyTorch, безлимитным трафиком и без логирования ваших задач.
**Source:** https://incognitovps.com/ru/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

32 GB видеопамяти запускают модель 32B в 4-битном формате или 13B в полной точности с запасом на контекст. Амстердам обеспечивает низкую задержку первого токена для европейских пользователей.

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| 7–8B, 4-бит | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-бит | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-бит | 1 × RTX 5090 (32 GB) |
| 70B, 4-бит | 1 × H100 (80 GB) |
| 70B, полная точность | 4 × H100 (320 GB) |

## Когда самостоятельный хостинг выгоднее API

API-сервисы дешевле за токен, но только до определённого момента. Пересечение примерно при постоянном использовании: если GPU занят большую часть дня, месячная аренда стоит меньше, чем эквивалентные расходы на API, и разрыв растёт с объёмом.

Остальные причины структурные, а не экономические. Ваши промпты не покидают сервер. К запросам не применяется контент-политика. Нет лимитов скорости, нет устаревания используемой модели, нет провайдера, который решает, что ваш сценарий больше не приветствуется. Для некоторых задач это важнее цены.

## Сначала важна только память GPU

Размер модели в параметрах, умноженный на байты на параметр, даёт нижнюю границу, а сверху нужен запас для KV-кэша, который растёт с длиной контекста и размером батча. Модель 7B в 4-битном квантовании — примерно 4 GB; 70B в 4-бит — примерно 40 GB.

Практическое соответствие: 24 GB уверенно тянет 7B–13B. 32 GB достигает 32B в 4-бит. 80 GB запускает 70B в 4-бит с большим контекстом. Больше — нужны несколько карт и тензорный параллелизм.

## Программный стек

vLLM — правильный выбор по умолчанию для serving: непрерывный батчинг и PagedAttention дают большое преимущество в пропускной способности над наивными реализациями, а API совместим с OpenAI, так что большинство клиентского кода работает без изменений. Ollama проще для экспериментов, если не нужна пропускная способность. TGI и SGLang тоже стоит рассмотреть для специфических нагрузок.

Все они устанавливаются одной командой на наших образах, где уже стоят CUDA 13, cuDNN 9 и PyTorch 2.6.


## Часто задаваемые вопросы

### Какой GPU нужен для модели 70B?

Один H100 с 80 GB запускает 70B в 4-битном квантовании с большим контекстом. Для полной точности нужно около 140 GB, то есть четыре H100 за NVLink.

### Вы логируете то, что я запускаю?

Нет. Нет проверки нагрузки на GPU, нет логирования промптов, нет контент-политики для вычислений. Наш AUP регулирует, что вы распространяете с сервера, а не что вычисляете на нём.

### GPU используется совместно с другими клиентами?

Нет. Физическая карта выделяется целиком вашей виртуальной машине на весь срок — без разделения времени, без MIG-партиционирования, полные VRAM и пропускная способность.

### Могу ли я дообучать модели, а не только инференсить?

Да. LoRA-дообучение 7B легко помещается на 4090. Полное дообучение больших моделей требует A100 или H100. Безлимитный трафик делает загрузку наборов данных и выгрузку чекпоинтов бесплатной.


---

Incognito VPS — Офшорные VPS, bare-metal и GPU-серверы в 16 локациях, 8 из которых выбраны за их правовые свойства. Без идентификации, оплата только криптовалютой, развертывание за 55 секунд.
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt