# Хостинг AI-інференсу
> Саморозміщений AI-інференс — це запуск моделей з відкритою вагою на орендованому GPU-обладнанні, а не виклик хмарного API. Incognito VPS надає сервери з RTX 4090, RTX 5090, A100 та H100, з попередньо встановленими CUDA 13 і PyTorch, безлімітним трафіком та без журналювання того, що ви запускаєте.
**Source:** https://incognitovps.com/uk/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

32 ГБ VRAM запускають модель 32B у 4-бітному форматі або 13B у повній точності з запасом для контексту. Амстердам забезпечує низьку затримку першого токена для європейських користувачів.

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| 7–8B, 4 біти | 1 × RTX 4090 (24 ГБ) |
| 13–14B, 8 бітів | 1 × RTX 5090 (32 ГБ) |
| 32–34B, 4 біти | 1 × RTX 5090 (32 ГБ) |
| 70B, 4 біти | 1 × H100 (80 ГБ) |
| 70B, повна точність | 4 × H100 (320 ГБ) |

## Коли саморозміщення вигідніше за API

Хмарні API дешевші за токен, поки не стають дорожчими. Переломний момент приблизно такий: при безперервному використанні, коли GPU зайнятий більшу частину дня, щомісячна оренда коштує менше, ніж еквівалентні витрати на API, і розрив зростає зі збільшенням обсягу.

Інші причини — структурні, а не економічні. Ваші запити не покидають ваш сервер. До ваших запитів не застосовується жодна політика контенту. Немає ліміту швидкості, немає зняття з підтримки моделі, під яку ви будувалися, і немає провайдера, який вирішує, що ваш сценарій більше не бажаний. Для деяких завдань це важливіше за ціну.

## На першому етапі має значення лише VRAM

Розмір моделі в параметрах, помножений на байти на параметр, дає мінімум, а зверху потрібен запас для KV-кешу, який зростає з довжиною контексту та розміром пакета. Модель 7B у 4-бітному квантуванні — це близько 4 ГБ; 70B у 4-бітному — близько 40 ГБ.

Практичне співвідношення: 24 ГБ без проблем тягне 7B–13B. 32 ГБ досягає 32B у 4-бітному форматі. 80 ГБ запускає 70B у 4-бітному з великим контекстом. Понад це потрібно кілька карт і тензорний паралелізм.

## Програмний стек

vLLM — правильний вибір за замовчуванням для обслуговування: безперервне пакетування та PagedAttention дають значну перевагу в пропускній здатності порівняно з наївними реалізаціями, і він підтримує формат OpenAI API, тому більшість клієнтського коду працює без змін. Ollama простіший, якщо ви експериментуєте і не потребуєте пропускної здатності. TGI та SGLang варто розглянути для специфічних навантажень.

Усі вони запускаються однією командою на наших образах, які вже мають CUDA 13, cuDNN 9 і PyTorch 2.6.


## Поширені запитання

### Який GPU потрібен для моделі 70B?

Один H100 з 80 ГБ запускає 70B у 4-бітному квантуванні з великим контекстом. Повна точність потребує приблизно 140 ГБ, тому чотири H100 через NVLink.

### Чи журналюєте ви те, що я запускаю?

Ні. Ми не перевіряємо GPU-навантаження, не журналюємо запити і не застосовуємо політику контенту до обчислень. Наша AUP регулює те, що ви поширюєте з сервера, а не те, що обчислюєте на ньому.

### Чи спільний GPU з іншими клієнтами?

Ні. Фізична карта передається у вашу віртуальну машину повністю і виділена їй на весь термін — без поділу часу, без MIG-розбиття, повний обсяг VRAM і повна пропускна здатність.

### Чи можна не лише інференс, а й доналаштування?

Так. LoRA-доналаштування моделі 7B легко вміщується на 4090. Повне доналаштування великих моделей потребує A100 або H100. Безлімітний трафік означає, що переміщення датасетів і чекпоінтів нічого не коштує.


---

Incognito VPS — Офшорні VPS, виділені сервери та GPU-сервери у 16 локаціях, 8 з яких обрані за їхні правові властивості. Без ідентифікації, лише крипто-оплата, розгортання за 55 секунд.
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt