Хостинг AI-інференсу
Відповідь
Саморозміщений AI-інференс — це запуск моделей з відкритою вагою на орендованому GPU-обладнанні, а не виклик хмарного API. Incognito VPS надає сервери з RTX 4090, RTX 5090, A100 та H100, з попередньо встановленими CUDA 13 і PyTorch, безлімітним трафіком та без журналювання того, що ви запускаєте.
| Сценарій | Мінімум |
|---|---|
| 7–8B, 4 біти | 1 × RTX 4090 (24 ГБ) |
| 13–14B, 8 бітів | 1 × RTX 5090 (32 ГБ) |
| 32–34B, 4 біти | 1 × RTX 5090 (32 ГБ) |
| 70B, 4 біти | 1 × H100 (80 ГБ) |
| 70B, повна точність | 4 × H100 (320 ГБ) |
Коли саморозміщення вигідніше за API
Хмарні API дешевші за токен, поки не стають дорожчими. Переломний момент приблизно такий: при безперервному використанні, коли GPU зайнятий більшу частину дня, щомісячна оренда коштує менше, ніж еквівалентні витрати на API, і розрив зростає зі збільшенням обсягу.
Інші причини — структурні, а не економічні. Ваші запити не покидають ваш сервер. До ваших запитів не застосовується жодна політика контенту. Немає ліміту швидкості, немає зняття з підтримки моделі, під яку ви будувалися, і немає провайдера, який вирішує, що ваш сценарій більше не бажаний. Для деяких завдань це важливіше за ціну.
На першому етапі має значення лише VRAM
Розмір моделі в параметрах, помножений на байти на параметр, дає мінімум, а зверху потрібен запас для KV-кешу, який зростає з довжиною контексту та розміром пакета. Модель 7B у 4-бітному квантуванні — це близько 4 ГБ; 70B у 4-бітному — близько 40 ГБ.
Практичне співвідношення: 24 ГБ без проблем тягне 7B–13B. 32 ГБ досягає 32B у 4-бітному форматі. 80 ГБ запускає 70B у 4-бітному з великим контекстом. Понад це потрібно кілька карт і тензорний паралелізм.
Програмний стек
vLLM — правильний вибір за замовчуванням для обслуговування: безперервне пакетування та PagedAttention дають значну перевагу в пропускній здатності порівняно з наївними реалізаціями, і він підтримує формат OpenAI API, тому більшість клієнтського коду працює без змін. Ollama простіший, якщо ви експериментуєте і не потребуєте пропускної здатності. TGI та SGLang варто розглянути для специфічних навантажень.
Усі вони запускаються однією командою на наших образах, які вже мають CUDA 13, cuDNN 9 і PyTorch 2.6.
Поширені запитання
01 Який GPU потрібен для моделі 70B?
Один H100 з 80 ГБ запускає 70B у 4-бітному квантуванні з великим контекстом. Повна точність потребує приблизно 140 ГБ, тому чотири H100 через NVLink.
02 Чи журналюєте ви те, що я запускаю?
Ні. Ми не перевіряємо GPU-навантаження, не журналюємо запити і не застосовуємо політику контенту до обчислень. Наша AUP регулює те, що ви поширюєте з сервера, а не те, що обчислюєте на ньому.
03 Чи спільний GPU з іншими клієнтами?
Ні. Фізична карта передається у вашу віртуальну машину повністю і виділена їй на весь термін — без поділу часу, без MIG-розбиття, повний обсяг VRAM і повна пропускна здатність.
04 Чи можна не лише інференс, а й доналаштування?
Так. LoRA-доналаштування моделі 7B легко вміщується на 4090. Повне доналаштування великих моделей потребує A100 або H100. Безлімітний трафік означає, що переміщення датасетів і чекпоінтів нічого не коштує.
Пов'язане