INCOGNITO VPS
Обновлено August 8, 2026

Хостинг для AI-инференса

Ответ

Самостоятельный AI-инференс — это запуск моделей с открытыми весами на арендованном GPU вместо вызова внешнего API. Incognito VPS предоставляет серверы с RTX 4090, RTX 5090, A100 и H100 с предустановленными CUDA 13 и PyTorch, безлимитным трафиком и без логирования ваших задач.

Resource guidance for Хостинг для AI-инференса
Сценарий Минимум
7–8B, 4-бит 1 × RTX 4090 (24 GB)
13–14B, 8-бит 1 × RTX 5090 (32 GB)
32–34B, 4-бит 1 × RTX 5090 (32 GB)
70B, 4-бит 1 × H100 (80 GB)
70B, полная точность 4 × H100 (320 GB)

Когда самостоятельный хостинг выгоднее API

API-сервисы дешевле за токен, но только до определённого момента. Пересечение примерно при постоянном использовании: если GPU занят большую часть дня, месячная аренда стоит меньше, чем эквивалентные расходы на API, и разрыв растёт с объёмом.

Остальные причины структурные, а не экономические. Ваши промпты не покидают сервер. К запросам не применяется контент-политика. Нет лимитов скорости, нет устаревания используемой модели, нет провайдера, который решает, что ваш сценарий больше не приветствуется. Для некоторых задач это важнее цены.

Сначала важна только память GPU

Размер модели в параметрах, умноженный на байты на параметр, даёт нижнюю границу, а сверху нужен запас для KV-кэша, который растёт с длиной контекста и размером батча. Модель 7B в 4-битном квантовании — примерно 4 GB; 70B в 4-бит — примерно 40 GB.

Практическое соответствие: 24 GB уверенно тянет 7B–13B. 32 GB достигает 32B в 4-бит. 80 GB запускает 70B в 4-бит с большим контекстом. Больше — нужны несколько карт и тензорный параллелизм.

Программный стек

vLLM — правильный выбор по умолчанию для serving: непрерывный батчинг и PagedAttention дают большое преимущество в пропускной способности над наивными реализациями, а API совместим с OpenAI, так что большинство клиентского кода работает без изменений. Ollama проще для экспериментов, если не нужна пропускная способность. TGI и SGLang тоже стоит рассмотреть для специфических нагрузок.

Все они устанавливаются одной командой на наших образах, где уже стоят CUDA 13, cuDNN 9 и PyTorch 2.6.

FAQ

Часто задаваемые вопросы

01 Какой GPU нужен для модели 70B?

Один H100 с 80 GB запускает 70B в 4-битном квантовании с большим контекстом. Для полной точности нужно около 140 GB, то есть четыре H100 за NVLink.

02 Вы логируете то, что я запускаю?

Нет. Нет проверки нагрузки на GPU, нет логирования промптов, нет контент-политики для вычислений. Наш AUP регулирует, что вы распространяете с сервера, а не что вычисляете на нём.

03 GPU используется совместно с другими клиентами?

Нет. Физическая карта выделяется целиком вашей виртуальной машине на весь срок — без разделения времени, без MIG-партиционирования, полные VRAM и пропускная способность.

04 Могу ли я дообучать модели, а не только инференсить?

Да. LoRA-дообучение 7B легко помещается на 4090. Полное дообучение больших моделей требует A100 или H100. Безлимитный трафик делает загрузку наборов данных и выгрузку чекпоинтов бесплатной.

Похожее

Развёртывание за 55 секунд

Выберите юрисдикцию. Оплатите в крипте. Запуститесь в течение минуты.

Никакого аккаунта, email для подтверждения и карты.