Хостинг для AI-инференса
Ответ
Самостоятельный AI-инференс — это запуск моделей с открытыми весами на арендованном GPU вместо вызова внешнего API. Incognito VPS предоставляет серверы с RTX 4090, RTX 5090, A100 и H100 с предустановленными CUDA 13 и PyTorch, безлимитным трафиком и без логирования ваших задач.
| Сценарий | Минимум |
|---|---|
| 7–8B, 4-бит | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-бит | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-бит | 1 × RTX 5090 (32 GB) |
| 70B, 4-бит | 1 × H100 (80 GB) |
| 70B, полная точность | 4 × H100 (320 GB) |
Когда самостоятельный хостинг выгоднее API
API-сервисы дешевле за токен, но только до определённого момента. Пересечение примерно при постоянном использовании: если GPU занят большую часть дня, месячная аренда стоит меньше, чем эквивалентные расходы на API, и разрыв растёт с объёмом.
Остальные причины структурные, а не экономические. Ваши промпты не покидают сервер. К запросам не применяется контент-политика. Нет лимитов скорости, нет устаревания используемой модели, нет провайдера, который решает, что ваш сценарий больше не приветствуется. Для некоторых задач это важнее цены.
Сначала важна только память GPU
Размер модели в параметрах, умноженный на байты на параметр, даёт нижнюю границу, а сверху нужен запас для KV-кэша, который растёт с длиной контекста и размером батча. Модель 7B в 4-битном квантовании — примерно 4 GB; 70B в 4-бит — примерно 40 GB.
Практическое соответствие: 24 GB уверенно тянет 7B–13B. 32 GB достигает 32B в 4-бит. 80 GB запускает 70B в 4-бит с большим контекстом. Больше — нужны несколько карт и тензорный параллелизм.
Программный стек
vLLM — правильный выбор по умолчанию для serving: непрерывный батчинг и PagedAttention дают большое преимущество в пропускной способности над наивными реализациями, а API совместим с OpenAI, так что большинство клиентского кода работает без изменений. Ollama проще для экспериментов, если не нужна пропускная способность. TGI и SGLang тоже стоит рассмотреть для специфических нагрузок.
Все они устанавливаются одной командой на наших образах, где уже стоят CUDA 13, cuDNN 9 и PyTorch 2.6.
Часто задаваемые вопросы
01 Какой GPU нужен для модели 70B?
Один H100 с 80 GB запускает 70B в 4-битном квантовании с большим контекстом. Для полной точности нужно около 140 GB, то есть четыре H100 за NVLink.
02 Вы логируете то, что я запускаю?
Нет. Нет проверки нагрузки на GPU, нет логирования промптов, нет контент-политики для вычислений. Наш AUP регулирует, что вы распространяете с сервера, а не что вычисляете на нём.
03 GPU используется совместно с другими клиентами?
Нет. Физическая карта выделяется целиком вашей виртуальной машине на весь срок — без разделения времени, без MIG-партиционирования, полные VRAM и пропускная способность.
04 Могу ли я дообучать модели, а не только инференсить?
Да. LoRA-дообучение 7B легко помещается на 4090. Полное дообучение больших моделей требует A100 или H100. Безлимитный трафик делает загрузку наборов данных и выгрузку чекпоинтов бесплатной.
Похожее