INCOGNITO VPS
Güncellendi August 8, 2026

AI inference hosting

Cevap

Kendi kendine barındırılan AI çıkarımı, barındırılan bir API çağırmak yerine açık ağırlıklı modelleri kiraladığınız GPU donanımında çalıştırmak anlamına gelir. Incognito VPS, CUDA 13 ve PyTorch önceden kurulu, ölçümsüz transfer ve ne çalıştırdığınıza dair kayıt tutmayan RTX 4090, RTX 5090, A100 ve H100 sunucuları sağlar.

Resource guidance for AI inference hosting
Senaryo Minimum
7–8B, 4-bit 1 × RTX 4090 (24 GB)
13–14B, 8-bit 1 × RTX 5090 (32 GB)
32–34B, 4-bit 1 × RTX 5090 (32 GB)
70B, 4-bit 1 × H100 (80 GB)
70B full precision 4 × H100 (320 GB)

Kendi kendine barındırmanın API'den üstün olduğu durumlar

Barındırılan API'ler belirteç başına daha ucuzdur, ta ki öyle olmayana kadar. Geçiş noktası kabaca sürekli kullanımdır: bir GPU günün çoğu saatinde meşgulse, aylık kiralama eşdeğer API harcamasından daha ucuza gelir ve hacim arttıkça fark açılır.

Diğer nedenler ekonomik olmaktan çok yapısaldır. İstemleriniz sunucunuzdan ayrılmaz. İsteklerinize uygulanan bir içerik politikası yoktur. Hız sınırı yok, üzerine inşa ettiğiniz modelin kullanımdan kaldırılması yok ve kullanım durumunuzun artık hoş karşılanmadığına karar veren bir sağlayıcı yok. Bazı işler için bunlar fiyattan daha önemlidir.

VRAM, başlangıçta önemli olan tek özelliktir

Parametre cinsinden model boyutu ile parametre başına bayt çarpımı alt sınırı verir ve üstüne bağlam uzunluğu ve toplu iş boyutuyla büyüyen KV önbelleği için ekstra alan gerekir. 4-bit nicelenmiş 7B model yaklaşık 4 GB; 4-bit 70B model yaklaşık 40 GB'dır.

Pratik eşleme: 24 GB, 7B–13B'yi rahatça çalıştırır. 32 GB, 4-bit'te 32B'ye ulaşır. 80 GB, geniş bağlamla 4-bit'te 70B çalıştırır. Ötesi için birden fazla kart ve tensör paralelliği gerekir.

The software stack

vLLM, sunum için doğru varsayılandır — sürekli toplu işleme ve PagedAttention, ona saf uygulamalara göre büyük bir verim avantajı sağlar ve OpenAI API formatını konuştuğu için çoğu istemci kodu değişmeden çalışır. Deney yapıyorsanız ve verime ihtiyacınız yoksa Ollama daha basittir. TGI ve SGLang da belirli iş yükleri için bakılmaya değerdir.

Hepsi, CUDA 13, cuDNN 9 ve PyTorch 2.6'nın önceden kurulu olduğu görüntülerimizde tek komut uzağınızda.

FAQ

Sık sorulan sorular

01 70B model için hangi GPU?

80 GB'lık tek H100, geniş bağlamla 4-bit nicelenmiş 70B'yi çalıştırır. Tam duyarlık yaklaşık 140 GB gerektirir, bu nedenle NVLink arkasında dört H100 gerekir.

02 Ne çalıştırdığımı kaydediyor musunuz?

Hayır. GPU iş yüklerinin incelemesi, istem kaydı veya hesaplamaya uygulanan bir içerik politikası yoktur. AUP'umuz sunucudan dağıttığınız şeyi yönetir, üzerinde hesapladığınız şeyi değil.

03 GPU diğer müşterilerle paylaşılıyor mu?

Hayır. Fiziksel kart geçirilir ve süre boyunca sanal makinenize özeldir — zaman dilimleme yok, MIG bölümleme yok, tam VRAM ve tam verim.

04 Sadece çıkarım değil, ince ayar da yapabilir miyim?

Evet. 7B modelin LoRA ince ayarı 4090'da rahatça sığar. Daha büyük modellerin tam ince ayarı A100 veya H100 ister. Ölçümsüz transfer, veri kümelerini içeri ve kontrol noktalarını dışarı taşımanın maliyetini ortadan kaldırır.

İlgili

55 saniyede kurulum

Bir yetki alanı seçin. Kripto ile ödeyin. Bir dakikada çalışır durumda olun.

Hesap açmak yok, e-posta doğrulamak yok, kart girmek yok.