Hosting inferensi AI
Jawaban
Inferensi AI yang di-host sendiri berarti menjalankan model bobot terbuka di perangkat GPU yang Anda sewa, bukan memanggil API yang di-host. Incognito VPS menyediakan server RTX 4090, RTX 5090, A100, dan H100 dengan CUDA 13 dan PyTorch terinstal, transfer tanpa batas, dan tanpa pencatatan apa yang Anda jalankan.
| Skenario | Minimum |
|---|---|
| 7–8B, 4-bit | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-bit | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-bit | 1 × RTX 5090 (32 GB) |
| 70B, 4-bit | 1 × H100 (80 GB) |
| 70B presisi penuh | 4 × H100 (320 GB) |
Kapan hosting sendiri mengungguli API
API yang di-host lebih murah per token sampai tidak lagi. Titik peralihan kira-kira pada penggunaan terus-menerus: jika GPU sibuk hampir sepanjang hari, sewa bulanan lebih murah daripada pengeluaran API yang setara, dan selisihnya melebar seiring volume bertambah.
Alasan lain bersifat struktural daripada ekonomi. Prompt Anda tidak meninggalkan server Anda. Tidak ada kebijakan konten yang diterapkan pada permintaan Anda. Tidak ada batas kecepatan, tidak ada penghentian model yang Anda gunakan, dan tidak ada penyedia yang memutuskan kasus penggunaan Anda tidak lagi diterima. Untuk beberapa pekerjaan, ini lebih penting daripada harga.
VRAM adalah satu-satunya spesifikasi yang penting pada awalnya
Ukuran model dalam parameter dikali byte per parameter memberi Anda dasar, dan Anda perlu ruang di atasnya untuk cache KV, yang tumbuh dengan panjang konteks dan ukuran batch. Model 7B terkuantisasi 4-bit sekitar 4 GB; 70B 4-bit sekitar 40 GB.
Pemetaan praktis: 24 GB menjalankan 7B hingga 13B dengan nyaman. 32 GB mencapai 32B pada 4-bit. 80 GB menjalankan 70B pada 4-bit dengan konteks luas. Di luar itu, Anda memerlukan beberapa kartu dan paralelisme tensor.
Tumpukan perangkat lunak
vLLM adalah default yang tepat untuk serving — continuous batching dan PagedAttention memberinya keunggulan throughput besar dibandingkan implementasi naif, dan mendukung format API OpenAI sehingga sebagian besar kode klien berfungsi tanpa modifikasi. Ollama lebih sederhana jika Anda bereksperimen dan tidak membutuhkan throughput. TGI dan SGLang keduanya layak dipertimbangkan untuk beban kerja tertentu.
Semuanya satu perintah dari image kami, yang sudah dilengkapi CUDA 13, cuDNN 9, dan PyTorch 2.6.
Pertanyaan yang sering diajukan
01 GPU mana untuk model 70B?
Satu H100 dengan 80 GB menjalankan 70B pada kuantisasi 4-bit dengan konteks luas. Presisi penuh membutuhkan sekitar 140 GB, jadi empat H100 di belakang NVLink.
02 Apakah Anda mencatat apa yang saya jalankan?
Tidak. Tidak ada pemeriksaan beban kerja GPU, tidak ada pencatatan prompt, dan tidak ada kebijakan konten yang diterapkan pada komputasi. AUP kami mengatur apa yang Anda distribusikan dari server, bukan apa yang Anda hitung di dalamnya.
03 Apakah GPU dibagi dengan pelanggan lain?
Tidak. Kartu fisik diberikan secara langsung dan didedikasikan untuk VM Anda selama masa sewa — tanpa pembagian waktu, tanpa partisi MIG, VRAM penuh dan throughput penuh.
04 Bisakah saya melakukan fine-tuning, bukan hanya inferensi?
Ya. Fine-tuning LoRA dari model 7B muat dengan nyaman di 4090. Fine-tuning penuh model yang lebih besar membutuhkan A100 atau H100. Transfer tanpa batas berarti memindahkan dataset masuk dan checkpoint keluar tanpa biaya.
Terkait