AI 推論託管
回答
自架 AI 推論是指在你租用的 GPU 硬體上運行開放權重模型,而非呼叫託管的 API。Incognito VPS 提供 RTX 4090、RTX 5090、A100 和 H100 伺服器,預先安裝 CUDA 13 和 PyTorch,流量無限,且不記錄您所運行的內容。
| 情境 | 最低 |
|---|---|
| 7–8B,4-bit | 1 × RTX 4090(24 GB) |
| 13–14B,8-bit | 1 × RTX 5090(32 GB) |
| 32–34B,4-bit | 1 × RTX 5090(32 GB) |
| 70B,4-bit | 1 × H100(80 GB) |
| 70B 全精度 | 4 × H100(320 GB) |
何時自架優於 API
託管 API 每 token 較便宜,直到不再便宜。交叉點大約在持續使用:若 GPU 一天大部分時間都在忙碌,月租成本將低於同等 API 花費,且隨著用量成長差距擴大。
其他原因是結構性的而非經濟性的。您的提示詞不會離開您的伺服器。您的請求不會受到內容政策的限制。沒有速率限制、沒有您所建置模型的棄用、也沒有提供者決定您的使用案例不再受歡迎。對某些工作而言,這些比價格更重要。
VRAM 是唯一首先重要的規格
模型大小(參數數)乘以每參數位元組數即為下限,此外還需為 KV 快取留出餘裕,其隨上下文長度和批次大小成長。4-bit 量化 7B 模型約 4 GB;4-bit 70B 約 40 GB。
實際對應:24 GB 可舒適運行 7B 至 13B。32 GB 可達 4-bit 的 32B。80 GB 可運行 4-bit 的 70B 且有寬裕上下文。超過此範圍則需要多張顯示卡和張量並行。
軟體堆疊
vLLM 是服務部署的正確預設——連續批次處理和 PagedAttention 使其比單純實作有更大的吞吐量優勢,且它使用 OpenAI API 格式,因此大多數用戶端程式碼無需修改即可運作。若您正在實驗且不需要吞吐量,Ollama 更簡單。針對特定工作負載,TGI 和 SGLang 也值得一試。
所有這些在我們的映像檔中只需一個指令即可使用,映像檔已預先安裝 CUDA 13、cuDNN 9 和 PyTorch 2.6。
常見問題
01 哪張 GPU 適合 70B 模型?
單張 H100(80 GB)可運行 4-bit 量化且上下文寬裕的 70B。全精度約需 140 GB,因此需要四張 H100 並以 NVLink 連接。
02 你們會記錄我運行的內容嗎?
不會。我們不檢查 GPU 工作負載、不記錄提示詞,也不對計算套用內容政策。我們的可接受使用政策(AUP)管理您從伺服器發布的內容,而非您在伺服器上計算的內容。
03 GPU 是否與其他客戶共享?
不會。實體卡會透傳並在租期內專屬於您的 VM——無時間切片、無 MIG 分割、完整 VRAM 和完整吞吐量。
04 可以微調而不僅是推論嗎?
可以。7B 模型的 LoRA 微調可輕鬆在 4090 上進行。較大模型的完整微調需要 A100 或 H100。無限流量意味著匯入資料集和匯出檢查點不需額外費用。
相關