# AI 推論託管
> 自架 AI 推論是指在你租用的 GPU 硬體上運行開放權重模型，而非呼叫託管的 API。Incognito VPS 提供 RTX 4090、RTX 5090、A100 和 H100 伺服器，預先安裝 CUDA 13 和 PyTorch，流量無限，且不記錄您所運行的內容。
**Source:** https://incognitovps.com/zh-tw/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

32 GB 的 VRAM 可以 4-bit 運行 32B 模型，或以全精度運行 13B 且有上下文空間。阿姆斯特丹可為歐洲用戶降低首位元組延遲。

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| 7–8B，4-bit | 1 × RTX 4090（24 GB） |
| 13–14B，8-bit | 1 × RTX 5090（32 GB） |
| 32–34B，4-bit | 1 × RTX 5090（32 GB） |
| 70B，4-bit | 1 × H100（80 GB） |
| 70B 全精度 | 4 × H100（320 GB） |

## 何時自架優於 API

託管 API 每 token 較便宜，直到不再便宜。交叉點大約在持續使用：若 GPU 一天大部分時間都在忙碌，月租成本將低於同等 API 花費，且隨著用量成長差距擴大。

其他原因是結構性的而非經濟性的。您的提示詞不會離開您的伺服器。您的請求不會受到內容政策的限制。沒有速率限制、沒有您所建置模型的棄用、也沒有提供者決定您的使用案例不再受歡迎。對某些工作而言，這些比價格更重要。

## VRAM 是唯一首先重要的規格

模型大小（參數數）乘以每參數位元組數即為下限，此外還需為 KV 快取留出餘裕，其隨上下文長度和批次大小成長。4-bit 量化 7B 模型約 4 GB；4-bit 70B 約 40 GB。

實際對應：24 GB 可舒適運行 7B 至 13B。32 GB 可達 4-bit 的 32B。80 GB 可運行 4-bit 的 70B 且有寬裕上下文。超過此範圍則需要多張顯示卡和張量並行。

## 軟體堆疊

vLLM 是服務部署的正確預設——連續批次處理和 PagedAttention 使其比單純實作有更大的吞吐量優勢，且它使用 OpenAI API 格式，因此大多數用戶端程式碼無需修改即可運作。若您正在實驗且不需要吞吐量，Ollama 更簡單。針對特定工作負載，TGI 和 SGLang 也值得一試。

所有這些在我們的映像檔中只需一個指令即可使用，映像檔已預先安裝 CUDA 13、cuDNN 9 和 PyTorch 2.6。


## 常見問題

### 哪張 GPU 適合 70B 模型？

單張 H100（80 GB）可運行 4-bit 量化且上下文寬裕的 70B。全精度約需 140 GB，因此需要四張 H100 並以 NVLink 連接。

### 你們會記錄我運行的內容嗎？

不會。我們不檢查 GPU 工作負載、不記錄提示詞，也不對計算套用內容政策。我們的可接受使用政策（AUP）管理您從伺服器發布的內容，而非您在伺服器上計算的內容。

### GPU 是否與其他客戶共享？

不會。實體卡會透傳並在租期內專屬於您的 VM——無時間切片、無 MIG 分割、完整 VRAM 和完整吞吐量。

### 可以微調而不僅是推論嗎？

可以。7B 模型的 LoRA 微調可輕鬆在 4090 上進行。較大模型的完整微調需要 A100 或 H100。無限流量意味著匯入資料集和匯出檢查點不需額外費用。


---

Incognito VPS — 離岸 VPS、裸機與 GPU 伺服器，全球 16 個站點，其中 8 個因法律特性而獲選。無需身分、僅收加密貨幣、55 秒內部署完成。
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt