# AI 推理托管
> 自托管 AI 推理是指在租用的 GPU 硬件上运行开源权重模型，而不是调用托管 API。Incognito VPS 提供 RTX 4090、RTX 5090、A100 和 H100 服务器，预装 CUDA 13 和 PyTorch，不限流量，且不记录您运行的内容。
**Source:** https://incognitovps.com/zh-cn/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

32 GB 显存可以运行 4-bit 的 32B 模型或全精度的 13B 模型，并留有上下文空间。阿姆斯特丹可降低欧洲用户的首字延迟。

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| 7–8B, 4-bit | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-bit | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-bit | 1 × RTX 5090 (32 GB) |
| 70B, 4-bit | 1 × H100 (80 GB) |
| 70B 全精度 | 4 × H100 (320 GB) |

## 自托管何时优于 API

托管 API 按 token 计费更便宜，直到某个临界点。临界点大约在持续使用时：如果 GPU 一天大部分时间都在忙碌，月租费用低于等效的 API 消费，而且随着用量增长差距会扩大。

其他原因是结构性的而非经济性的。您的提示不会离开服务器。您的请求不会被应用内容政策。没有速率限制，不会弃用您所依赖的模型，也没有供应商决定您的用例不再受欢迎。对于某些工作，这些比价格更重要。

## 显存是唯一最重要的规格

模型参数量乘以每个参数的字节数给出了下限，而您还需要额外空间用于 KV 缓存，它随上下文长度和批处理大小增长。一个 4-bit 量化的 7B 模型约 4 GB；4-bit 的 70B 约 40 GB。

实际映射：24 GB 可以轻松运行 7B 到 13B。32 GB 可以达到 4-bit 的 32B。80 GB 可以运行 4-bit 的 70B 并具有充足的上下文。再往上需要多卡和张量并行。

## 软件栈

vLLM 是服务的正确默认选择——连续批处理和 PagedAttention 使其吞吐量远超朴素实现，并且它兼容 OpenAI API 格式，因此大多数客户端代码无需修改即可使用。如果您只是实验且不需要吞吐量，Ollama 更简单。TGI 和 SGLang 也值得一看，适用于特定工作负载。

所有这些在我们的镜像上一键即可安装，镜像预装 CUDA 13、cuDNN 9 和 PyTorch 2.6。


## 常见问题

### 70B 模型需要什么 GPU？

单块 H100 80 GB 可以运行 4-bit 量化的 70B 模型，并具有充足的上下文。全精度需要约 140 GB，所以需要四块 H100 通过 NVLink 连接。

### 你们会记录我运行的内容吗？

不会。我们不检查 GPU 工作负载，不记录提示，也不会对计算应用内容政策。我们的 AUP 管理您从服务器分发的内容，而不是您在其上计算的内容。

### GPU 是否与其他客户共享？

不会。物理显卡被透传并专属于您的 VM，租期内不会时间切片或 MIG 分区，您拥有完整显存和吞吐量。

### 我不仅可以推理，还能微调吗？

可以。7B 模型的 LoRA 微调在 4090 上轻松完成。更大规模的模型全量微调需要 A100 或 H100。不限流量意味着传输数据集和检查点无需额外费用。


---

Incognito VPS — 离岸 VPS、裸金属和 GPU 服务器，分布于 16 个地点，其中 8 个因其法律特性而入选。无需身份验证，仅加密货币支付，55 秒部署。
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt