INCOGNITO VPS
更新于 August 8, 2026

AI 推理托管

回答

自托管 AI 推理是指在租用的 GPU 硬件上运行开源权重模型,而不是调用托管 API。Incognito VPS 提供 RTX 4090、RTX 5090、A100 和 H100 服务器,预装 CUDA 13 和 PyTorch,不限流量,且不记录您运行的内容。

Resource guidance for AI 推理托管
场景 最低
7–8B, 4-bit 1 × RTX 4090 (24 GB)
13–14B, 8-bit 1 × RTX 5090 (32 GB)
32–34B, 4-bit 1 × RTX 5090 (32 GB)
70B, 4-bit 1 × H100 (80 GB)
70B 全精度 4 × H100 (320 GB)

自托管何时优于 API

托管 API 按 token 计费更便宜,直到某个临界点。临界点大约在持续使用时:如果 GPU 一天大部分时间都在忙碌,月租费用低于等效的 API 消费,而且随着用量增长差距会扩大。

其他原因是结构性的而非经济性的。您的提示不会离开服务器。您的请求不会被应用内容政策。没有速率限制,不会弃用您所依赖的模型,也没有供应商决定您的用例不再受欢迎。对于某些工作,这些比价格更重要。

显存是唯一最重要的规格

模型参数量乘以每个参数的字节数给出了下限,而您还需要额外空间用于 KV 缓存,它随上下文长度和批处理大小增长。一个 4-bit 量化的 7B 模型约 4 GB;4-bit 的 70B 约 40 GB。

实际映射:24 GB 可以轻松运行 7B 到 13B。32 GB 可以达到 4-bit 的 32B。80 GB 可以运行 4-bit 的 70B 并具有充足的上下文。再往上需要多卡和张量并行。

软件栈

vLLM 是服务的正确默认选择——连续批处理和 PagedAttention 使其吞吐量远超朴素实现,并且它兼容 OpenAI API 格式,因此大多数客户端代码无需修改即可使用。如果您只是实验且不需要吞吐量,Ollama 更简单。TGI 和 SGLang 也值得一看,适用于特定工作负载。

所有这些在我们的镜像上一键即可安装,镜像预装 CUDA 13、cuDNN 9 和 PyTorch 2.6。

FAQ

常见问题

01 70B 模型需要什么 GPU?

单块 H100 80 GB 可以运行 4-bit 量化的 70B 模型,并具有充足的上下文。全精度需要约 140 GB,所以需要四块 H100 通过 NVLink 连接。

02 你们会记录我运行的内容吗?

不会。我们不检查 GPU 工作负载,不记录提示,也不会对计算应用内容政策。我们的 AUP 管理您从服务器分发的内容,而不是您在其上计算的内容。

03 GPU 是否与其他客户共享?

不会。物理显卡被透传并专属于您的 VM,租期内不会时间切片或 MIG 分区,您拥有完整显存和吞吐量。

04 我不仅可以推理,还能微调吗?

可以。7B 模型的 LoRA 微调在 4090 上轻松完成。更大规模的模型全量微调需要 A100 或 H100。不限流量意味着传输数据集和检查点无需额外费用。

相关

55 秒部署

选择一个司法管辖区。用加密货币支付。一分钟内即可运行。

无需创建账户、确认电子邮件或输入信用卡。