# AI推論ホスティング
> セルフホストAI推論とは、オープンウェイトモデルをレンタルしたGPU上で実行し、ホスト型APIを呼び出さないことです。Incognito VPSは、CUDA 13とPyTorchがプリインストールされたRTX 4090、RTX 5090、A100、H100サーバーを提供し、アンメータード転送、実行内容のログなしを実現します。
**Source:** https://incognitovps.com/ja/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

32 GBのVRAMで、32Bモデルを4ビット精度、または13Bモデルをフル精度で、コンテキストの余裕を持って実行できます。アムステルダムは、欧州ユーザーにとってファーストトークンレイテンシを低く抑えます。

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| 7–8B、4ビット | 1 × RTX 4090 (24 GB) |
| 13–14B、8ビット | 1 × RTX 5090 (32 GB) |
| 32–34B、4ビット | 1 × RTX 5090 (32 GB) |
| 70B、4ビット | 1 × H100 (80 GB) |
| 70B フル精度 | 4 × H100 (320 GB) |

## セルフホストがAPIに勝る場合

ホスト型APIは、トークン単価が安いのはある時点までです。分岐点はほぼ継続的な使用です。GPUが1日の大半ビジーなら、月額レンタルは同等のAPI使用料より安く、ボリュームが増えるほど差は広がります。

他の理由は構造的で、経済的ではありません。プロンプトはサーバーから出ません。リクエストにコンテンツポリシーは適用されません。レート制限も、構築したモデルの非推奨化も、プロバイダーがあなたのユースケースを歓迎しなくなることもありません。仕事によっては、これらは価格よりも重要です。

## 最初に重要なのはVRAMだけ

パラメータ数×パラメータあたりのバイト数が下限で、その上にKVキャッシュのヘッドルームが必要です。コンテキスト長とバッチサイズに応じて増加します。4ビット量子化の7Bモデルは約4 GB、4ビット70Bは約40 GBです。

実用的な対応: 24 GBで7B〜13Bを快適に実行。32 GBで32Bを4ビットで。80 GBで70Bを4ビット、十分なコンテキストで。それ以上は複数カードとテンソル並列が必要です。

## ソフトウェアスタック

vLLMはサービングのデフォルトとして適切です。連続バッチ処理とPagedAttentionにより、単純な実装よりスループットで大きく優れ、OpenAI API形式を話すため、ほとんどのクライアントコードは変更なしで動作します。実験目的でスループットが不要ならOllamaが簡単です。特定のワークロードにはTGIやSGLangも検討価値があります。

これらはすべて、CUDA 13、cuDNN 9、PyTorch 2.6がプリインストールされたイメージで、ワンコマンドで利用できます。


## よくある質問

### 70BモデルにはどのGPUが必要？

80 GBのH100 1枚で、70Bモデルを4ビット量子化で、十分なコンテキストで実行できます。フル精度には約140 GB必要なので、NVLinkで接続した4枚のH100が必要です。

### 実行内容はログに記録されますか？

いいえ。GPUワークロードの検査、プロンプトのログ、コンピューティングへのコンテンツポリシーの適用はありません。AUPはサーバーからの配布物に適用され、サーバー上での計算には適用されません。

### GPUは他の顧客と共有ですか？

いいえ。物理カードはパススルーされ、期間中、あなたのVM専用です。タイムスライシングやMIGパーティショニングはなく、VRAM全体とスループットを利用できます。

### 推論だけでなくファインチューニングもできますか？

はい。7BモデルのLoRAファインチューニングは、4090で快適に動作します。より大きなモデルのフルファインチューニングにはA100またはH100が必要です。アンメータード転送により、データセットの転送やチェックポイントの出力はコストゼロです。


---

Incognito VPS — 16拠点でオフショアVPS、ベアメタル、GPUサーバーを提供。うち8拠点は法的特性に基づき選定。本人確認不要、暗号通貨のみの支払い、55秒でデプロイ。
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt