AI推論ホスティング
回答
セルフホストAI推論とは、オープンウェイトモデルをレンタルしたGPU上で実行し、ホスト型APIを呼び出さないことです。Incognito VPSは、CUDA 13とPyTorchがプリインストールされたRTX 4090、RTX 5090、A100、H100サーバーを提供し、アンメータード転送、実行内容のログなしを実現します。
| シナリオ | 最小 |
|---|---|
| 7–8B、4ビット | 1 × RTX 4090 (24 GB) |
| 13–14B、8ビット | 1 × RTX 5090 (32 GB) |
| 32–34B、4ビット | 1 × RTX 5090 (32 GB) |
| 70B、4ビット | 1 × H100 (80 GB) |
| 70B フル精度 | 4 × H100 (320 GB) |
セルフホストがAPIに勝る場合
ホスト型APIは、トークン単価が安いのはある時点までです。分岐点はほぼ継続的な使用です。GPUが1日の大半ビジーなら、月額レンタルは同等のAPI使用料より安く、ボリュームが増えるほど差は広がります。
他の理由は構造的で、経済的ではありません。プロンプトはサーバーから出ません。リクエストにコンテンツポリシーは適用されません。レート制限も、構築したモデルの非推奨化も、プロバイダーがあなたのユースケースを歓迎しなくなることもありません。仕事によっては、これらは価格よりも重要です。
最初に重要なのはVRAMだけ
パラメータ数×パラメータあたりのバイト数が下限で、その上にKVキャッシュのヘッドルームが必要です。コンテキスト長とバッチサイズに応じて増加します。4ビット量子化の7Bモデルは約4 GB、4ビット70Bは約40 GBです。
実用的な対応: 24 GBで7B〜13Bを快適に実行。32 GBで32Bを4ビットで。80 GBで70Bを4ビット、十分なコンテキストで。それ以上は複数カードとテンソル並列が必要です。
ソフトウェアスタック
vLLMはサービングのデフォルトとして適切です。連続バッチ処理とPagedAttentionにより、単純な実装よりスループットで大きく優れ、OpenAI API形式を話すため、ほとんどのクライアントコードは変更なしで動作します。実験目的でスループットが不要ならOllamaが簡単です。特定のワークロードにはTGIやSGLangも検討価値があります。
これらはすべて、CUDA 13、cuDNN 9、PyTorch 2.6がプリインストールされたイメージで、ワンコマンドで利用できます。
よくある質問
01 70BモデルにはどのGPUが必要?
80 GBのH100 1枚で、70Bモデルを4ビット量子化で、十分なコンテキストで実行できます。フル精度には約140 GB必要なので、NVLinkで接続した4枚のH100が必要です。
02 実行内容はログに記録されますか?
いいえ。GPUワークロードの検査、プロンプトのログ、コンピューティングへのコンテンツポリシーの適用はありません。AUPはサーバーからの配布物に適用され、サーバー上での計算には適用されません。
03 GPUは他の顧客と共有ですか?
いいえ。物理カードはパススルーされ、期間中、あなたのVM専用です。タイムスライシングやMIGパーティショニングはなく、VRAM全体とスループットを利用できます。
04 推論だけでなくファインチューニングもできますか?
はい。7BモデルのLoRAファインチューニングは、4090で快適に動作します。より大きなモデルのフルファインチューニングにはA100またはH100が必要です。アンメータード転送により、データセットの転送やチェックポイントの出力はコストゼロです。
関連