# میزبانی استنتاج هوش مصنوعی
> استنتاج هوش مصنوعی خودمیزبان یعنی اجرای مدل‌های متن‌باز روی سخت‌افزار GPU اجاره‌ای به جای فراخوانی API میزبانی‌شده. Incognito VPS سرورهای RTX 4090، RTX 5090، A100 و H100 با CUDA 13 و PyTorch از پیش نصب‌شده، ترانسفر نامحدود و بدون ثبت‌وقایع اجرا ارائه می‌دهد.
**Source:** https://incognitovps.com/fa/use-cases/ai-inference-hosting
**Updated:** 2026-08-08

## Recommended configuration

| Field | Value |
| --- | --- |
| Plan | FORGE-XL (gx-5090) |
| Specification | 12 vCPU, 96 GB, 2 TB |
| Jurisdiction | Amsterdam, Netherlands |
| Price | $219.00/mo |

۳۲ گیگابایت VRAM یک مدل ۳۲B را با بیت ۴ یا ۱۳B را با دقت کامل با فضای زمینه اجرا می‌کند. آمستردام تأخیر اولین توکن را برای کاربران اروپایی پایین نگه می‌دارد.

## Resource guidance

| Scenario | Minimum |
| --- | --- |
| ۷–۸B، بیت ۴ | ۱ × RTX 4090 (24 GB) |
| ۱۳–۱۴B، بیت ۸ | ۱ × RTX 5090 (32 GB) |
| ۳۲–۳۴B، بیت ۴ | ۱ × RTX 5090 (32 GB) |
| ۷۰B، بیت ۴ | ۱ × H100 (80 GB) |
| ۷۰B دقت کامل | ۴ × H100 (320 GB) |

## وقتی خودمیزبانی از API بهتر است

APIهای میزبانی‌شده از نظر هزینه به ازای هر توکن ارزان‌ترند تا زمانی که نباشند. نقطه‌ی تلاقی تقریباً استفاده‌ی مداوم است: اگر GPU بیشتر روز مشغول باشد، اجاره‌ی ماهانه از هزینه‌ی معادل API کمتر می‌شود و با رشد حجم، شکاف بیشتر می‌شود.

دلایل دیگر ساختاری هستند نه اقتصادی. پرامپت‌های شما از سرور خارج نمی‌شوند. هیچ سیاست محتوایی روی درخواست‌های شما اعمال نمی‌شود. هیچ محدودیت نرخی، هیچ منسوخ‌سازی مدلی که روی آن ساخته‌اید، و هیچ ارائه‌دهنده‌ای که تصمیم بگیرد کاربرد شما دیگر خوشایند نیست وجود ندارد. برای برخی کارها این‌ها از قیمت مهم‌ترند.

## VRAM تنها مشخصه‌ای است که ابتدا اهمیت دارد

اندازه‌ی مدل به پارامترها ضربدر بایت به ازای هر پارامتر، کف را می‌دهد و به فضای اضافی برای کش KV نیاز دارید که با طول زمینه و اندازه‌ی دسته رشد می‌کند. یک مدل ۷B کوانتیزه‌ی ۴ بیتی حدود ۴ گیگابایت است؛ ۷۰B با بیت ۴ حدود ۴۰ گیگابایت.

نگاشت عملی: ۲۴ گیگابایت ۷B تا ۱۳B را راحت اجرا می‌کند. ۳۲ گیگابایت به ۳۲B با بیت ۴ می‌رسد. ۸۰ گیگابایت ۷۰B را با بیت ۴ با زمینه‌ی سخاوتمندانه اجرا می‌کند. فراتر از آن به چند کارت و موازی‌سازی تنسور نیاز دارید.

## پشته‌ی نرم‌افزاری

vLLM انتخاب درست پیش‌فرض برای سرو است — بatching پیوسته و PagedAttention مزیت توان عملیاتی زیادی نسبت به پیاده‌سازی‌های ساده می‌دهند و با فرمت OpenAI API صحبت می‌کند، بنابراین بیشتر کدهای کلاینت بدون تغییر کار می‌کنند. اگر آزمایش می‌کنید و نیازی به توان عملیاتی ندارید، Ollama ساده‌تر است. TGI و SGLang برای بارهای کاری خاص ارزش بررسی دارند.

همه‌ی آن‌ها با یک فرمان روی تصاویر ما در دسترس هستند که با CUDA 13، cuDNN 9 و PyTorch 2.6 از پیش نصب‌شده عرضه می‌شوند.


## سوالات متداول

### برای مدل ۷۰B کدام GPU؟

یک H100 با ۸۰ گیگابایت، ۷۰B را با کوانتیزاسیون ۴ بیتی و زمینه‌ی سخاوتمندانه اجرا می‌کند. دقت کامل حدود ۱۴۰ گیگابایت نیاز دارد، پس چهار H100 پشت NVLink.

### آیا اجرای من را ثبت‌وقایع می‌کنید؟

خیر. هیچ بازرسی از بار کاری GPU، هیچ ثبت‌وقایع پرامپت و هیچ سیاست محتوایی روی محاسبات اعمال نمی‌شود. AUP ما بر توزیع شما از سرور حاکم است، نه بر محاسبات روی آن.

### آیا GPU با مشتریان دیگر به اشتراک گذاشته می‌شود؟

خیر. کارت فیزیکی به‌صورت مستقیم و اختصاصی به VM شما برای مدت قرارداد داده می‌شود — بدون تقسیم زمانی، بدون پارتیشن‌بندی MIG، VRAM کامل و توان عملیاتی کامل.

### آیا می‌توانم fine-tune کنم، نه فقط استنتاج؟

بله. fine-tune لورا برای مدل ۷B به راحتی روی 4090 جا می‌شود. fine-tune کامل مدل‌های بزرگ‌تر به A100 یا H100 نیاز دارد. ترانسفر نامحدود یعنی انتقال مجموعه‌داده به داخل و چک‌پوینت به بیرون هزینه‌ای ندارد.


---

Incognito VPS — سرورهای VPS آفشور، فلزی و GPU در ۱۶ موقعیت، که ۸ مورد از آنها به دلیل ویژگیهای قانونیشان انتخاب شدهاند. بدون نیاز به هویت، پرداخت فقط با ارز دیجیتال، استقرار در ۵۵ ثانیه.
Operating since 2020. 16 locations, 8 of them privacy jurisdictions. AS204287.
Payment: BTC, XMR, ETH, USDT, USDC, LTC, TRX, SOL, BNB, DOGE, TON, DAI. No identity verification at any point.
Catalogue: https://incognitovps.com/pricing.md · API: https://incognitovps.com/openapi.json · Index: https://incognitovps.com/llms.txt