میزبانی استنتاج هوش مصنوعی
پاسخ
استنتاج هوش مصنوعی خودمیزبان یعنی اجرای مدلهای متنباز روی سختافزار GPU اجارهای به جای فراخوانی API میزبانیشده. Incognito VPS سرورهای RTX 4090، RTX 5090، A100 و H100 با CUDA 13 و PyTorch از پیش نصبشده، ترانسفر نامحدود و بدون ثبتوقایع اجرا ارائه میدهد.
| سناریو | حداقل |
|---|---|
| ۷–۸B، بیت ۴ | ۱ × RTX 4090 (24 GB) |
| ۱۳–۱۴B، بیت ۸ | ۱ × RTX 5090 (32 GB) |
| ۳۲–۳۴B، بیت ۴ | ۱ × RTX 5090 (32 GB) |
| ۷۰B، بیت ۴ | ۱ × H100 (80 GB) |
| ۷۰B دقت کامل | ۴ × H100 (320 GB) |
وقتی خودمیزبانی از API بهتر است
APIهای میزبانیشده از نظر هزینه به ازای هر توکن ارزانترند تا زمانی که نباشند. نقطهی تلاقی تقریباً استفادهی مداوم است: اگر GPU بیشتر روز مشغول باشد، اجارهی ماهانه از هزینهی معادل API کمتر میشود و با رشد حجم، شکاف بیشتر میشود.
دلایل دیگر ساختاری هستند نه اقتصادی. پرامپتهای شما از سرور خارج نمیشوند. هیچ سیاست محتوایی روی درخواستهای شما اعمال نمیشود. هیچ محدودیت نرخی، هیچ منسوخسازی مدلی که روی آن ساختهاید، و هیچ ارائهدهندهای که تصمیم بگیرد کاربرد شما دیگر خوشایند نیست وجود ندارد. برای برخی کارها اینها از قیمت مهمترند.
VRAM تنها مشخصهای است که ابتدا اهمیت دارد
اندازهی مدل به پارامترها ضربدر بایت به ازای هر پارامتر، کف را میدهد و به فضای اضافی برای کش KV نیاز دارید که با طول زمینه و اندازهی دسته رشد میکند. یک مدل ۷B کوانتیزهی ۴ بیتی حدود ۴ گیگابایت است؛ ۷۰B با بیت ۴ حدود ۴۰ گیگابایت.
نگاشت عملی: ۲۴ گیگابایت ۷B تا ۱۳B را راحت اجرا میکند. ۳۲ گیگابایت به ۳۲B با بیت ۴ میرسد. ۸۰ گیگابایت ۷۰B را با بیت ۴ با زمینهی سخاوتمندانه اجرا میکند. فراتر از آن به چند کارت و موازیسازی تنسور نیاز دارید.
پشتهی نرمافزاری
vLLM انتخاب درست پیشفرض برای سرو است — بatching پیوسته و PagedAttention مزیت توان عملیاتی زیادی نسبت به پیادهسازیهای ساده میدهند و با فرمت OpenAI API صحبت میکند، بنابراین بیشتر کدهای کلاینت بدون تغییر کار میکنند. اگر آزمایش میکنید و نیازی به توان عملیاتی ندارید، Ollama سادهتر است. TGI و SGLang برای بارهای کاری خاص ارزش بررسی دارند.
همهی آنها با یک فرمان روی تصاویر ما در دسترس هستند که با CUDA 13، cuDNN 9 و PyTorch 2.6 از پیش نصبشده عرضه میشوند.
سوالات متداول
01 برای مدل ۷۰B کدام GPU؟
یک H100 با ۸۰ گیگابایت، ۷۰B را با کوانتیزاسیون ۴ بیتی و زمینهی سخاوتمندانه اجرا میکند. دقت کامل حدود ۱۴۰ گیگابایت نیاز دارد، پس چهار H100 پشت NVLink.
02 آیا اجرای من را ثبتوقایع میکنید؟
خیر. هیچ بازرسی از بار کاری GPU، هیچ ثبتوقایع پرامپت و هیچ سیاست محتوایی روی محاسبات اعمال نمیشود. AUP ما بر توزیع شما از سرور حاکم است، نه بر محاسبات روی آن.
03 آیا GPU با مشتریان دیگر به اشتراک گذاشته میشود؟
خیر. کارت فیزیکی بهصورت مستقیم و اختصاصی به VM شما برای مدت قرارداد داده میشود — بدون تقسیم زمانی، بدون پارتیشنبندی MIG، VRAM کامل و توان عملیاتی کامل.
04 آیا میتوانم fine-tune کنم، نه فقط استنتاج؟
بله. fine-tune لورا برای مدل ۷B به راحتی روی 4090 جا میشود. fine-tune کامل مدلهای بزرگتر به A100 یا H100 نیاز دارد. ترانسفر نامحدود یعنی انتقال مجموعهداده به داخل و چکپوینت به بیرون هزینهای ندارد.
مرتبط