AI inference hosting
الإجابة
الاستدلال الذاتي للذكاء الاصطناعي يعني تشغيل نماذج وزن مفتوح على أجهزة GPU تستأجرها بدلاً من استدعاء واجهة برمجية مستضافة. توفر Incognito VPS خوادم RTX 4090 و RTX 5090 و A100 و H100 مع CUDA 13 و PyTorch مثبتة مسبقًا، ونقل غير محدود، وعدم تسجيل لما تشغله.
| السيناريو | الحد الأدنى |
|---|---|
| 7–8B, 4-bit | 1 × RTX 4090 (24 GB) |
| 13–14B, 8-bit | 1 × RTX 5090 (32 GB) |
| 32–34B, 4-bit | 1 × RTX 5090 (32 GB) |
| 70B, 4-bit | 1 × H100 (80 GB) |
| 70B full precision | 4 × H100 (320 GB) |
متى يتفوق الاستضافة الذاتية على واجهة برمجية
واجهات API المستضافة أرخص لكل رمز إلا أنها ليست كذلك دائمًا. نقطة التقاطع تقريبًا هي الاستخدام المستمر: إذا كان GPU مشغولًا معظم اليوم، فإن الإيجار الشهري يكلف أقل من الإنفاق المكافئ على API، وتتسع الفجوة مع نمو الحجم.
الأسباب الأخرى بنيوية وليست اقتصادية. استفساراتك لا تغادر خادمك. لا توجد سياسة محتوى تُطبق على طلباتك. لا يوجد حد للمعدل، ولا إهمال للنموذج الذي بنيت عليه، ولا مزود يقرر أن حالتك الاستخدام لم تعد مرحبًا بها. بالنسبة لبعض الأعمال، هذه الأمور تهم أكثر من السعر.
VRAM هو المواصفة الوحيدة التي تهم أولاً
حجم النموذج بالمعلمات ضرب البايت لكل معلمة يعطيك الحد الأدنى، وتحتاج إلى مساحة إضافية فوق ذلك لذاكرة التخزين المؤقت KV، التي تنمو مع طول السياق وحجم الدفعة. نموذج 7B بكمية 4 بت يبلغ حوالي 4 غيغابايت؛ نموذج 70B بكمية 4 بت يبلغ حوالي 40 غيغابايت.
الربط العملي: 24 غيغابايت يعمل 7B إلى 13B بشكل مريح. 32 غيغابايت يصل إلى 32B بدقة 4 بت. 80 غيغابايت يعمل 70B بدقة 4 بت مع سياق واسع. بعد ذلك تحتاج إلى بطاقات متعددة وتوازي التوتر.
The software stack
vLLM هو الخيار الصحيح الافتراضي للتقديم — الدفعات المستمرة و PagedAttention تمنحه ميزة إنتاجية كبيرة على التطبيقات الساذجة، وهو يتحدث بصيغة OpenAI API لذا يعمل معظم رمز العميل دون تعديل. Ollama أبسط إذا كنت تجرب ولا تحتاج إلى إنتاجية. TGI و SGLang كلاهما يستحقان النظر في مهام محددة.
كلها على بُعد أمر واحد على صورنا، التي تأتي مع CUDA 13 و cuDNN 9 و PyTorch 2.6 مثبتة مسبقًا.
الأسئلة الشائعة
01 أي GPU لنموذج 70B؟
H100 واحد بسعة 80 غيغابايت يشغل 70B بكمية 4 بت مع سياق واسع. الدقة الكاملة تحتاج حوالي 140 غيغابايت، لذا أربعة H100 خلف NVLink.
02 هل تسجل ما أشغّله؟
لا. لا يوجد فحص لأعباء عمل GPU، ولا تسجيل استفسارات، ولا سياسة محتوى مطبقة على الحوسبة. تحكم سياسة الاستخدام المقبول (AUP) ما توزعه من الخادم، وليس ما تحسبه عليه.
03 هل GPU مشترك مع عملاء آخرين؟
لا. البطاقة المادية مُمررة ومخصصة لجهازك الافتراضي طوال المدة — لا تقطيع زمني، ولا تقسيم MIG، كل VRAM وكل الإنتاجية.
04 هل يمكنني ضبط النموذج بدقة، وليس الاستدلال فقط؟
نعم. ضبط LoRA لنموذج 7B يناسب 4090 بشكل مريح. الضبط الكامل للنماذج الأكبر يريد A100 أو H100. النقل غير المحدود يعني نقل مجموعات البيانات إلى الداخل ونقل نقاط التفتيش إلى الخارج لا يكلف شيئًا.
ذات صلة