INCOGNITO VPS
Cập nhật August 8, 2026

Lưu trữ suy luận AI

Trả lời

Tự lưu trữ suy luận AI nghĩa là chạy các mô hình mã nguồn mở trên phần cứng GPU bạn thuê thay vì gọi API được lưu trữ. Incognito VPS cung cấp máy chủ RTX 4090, RTX 5090, A100 và H100 với CUDA 13 và PyTorch cài sẵn, băng thông không giới hạn và không ghi log những gì bạn chạy.

Resource guidance for Lưu trữ suy luận AI
Tình huống Tối thiểu
7–8B, 4-bit 1 × RTX 4090 (24 GB)
13–14B, 8-bit 1 × RTX 5090 (32 GB)
32–34B, 4-bit 1 × RTX 5090 (32 GB)
70B, 4-bit 1 × H100 (80 GB)
70B độ chính xác đầy đủ 4 × H100 (320 GB)

Khi nào tự lưu trữ tốt hơn API

API được lưu trữ rẻ hơn cho mỗi token cho đến khi nó không còn rẻ. Điểm giao nhau xấp xỉ khi sử dụng liên tục: nếu GPU bận gần như cả ngày, thuê hàng tháng sẽ tốn ít hơn chi phí API tương đương, và khoảng cách ngày càng rộng khi khối lượng tăng lên.

Các lý do khác mang tính cấu trúc hơn là kinh tế. Các prompt của bạn không rời khỏi máy chủ của bạn. Không có chính sách nội dung áp dụng cho các yêu cầu của bạn. Không có giới hạn tốc độ, không có việc loại bỏ mô hình bạn đã xây dựng, và không có nhà cung cấp nào quyết định rằng trường hợp sử dụng của bạn không còn được chấp nhận. Với một số công việc, những lý do này quan trọng hơn giá cả.

VRAM là thông số duy nhất quan trọng lúc đầu

Kích thước mô hình tính bằng tham số nhân với số byte mỗi tham số cho bạn con số tối thiểu, và bạn cần thêm khoảng trống cho bộ đệm KV, bộ đệm này tăng theo độ dài context và kích thước lô. Mô hình 7B lượng tử 4-bit khoảng 4 GB; mô hình 70B 4-bit khoảng 40 GB.

Sự tương ứng thực tế: 24 GB chạy thoải mái 7B đến 13B. 32 GB đạt 32B ở 4-bit. 80 GB chạy 70B ở 4-bit với context rộng rãi. Trên mức đó, bạn cần nhiều card và tensor parallelism.

Ngăn xếp phần mềm

vLLM là lựa chọn mặc định phù hợp để phục vụ — continuous batching và PagedAttention mang lại lợi thế về thông lượng lớn so với việc triển khai thông thường, và nó hỗ trợ định dạng OpenAI API nên hầu hết mã client hoạt động mà không cần sửa đổi. Ollama đơn giản hơn nếu bạn đang thử nghiệm và không cần thông lượng cao. TGI và SGLang cũng đáng xem xét cho các khối lượng công việc cụ thể.

Tất cả đều có thể cài bằng một lệnh trên image của chúng tôi, được cài sẵn CUDA 13, cuDNN 9 và PyTorch 2.6.

FAQ

Câu hỏi thường gặp

01 GPU nào phù hợp cho mô hình 70B?

Một H100 với 80 GB chạy 70B ở độ chính xác 4-bit với context rộng rãi. Độ chính xác đầy đủ cần khoảng 140 GB, vì vậy cần bốn H100 kết nối NVLink.

02 Bạn có ghi log những gì tôi chạy không?

Không. Chúng tôi không kiểm tra khối lượng công việc trên GPU, không ghi log prompt và không có chính sách nội dung áp dụng cho việc tính toán. Điều khoản sử dụng của chúng tôi quản lý những gì bạn phân phối từ máy chủ, không phải những gì bạn tính toán trên đó.

03 GPU có được chia sẻ với khách hàng khác không?

Không. Card vật lý được chuyển qua và dành riêng cho VM của bạn trong suốt thời gian sử dụng — không chia sẻ thời gian, không phân vùng MIG, đủ VRAM và đủ thông lượng.

04 Tôi có thể fine-tuning, không chỉ suy luận?

Có. LoRA fine-tuning mô hình 7B phù hợp với 4090. Fine-tuning đầy đủ các mô hình lớn hơn cần A100 hoặc H100. Băng thông không giới hạn có nghĩa là việc chuyển tập dữ liệu và checkpoint không tốn kém.

Liên quan

Triển khai trong 55 giây

Chọn khu vực tài phán. Thanh toán bằng crypto. Chạy trong một phút.

Không cần tạo tài khoản, không cần xác nhận email, không cần nhập thẻ.