AI 추론 호스팅
답변
자체 호스팅 AI 추론은 호스팅 API를 호출하는 대신 임대한 GPU 하드웨어에서 오픈 가중치 모델을 실행하는 것을 의미합니다. Incognito VPS는 CUDA 13과 PyTorch가 사전 설치된 RTX 4090, RTX 5090, A100, H100 서버를 제공하며, 무제한 전송과 실행 내용에 대한 로깅이 없습니다.
| 시나리오 | 최소 |
|---|---|
| 7–8B, 4비트 | RTX 4090 1장 (24GB) |
| 13–14B, 8비트 | RTX 5090 1장 (32GB) |
| 32–34B, 4비트 | RTX 5090 1장 (32GB) |
| 70B, 4비트 | H100 1장 (80GB) |
| 70B 전체 정밀도 | H100 4장 (320GB) |
API보다 자체 호스팅이 나은 경우
호스팅 API는 토큰당 더 저렴하지만 항상 그런 것은 아닙니다. 전환점은 대략 연속 사용입니다. GPU가 하루 종일 바쁘다면 월 임대료가 동일한 API 사용량보다 저렴하며, 볼륨이 증가할수록 격차는 커집니다.
다른 이유는 경제적이라기보다 구조적입니다. 프롬프트가 서버를 떠나지 않습니다. 요청에 적용되는 콘텐츠 정책이 없습니다. 속도 제한도, 구축한 모델의 지원 중단도, 공급자가 사용 사례를 더 이상 허용하지 않기로 결정하는 일도 없습니다. 어떤 작업에서는 가격보다 이러한 요소가 더 중요합니다.
VRAM은 처음에 중요한 유일한 사양
모델 크기(파라미터 수)에 파라미터당 바이트 수를 곱하면 최소 요구 사항이 나오며, 그 위에 컨텍스트 길이와 배치 크기에 따라 증가하는 KV 캐시를 위한 여유 공간이 필요합니다. 4비트 양자화된 7B 모델은 약 4GB이고, 4비트 70B는 약 40GB입니다.
실용적인 매핑: 24GB는 7B~13B를 원활하게 실행합니다. 32GB는 4비트 32B까지 도달합니다. 80GB는 4비트 70B를 넉넉한 컨텍스트로 실행합니다. 그 이상은 다중 카드와 텐서 병렬 처리가 필요합니다.
소프트웨어 스택
vLLM은 서빙에 적합한 기본 선택입니다. 연속 배칭과 PagedAttention 덕분에 단순 구현보다 처리량이 크게 높으며 OpenAI API 형식을 따르므로 대부분의 클라이언트 코드를 수정 없이 사용할 수 있습니다. Ollama는 처리량이 필요 없는 실험에 더 간단합니다. TGI와 SGLang도 특정 워크로드에 고려해 볼 만합니다.
이 모든 것은 CUDA 13, cuDNN 9, PyTorch 2.6이 이미 설치된 당사 이미지에서 한 줄 명령으로 사용할 수 있습니다.
자주 묻는 질문
01 70B 모델에는 어떤 GPU가 필요한가요?
80GB 단일 H100으로 4비트 양자화 70B 모델을 넉넉한 컨텍스트로 실행할 수 있습니다. 전체 정밀도에는 약 140GB가 필요하므로 NVLink로 연결된 H100 4장이 필요합니다.
02 제가 실행하는 내용을 로그로 남기나요?
아니요. GPU 워크로드 검사, 프롬프트 로깅, 계산에 적용되는 콘텐츠 정책이 없습니다. 당사 AUP는 서버에서 배포하는 내용을 규제하며, 서버에서 계산하는 내용은 규제하지 않습니다.
03 GPU를 다른 고객과 공유하나요?
아니요. 물리적 카드는 패스스루되어 기간 동안 VM 전용입니다. 시간 분할, MIG 파티셔닝 없이 전체 VRAM과 전체 처리량을 사용할 수 있습니다.
04 추론뿐만 아니라 미세 조정도 할 수 있나요?
네. 7B 모델의 LoRA 미세 조정은 4090에서 충분히 가능합니다. 더 큰 모델의 전체 미세 조정에는 A100 또는 H100이 필요합니다. 무제한 전송으로 데이터 세트 이동과 체크포인트 업로드 비용이 들지 않습니다.
관련