솔루션

AI 워크로드, LLM 추론 및 RAG 파이프라인용 VPS

Clipper 16 · $92/moClipper 32 · $174/mo
간단한 답변

소형 모델에는 CPU 추론이 가능합니다: 4비트로 양자화된 80억 매개변수 모델은 전용 코어 8개와 16GB RAM에서 대화 속도로 실행됩니다. 그 이상은 GPU가 필요합니다. 대부분의 자체 호스팅 AI 작업은 실제로 주변 스택(벡터 데이터베이스, 임베딩 서비스, API 게이트웨이)이며, 이는 Clipper 32에서 완벽하게 실행됩니다.

필요한 것

ai 및 llm 추론의 사양 최소 요건
리소스실제로 필요한 것
CPUAVX-512 지원 전용 코어 8개 이상 (CPU 추론용)
RAMQ4에서 8B 모델용 16GB, Q4에서 70B용 64GB
磁盘NVMe Gen4 — 모델 가중치는 크며 로드 지연 시간이 중요합니다.
GPU선택된 지역에서만 제공되며, 주문 전에 문의하세요.

추천 요금제

Clipper

Clipper 16

$ 87.4 /month

총 US$262.20 · 5% 할인

vCPU
8 × 전용
RAM
16 GB
저장 공간
400 GB NVMe Gen4 SSD
전송량
30 TB
IPv4 / IPv6
1 / /64 routed
구성
Clipper

Clipper 32

$ 165.3 /month

총 US$495.90 · 5% 할인

vCPU
12 × 전용
RAM
32 GB
저장 공간
800 GB NVMe Gen4 SSD
전송량
40 TB
IPv4 / IPv6
1 / /64 routed
구성
Clipper

Clipper 64

$ 312.55 /month

총 US$937.65 · 5% 할인

vCPU
16 × 전용
RAM
64 GB
저장 공간
1.6 TB NVMe Gen4 SSD
전송량
50 TB
IPv4 / IPv6
1 / /64 routed
구성

추천 위치

이 워크로드에서 가장 중요한 결정은 일반적으로 위치입니다 — 대기 시간이 지배적이거나, 관할권이 중요하기 때문입니다.

이용 이유: OnionVPS

  • AVX-512를 갖춘 고주파 EPYC 코어는 GPU 없이도 llama.cpp를 실질적으로 사용할 수 있게 합니다.
  • NVMe Gen4는 40GB 모델 파일을 몇 분이 아닌 몇 초 만에 로드합니다.
  • 자체 호스팅은 어떤 프롬프트도 귀하가 제어하는 인프라를 벗어나지 않음을 의미합니다 — 대부분이 이를 수행하는 실제 이유입니다.
  • 민감한 문서를 모델로 처리하는 팀을 위한 프라이버시 관할권.

설정 방법

  1. Ubuntu 24.04와 함께 Clipper 32 배포

    전용 코어 12개와 32GB는 대부분의 CPU 추론을 처리합니다.

  2. Ollama 또는 llama.cpp 설치

    Ollama가 가장 빠른 경로이며, llama.cpp는 양자화에 대한 더 세밀한 제어를 제공합니다.

  3. 양자화된 모델 가져오기

    Q4_K_M은 일반적인 품질과 속도 간의 최적 지점입니다.

  4. 앞에 API 게이트웨이 배치

    LiteLLM 또는 인증 및 속도 제한이 있는 리버스 프록시.

  5. RAG를 구축하는 경우 벡터 데이터베이스 추가

    Qdrant 또는 pgvector; 둘 다 모델과 함께 원활하게 실행됩니다.

자주 묻는 질문

GPU 없이 VPS에서 LLM을 실행할 수 있나요?

네, 작고 양자화된 모델의 경우 가능합니다. Q4의 8B 모델은 최신 전용 코어 8개에서 초당 약 8–15 토큰을 생성합니다 — 개인 비서나 배치 파이프라인에는 충분하지만, 트래픽이 많은 채팅 제품에는 너무 느립니다.

로컬 LLM에는 얼마나 많은 RAM이 필요합니까?

대략 양자화된 가중치 파일 크기에 2GB를 더한 정도입니다. Q4의 8B 모델은 약 5GB, Q4의 70B 모델은 약 40GB입니다.

GPU 인스턴스를 제공하나요?

일부 지역에서는 제공합니다. 주문 전에 연락 주시면 현재 가용성과 가격을 확인해 드리겠습니다.