Clipper 16
총 US$262.20 · 5% 할인
- vCPU
- 8 × 전용
- RAM
- 16 GB
- 저장 공간
- 400 GB NVMe Gen4 SSD
- 전송량
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
솔루션
소형 모델에는 CPU 추론이 가능합니다: 4비트로 양자화된 80억 매개변수 모델은 전용 코어 8개와 16GB RAM에서 대화 속도로 실행됩니다. 그 이상은 GPU가 필요합니다. 대부분의 자체 호스팅 AI 작업은 실제로 주변 스택(벡터 데이터베이스, 임베딩 서비스, API 게이트웨이)이며, 이는 Clipper 32에서 완벽하게 실행됩니다.
| 리소스 | 실제로 필요한 것 |
|---|---|
| CPU | AVX-512 지원 전용 코어 8개 이상 (CPU 추론용) |
| RAM | Q4에서 8B 모델용 16GB, Q4에서 70B용 64GB |
| 磁盘 | NVMe Gen4 — 모델 가중치는 크며 로드 지연 시간이 중요합니다. |
| GPU | 선택된 지역에서만 제공되며, 주문 전에 문의하세요. |
총 US$262.20 · 5% 할인
총 US$495.90 · 5% 할인
총 US$937.65 · 5% 할인
이 워크로드에서 가장 중요한 결정은 일반적으로 위치입니다 — 대기 시간이 지배적이거나, 관할권이 중요하기 때문입니다.
전용 코어 12개와 32GB는 대부분의 CPU 추론을 처리합니다.
Ollama가 가장 빠른 경로이며, llama.cpp는 양자화에 대한 더 세밀한 제어를 제공합니다.
Q4_K_M은 일반적인 품질과 속도 간의 최적 지점입니다.
LiteLLM 또는 인증 및 속도 제한이 있는 리버스 프록시.
Qdrant 또는 pgvector; 둘 다 모델과 함께 원활하게 실행됩니다.
네, 작고 양자화된 모델의 경우 가능합니다. Q4의 8B 모델은 최신 전용 코어 8개에서 초당 약 8–15 토큰을 생성합니다 — 개인 비서나 배치 파이프라인에는 충분하지만, 트래픽이 많은 채팅 제품에는 너무 느립니다.
대략 양자화된 가중치 파일 크기에 2GB를 더한 정도입니다. Q4의 8B 모델은 약 5GB, Q4의 70B 모델은 약 40GB입니다.
일부 지역에서는 제공합니다. 주문 전에 연락 주시면 현재 가용성과 가격을 확인해 드리겠습니다.