Clipper 16
262,20 US$ tổng cộng · Tiết kiệm 5%
- vCPU
- 8 × riêng
- RAM
- 16 GB
- Lưu trữ
- 400 GB NVMe Gen4 SSD
- Băng thông
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Giải pháp
Suy luận CPU khả thi cho các mô hình nhỏ: mô hình 8 tỷ tham số được lượng tử hóa 4 bit chạy ở tốc độ hội thoại trên 8 lõi chuyên dụng với 16 GB RAM. Bất kỳ thứ gì lớn hơn cần GPU. Hầu hết công việc AI tự lưu trữ thực sự là phần cơ sở hỗ trợ xung quanh — cơ sở dữ liệu vector, dịch vụ nhúng, cổng API — và phần đó chạy rất tốt trên Clipper 32.
| Tài nguyên | Những gì bạn thực sự cần |
|---|---|
| CPU | 8+ lõi chuyên dụng với AVX-512 cho suy luận CPU |
| RAM | 16 GB cho mô hình 8B ở Q4, 64 GB cho 70B ở Q4 |
| Ổ đĩa | NVMe Gen4 — trọng lượng mô hình lớn và độ trễ tải có ý nghĩa quan trọng |
| GPU | Khả dụng tại một số khu vực; vui lòng hỏi trước khi đặt hàng |
262,20 US$ tổng cộng · Tiết kiệm 5%
495,90 US$ tổng cộng · Tiết kiệm 5%
937,65 US$ tổng cộng · Tiết kiệm 5%
Vị trí thường là quyết định quan trọng nhất cho khối lượng công việc này — hoặc vì độ trễ chiếm ưu thế, hoặc vì thẩm quyền pháp lý.
Mười hai lõi chuyên dụng và 32 GB đủ cho hầu hết suy luận CPU.
Ollama là con đường nhanh nhất; llama.cpp cho phép kiểm soát chi tiết hơn về lượng tử hóa.
Q4_K_M là điểm cân bằng thông thường giữa chất lượng và tốc độ.
LiteLLM hoặc một reverse proxy có xác thực và giới hạn tốc độ.
Qdrant hoặc pgvector; cả hai đều chạy tốt cùng mô hình.
Có, với các mô hình nhỏ và đã lượng tử hóa. Mô hình 8B ở Q4 tạo ra khoảng 8–15 token mỗi giây trên 8 lõi chuyên dụng hiện đại — đủ tốt cho trợ lý cá nhân hoặc pipeline hàng loạt, quá chậm cho sản phẩm chat đông người dùng.
Gần bằng kích thước tệp của trọng số đã lượng tử hóa cộng thêm 2 GB. Mô hình 8B ở Q4 khoảng 5 GB, mô hình 70B ở Q4 khoảng 40 GB.
Có, tại một số khu vực chọn lọc. Liên hệ chúng tôi trước khi đặt hàng để xác nhận tình trạng sẵn có và giá hiện tại.