Clipper 16
US$262,20 total · Hemat 5%
- vCPU
- 8 × khusus
- RAM
- 16 GB
- Penyimpanan
- 400 GB NVMe Gen4 SSD
- Transfer
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Solusi
Inferensi CPU layak digunakan untuk model kecil: model dengan parameter 8 miliar yang dikuantisasi ke 4 bit berjalan dengan kecepatan percakapan pada 8 inti khusus dengan RAM 16 GB. Apa pun yang lebih besar membutuhkan GPU. Sebagian besar pekerjaan AI yang dihosting sendiri sebenarnya adalah tumpukan di sekitarnya — basis data vektor, layanan penyematan, gerbang API — dan itu berjalan sangat baik di Clipper 32.
| Sumber daya | Apa yang sebenarnya Anda butuhkan |
|---|---|
| CPU | 8+ inti khusus dengan AVX-512 untuk inferensi CPU |
| RAM | 16 GB untuk model 8B pada Q4, 64 GB untuk 70B pada Q4 |
| Disk | NVMe Gen4 — bobot model besar dan latensi pemuatan penting |
| GPU | Tersedia di wilayah tertentu; tanyakan sebelum memesan |
US$262,20 total · Hemat 5%
US$495,90 total · Hemat 5%
US$937,65 total · Hemat 5%
Lokasi biasanya adalah keputusan yang paling menentukan untuk beban kerja ini — baik karena latensi mendominasi, atau karena yurisdiksi yang menentukan.
Dua belas inti khusus dan 32 GB mencakup sebagian besar inferensi CPU.
Ollama adalah jalur tercepat; llama.cpp memberikan kontrol lebih halus atas kuantisasi.
Q4_K_M adalah titik keseimbangan umum antara kualitas dan kecepatan.
LiteLLM atau reverse proxy dengan autentikasi dan pembatasan laju.
Qdrant atau pgvector; keduanya berjalan nyaman berdampingan dengan model.
Ya, untuk model kecil dan terkuantisasi. Model 8B pada Q4 menghasilkan kira-kira 8–15 token per detik pada 8 inti khusus modern — cukup untuk asisten pribadi atau jalur pemrosesan batch, terlalu lambat untuk produk obrolan yang sibuk.
Kira-kira ukuran file dari bobot terkuantisasi ditambah 2 GB. Model 8B pada Q4 sekitar 5 GB, model 70B pada Q4 sekitar 40 GB.
Di wilayah tertentu, ya. Hubungi kami sebelum memesan agar kami dapat mengonfirmasi ketersediaan dan harga saat ini.