Clipper 16
Toplam $262,20 · %5 tasarruf
- Sanal CPU
- 8 × ayrılmış
- RAM
- 16 GB
- Depolama
- 400 GB NVMe Gen4 SSD
- Aktarım
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Çözüm
Küçük modeller için CPU çıkarımı uygundur: 4 bit'e nicelenmiş 8 milyar parametreli bir model, 8 özel çekirdek ve 16 GB RAM ile konuşma hızında çalışır. Daha büyük bir şey GPU ister. Kendi kendine barındırılan AI işinin çoğu aslında çevreleyen yığındır — vektör veritabanı, gömme hizmeti, API ağ geçidi — ve bu, bir Clipper 32'de mükemmel şekilde çalışır.
| Kaynak | Gerçekte ihtiyacınız olan |
|---|---|
| CPU | CPU çıkarımı için AVX-512 destekli 8+ özel çekirdek |
| RAM | Q4'te 8B model için 16 GB, Q4'te 70B için 64 GB |
| Disk | NVMe Gen4 — model ağırlıkları büyüktür ve yükleme gecikmesi önemlidir |
| GPU | Seçili bölgelerde mevcuttur; sipariş vermeden önce sorun |
Toplam $262,20 · %5 tasarruf
Toplam $495,90 · %5 tasarruf
Toplam $937,65 · %5 tasarruf
Bu iş yükü için en önemli karar genellikle konumdur — ya gecikme baskın olduğu için ya da yargı yetkisi baskın olduğu için.
On iki özel çekirdek ve 32 GB, çoğu CPU çıkarımını kapsar.
Ollama en hızlı yoldur; llama.cpp, niceme üzerinde daha ince kontrol sağlar.
Q4_K_M, kalite-hız dengesi için en yaygın seçimdir.
LiteLLM veya kimlik doğrulama ve hız sınırlama içeren bir ters vekil.
Qdrant veya pgvector; ikisi de modelle rahatça çalışır.
Evet, küçük ve niceh modeller için. Q4'teki 8B model, 8 modern özel çekirdekte saniyede kabaca 8-15 token üretir — kişisel bir asistan veya toplu iş hattı için yeterli, yoğun bir sohbet ürünü için çok yavaş.
Niceh ağırlıkların dosya boyutu artı 2 GB. Q4'teki 8B model yaklaşık 5 GB, Q4'teki 70B model yaklaşık 40 GB'dır.
Bazı bölgelerde, evet. Sipariş vermeden önce bizimle iletişime geçin; mevcut durumu ve fiyatları teyit edelim.