Clipper 16
262,20 USD totale · Risparmia 5%
- vCPU
- 8 × dedicato
- RAM
- 16 GB
- Archiviazione
- 400 GB NVMe Gen4 SSD
- Trasferimento
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Soluzione
L'inferenza su CPU è praticabile per modelli piccoli: un modello da 8 miliardi di parametri quantizzato a 4 bit gira a velocità di conversazione su 8 core dedicati con 16 GB di RAM. Qualcosa di più grande richiede una GPU. La maggior parte del lavoro AI self-hosted è in realtà lo stack circostante — database vettoriale, servizio di embedding, API gateway — e funziona perfettamente su un Clipper 32.
| Risorsa | Cosa ti serve davvero |
|---|---|
| CPU | 8+ core dedicati con AVX-512 per inferenza su CPU |
| RAM | 16 GB per un modello 8B a Q4, 64 GB per 70B a Q4 |
| Disco | NVMe Gen4 — i pesi dei modelli sono grandi e la latenza di caricamento conta |
| GPU | Disponibile in regioni selezionate; chiedere prima di ordinare |
262,20 USD totale · Risparmia 5%
495,90 USD totale · Risparmia 5%
937,65 USD totale · Risparmia 5%
La posizione è solitamente la decisione più importante per questo carico di lavoro — perché la latenza domina, o perché la giurisdizione conta.
Dodici core dedicati e 32 GB coprono la maggior parte dell'inferenza su CPU.
Ollama è la via più rapida; llama.cpp offre un controllo più fine sulla quantizzazione.
Q4_K_M è il punto di equilibrio abituale tra qualità e velocità.
LiteLLM o un reverse proxy con autenticazione e rate limiting.
Qdrant o pgvector; entrambi funzionano comodamente accanto al modello.
Sì, per modelli piccoli e quantizzati. Un modello 8B in Q4 produce circa 8–15 token al secondo su 8 core moderni dedicati — sufficiente per un assistente personale o una pipeline batch, troppo lento per un prodotto chat affollato.
Circa la dimensione del file dei pesi quantizzati più 2 GB. Un modello 8B in Q4 è circa 5 GB, un modello 70B in Q4 circa 40 GB.
In alcune regioni selezionate, sì. Contattaci prima di ordinare per confermare la disponibilità attuale e i prezzi.