Clipper 16
- vCPU
- 8 × dedicado
- RAM
- 16 GB
- Armazenamento
- 400 GB NVMe Gen4 SSD
- Transferência
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Solução
A inferência por CPU é viável para modelos pequenos: um modelo de 8 mil milhões de parâmetros quantizado para 4 bits corre à velocidade de conversação em 8 núcleos dedicados com 16 GB de RAM. Qualquer coisa maior quer uma GPU. A maior parte do trabalho de IA auto-alojada é na verdade a pilha circundante — base de dados vetorial, serviço de embeddings, gateway de API — e isso corre perfeitamente num Clipper 32.
| Recurso | O que realmente precisa |
|---|---|
| CPU | 8+ núcleos dedicados com AVX-512 para inferência por CPU |
| RAM | 16 GB para um modelo 8B em Q4, 64 GB para 70B em Q4 |
| Disco | NVMe Gen4 — os pesos dos modelos são grandes e a latência de carregamento importa |
| GPU | Disponível em regiões selecionadas; pergunte antes de encomendar |
A localização é geralmente a decisão que mais importa para esta carga de trabalho — seja porque a latência domina, seja porque a jurisdição domina.
Doze núcleos dedicados e 32 GB cobrem a maioria da inferência por CPU.
O Ollama é o caminho mais rápido; o llama.cpp dá um controlo mais fino sobre a quantização.
O Q4_K_M é o equilíbrio habitual entre qualidade e velocidade.
LiteLLM ou um proxy inverso com autenticação e limitação de taxa.
Qdrant ou pgvector; ambos funcionam bem ao lado do modelo.
Sim, para modelos pequenos e quantizados. Um modelo de 8B em Q4 produz aproximadamente 8–15 tokens por segundo em 8 núcleos dedicados modernos — suficiente para um assistente pessoal ou um pipeline de processamento em lote, demasiado lento para um produto de chat com muito tráfego.
Aproximadamente o tamanho do ficheiro dos pesos quantizados mais 2 GB. Um modelo de 8B em Q4 tem cerca de 5 GB, um modelo de 70B em Q4 cerca de 40 GB.
Em regiões selecionadas, sim. Contacte-nos antes de encomendar para confirmarmos a disponibilidade e os preços atuais.