Clipper 16
- vCPU
- 8 × dedicado
- RAM
- 16 GB
- Almacenamiento
- 400 GB NVMe Gen4 SSD
- Transferencia
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Solución
La inferencia por CPU es viable para modelos pequeños: un modelo de 8 mil millones de parámetros cuantizado a 4 bits funciona a velocidad conversacional en 8 núcleos dedicados con 16 GB de RAM. Cualquier cosa más grande requiere GPU. La mayor parte del trabajo de IA autoalojado es en realidad la pila circundante — base de datos vectorial, servicio de embeddings, pasarela API — y eso funciona perfectamente en un Clipper 32.
| Recurso | Lo que realmente necesita |
|---|---|
| CPU | 8+ núcleos dedicados con AVX-512 para inferencia por CPU |
| RAM | 16 GB para un modelo de 8B en Q4, 64 GB para 70B en Q4 |
| Disco | NVMe Gen4 — los pesos de los modelos son grandes y la latencia de carga importa |
| GPU | Disponible en regiones seleccionadas; pregunta antes de pedir |
La ubicación suele ser la decisión que más importa para esta carga de trabajo, ya sea porque domina la latencia o porque domina la jurisdicción.
Doce núcleos dedicados y 32 GB cubren la mayoría de la inferencia por CPU.
Ollama es la vía más rápida; llama.cpp ofrece un control más fino sobre la cuantización.
Q4_K_M es el punto óptimo habitual entre calidad y velocidad.
LiteLLM o un proxy inverso con autenticación y limitación de velocidad.
Qdrant o pgvector; ambos funcionan cómodamente junto al modelo.
Sí, para modelos pequeños y cuantizados. Un modelo de 8B en Q4 produce aproximadamente 8–15 tokens por segundo en 8 núcleos dedicados modernos — suficiente para un asistente personal o una canalización por lotes, demasiado lento para un producto de chat concurrido.
Aproximadamente el tamaño del archivo de los pesos cuantizados más 2 GB. Un modelo de 8B en Q4 ocupa unos 5 GB, un modelo de 70B en Q4 unos 40 GB.
En regiones seleccionadas, sí. Contacta con nosotros antes de realizar el pedido para que podamos confirmar la disponibilidad y el precio actuales.