Solución

VPS para cargas de trabajo de IA, inferencia de LLM y pipelines de RAG

Clipper 16 · $92/moClipper 32 · $174/mo
Respuesta corta

La inferencia por CPU es viable para modelos pequeños: un modelo de 8 mil millones de parámetros cuantizado a 4 bits funciona a velocidad conversacional en 8 núcleos dedicados con 16 GB de RAM. Cualquier cosa más grande requiere GPU. La mayor parte del trabajo de IA autoalojado es en realidad la pila circundante — base de datos vectorial, servicio de embeddings, pasarela API — y eso funciona perfectamente en un Clipper 32.

Qué necesitas

Especificaciones mínimas para inferencia de ia y llm
RecursoLo que realmente necesita
CPU8+ núcleos dedicados con AVX-512 para inferencia por CPU
RAM16 GB para un modelo de 8B en Q4, 64 GB para 70B en Q4
DiscoNVMe Gen4 — los pesos de los modelos son grandes y la latencia de carga importa
GPUDisponible en regiones seleccionadas; pregunta antes de pedir

Planes recomendados

Clipper

Clipper 16

$ 92 /month
vCPU
8 × dedicado
RAM
16 GB
Almacenamiento
400 GB NVMe Gen4 SSD
Transferencia
30 TB
IPv4 / IPv6
1 / /64 routed
Configurar
Clipper

Clipper 32

$ 174 /month
vCPU
12 × dedicado
RAM
32 GB
Almacenamiento
800 GB NVMe Gen4 SSD
Transferencia
40 TB
IPv4 / IPv6
1 / /64 routed
Configurar
Clipper

Clipper 64

$ 329 /month
vCPU
16 × dedicado
RAM
64 GB
Almacenamiento
1.6 TB NVMe Gen4 SSD
Transferencia
50 TB
IPv4 / IPv6
1 / /64 routed
Configurar

Ubicaciones recomendadas

La ubicación suele ser la decisión que más importa para esta carga de trabajo, ya sea porque domina la latencia o porque domina la jurisdicción.

Por qué OnionVPS para esto

  • Los núcleos EPYC de alta frecuencia con AVX-512 hacen que llama.cpp sea realmente utilizable sin GPU.
  • NVMe Gen4 carga un archivo de modelo de 40 GB en segundos en lugar de minutos.
  • El autoalojamiento significa que ningún prompt sale nunca de la infraestructura que controlas — la razón real por la que la mayoría hace esto.
  • Jurisdicciones de privacidad para equipos que procesan documentos sensibles a través de un modelo.

Cómo configurarlo

  1. Despliega un Clipper 32 con Ubuntu 24.04

    Doce núcleos dedicados y 32 GB cubren la mayoría de la inferencia por CPU.

  2. Instala Ollama o llama.cpp

    Ollama es la vía más rápida; llama.cpp ofrece un control más fino sobre la cuantización.

  3. Descarga un modelo cuantizado

    Q4_K_M es el punto óptimo habitual entre calidad y velocidad.

  4. Pon una puerta de enlace API delante

    LiteLLM o un proxy inverso con autenticación y limitación de velocidad.

  5. Añade una base de datos vectorial si estás construyendo RAG

    Qdrant o pgvector; ambos funcionan cómodamente junto al modelo.

Preguntas frecuentes

¿Puedo ejecutar un LLM en un VPS sin GPU?

Sí, para modelos pequeños y cuantizados. Un modelo de 8B en Q4 produce aproximadamente 8–15 tokens por segundo en 8 núcleos dedicados modernos — suficiente para un asistente personal o una canalización por lotes, demasiado lento para un producto de chat concurrido.

¿Cuánta RAM necesita un LLM local?

Aproximadamente el tamaño del archivo de los pesos cuantizados más 2 GB. Un modelo de 8B en Q4 ocupa unos 5 GB, un modelo de 70B en Q4 unos 40 GB.

¿Ofrecéis instancias con GPU?

En regiones seleccionadas, sí. Contacta con nosotros antes de realizar el pedido para que podamos confirmar la disponibilidad y el precio actuales.