Solução

VPS para cargas de trabalho de IA, inferência de LLM e pipelines RAG

Clipper 16 · $92/moClipper 32 · $174/mo
Resposta curta

A inferência por CPU é viável para modelos pequenos: um modelo de 8 mil milhões de parâmetros quantizado para 4 bits corre à velocidade de conversação em 8 núcleos dedicados com 16 GB de RAM. Qualquer coisa maior quer uma GPU. A maior parte do trabalho de IA auto-alojada é na verdade a pilha circundante — base de dados vetorial, serviço de embeddings, gateway de API — e isso corre perfeitamente num Clipper 32.

O que precisa

Especificações mínimas para ia e inferência de llm
RecursoO que realmente precisa
CPU8+ núcleos dedicados com AVX-512 para inferência por CPU
RAM16 GB para um modelo 8B em Q4, 64 GB para 70B em Q4
DiscoNVMe Gen4 — os pesos dos modelos são grandes e a latência de carregamento importa
GPUDisponível em regiões selecionadas; pergunte antes de encomendar

Planos recomendados

Clipper

Clipper 16

$ 92 /month
vCPU
8 × dedicado
RAM
16 GB
Armazenamento
400 GB NVMe Gen4 SSD
Transferência
30 TB
IPv4 / IPv6
1 / /64 routed
Configurar
Clipper

Clipper 32

$ 174 /month
vCPU
12 × dedicado
RAM
32 GB
Armazenamento
800 GB NVMe Gen4 SSD
Transferência
40 TB
IPv4 / IPv6
1 / /64 routed
Configurar
Clipper

Clipper 64

$ 329 /month
vCPU
16 × dedicado
RAM
64 GB
Armazenamento
1.6 TB NVMe Gen4 SSD
Transferência
50 TB
IPv4 / IPv6
1 / /64 routed
Configurar

Localizações recomendadas

A localização é geralmente a decisão que mais importa para esta carga de trabalho — seja porque a latência domina, seja porque a jurisdição domina.

Porquê a OnionVPS para isto

  • Núcleos EPYC de alta frequência com AVX-512 tornam o llama.cpp genuinamente utilizável sem GPU.
  • O NVMe Gen4 carrega um ficheiro de modelo de 40 GB em segundos, em vez de minutos.
  • Auto-alojamento significa que nenhum prompt sai da infraestrutura que controla — a verdadeira razão pela qual a maioria das pessoas faz isto.
  • Jurisdições de privacidade para equipas que processam documentos sensíveis através de um modelo.

Como configurar

  1. Implemente um Clipper 32 com Ubuntu 24.04

    Doze núcleos dedicados e 32 GB cobrem a maioria da inferência por CPU.

  2. Instalar o Ollama ou o llama.cpp

    O Ollama é o caminho mais rápido; o llama.cpp dá um controlo mais fino sobre a quantização.

  3. Obter um modelo quantizado

    O Q4_K_M é o equilíbrio habitual entre qualidade e velocidade.

  4. Colocar um gateway de API à frente

    LiteLLM ou um proxy inverso com autenticação e limitação de taxa.

  5. Adicionar uma base de dados vetorial se estiver a criar RAG

    Qdrant ou pgvector; ambos funcionam bem ao lado do modelo.

Perguntas frequentes

É possível executar um LLM num VPS sem GPU?

Sim, para modelos pequenos e quantizados. Um modelo de 8B em Q4 produz aproximadamente 8–15 tokens por segundo em 8 núcleos dedicados modernos — suficiente para um assistente pessoal ou um pipeline de processamento em lote, demasiado lento para um produto de chat com muito tráfego.

Quanta RAM precisa um LLM local?

Aproximadamente o tamanho do ficheiro dos pesos quantizados mais 2 GB. Um modelo de 8B em Q4 tem cerca de 5 GB, um modelo de 70B em Q4 cerca de 40 GB.

Oferecem instâncias com GPU?

Em regiões selecionadas, sim. Contacte-nos antes de encomendar para confirmarmos a disponibilidade e os preços atuais.