Soluzione

VPS per carichi di lavoro AI, inferenza LLM e pipeline RAG

Clipper 16 · $92/moClipper 32 · $174/mo
Risposta breve

L'inferenza su CPU è praticabile per modelli piccoli: un modello da 8 miliardi di parametri quantizzato a 4 bit gira a velocità di conversazione su 8 core dedicati con 16 GB di RAM. Qualcosa di più grande richiede una GPU. La maggior parte del lavoro AI self-hosted è in realtà lo stack circostante — database vettoriale, servizio di embedding, API gateway — e funziona perfettamente su un Clipper 32.

Cosa ti serve

Specifiche minime per inferenza ai e llm
RisorsaCosa ti serve davvero
CPU8+ core dedicati con AVX-512 per inferenza su CPU
RAM16 GB per un modello 8B a Q4, 64 GB per 70B a Q4
DiscoNVMe Gen4 — i pesi dei modelli sono grandi e la latenza di caricamento conta
GPUDisponibile in regioni selezionate; chiedere prima di ordinare

Piani consigliati

Clipper

Clipper 16

$ 87.4 /month

262,20 USD totale · Risparmia 5%

vCPU
8 × dedicato
RAM
16 GB
Archiviazione
400 GB NVMe Gen4 SSD
Trasferimento
30 TB
IPv4 / IPv6
1 / /64 routed
Configura
Clipper

Clipper 32

$ 165.3 /month

495,90 USD totale · Risparmia 5%

vCPU
12 × dedicato
RAM
32 GB
Archiviazione
800 GB NVMe Gen4 SSD
Trasferimento
40 TB
IPv4 / IPv6
1 / /64 routed
Configura
Clipper

Clipper 64

$ 312.55 /month

937,65 USD totale · Risparmia 5%

vCPU
16 × dedicato
RAM
64 GB
Archiviazione
1.6 TB NVMe Gen4 SSD
Trasferimento
50 TB
IPv4 / IPv6
1 / /64 routed
Configura

Posizioni consigliate

La posizione è solitamente la decisione più importante per questo carico di lavoro — perché la latenza domina, o perché la giurisdizione conta.

Perché OnionVPS per questo

  • Core EPYC ad alta frequenza con AVX-512 rendono llama.cpp davvero utilizzabile senza GPU.
  • NVMe Gen4 carica un file di modello da 40 GB in pochi secondi, non minuti.
  • L'hosting autonomo significa che nessun prompt lascia mai un'infrastruttura che controlli — il vero motivo per cui la maggior parte delle persone lo fa.
  • Giurisdizioni sulla privacy per team che elaborano documenti sensibili tramite un modello.

Come configurarlo

  1. Distribuisci un Clipper 32 con Ubuntu 24.04

    Dodici core dedicati e 32 GB coprono la maggior parte dell'inferenza su CPU.

  2. Installa Ollama o llama.cpp

    Ollama è la via più rapida; llama.cpp offre un controllo più fine sulla quantizzazione.

  3. Esegui il pull di un modello quantizzato

    Q4_K_M è il punto di equilibrio abituale tra qualità e velocità.

  4. Metti un gateway API davanti

    LiteLLM o un reverse proxy con autenticazione e rate limiting.

  5. Aggiungi un database vettoriale se stai costruendo un RAG

    Qdrant o pgvector; entrambi funzionano comodamente accanto al modello.

Domande frequenti

Puoi eseguire un LLM su un VPS senza GPU?

Sì, per modelli piccoli e quantizzati. Un modello 8B in Q4 produce circa 8–15 token al secondo su 8 core moderni dedicati — sufficiente per un assistente personale o una pipeline batch, troppo lento per un prodotto chat affollato.

Quanta RAM serve per un LLM locale?

Circa la dimensione del file dei pesi quantizzati più 2 GB. Un modello 8B in Q4 è circa 5 GB, un modello 70B in Q4 circa 40 GB.

Offrite istanze GPU?

In alcune regioni selezionate, sì. Contattaci prima di ordinare per confermare la disponibilità attuale e i prezzi.