Solution

VPS pour charges de travail IA, inférence LLM et pipelines RAG

Clipper 16 · $92/moClipper 32 · $174/mo
Réponse courte

L'inférence CPU est viable pour les petits modèles : un modèle de 8 milliards de paramètres quantifié à 4 bits fonctionne à vitesse conversationnelle sur 8 cœurs dédiés avec 16 GB de RAM. Tout ce qui est plus gros nécessite un GPU. La plupart du travail d'IA auto-hébergé est en réalité la pile environnante — base de données vectorielle, service d'embedding, passerelle API — et cela fonctionne parfaitement sur un Clipper 32.

Ce dont vous avez besoin

Plancher de spécifications pour ia et inférence llm
RessourceCe dont vous avez réellement besoin
CPU8+ cœurs dédiés avec AVX-512 pour l'inférence CPU
RAM16 GB pour un modèle 8B en Q4, 64 GB pour 70B en Q4
DisqueNVMe Gen4 — les poids de modèles sont volumineux et la latence de chargement compte
GPUDisponible dans certaines régions ; demandez avant de commander

Plans recommandés

Clipper

Clipper 16

$ 92 /month
vCPU
8 × dédié
RAM
16 GB
Stockage
400 GB SSD NVMe Gen4
Transfert
30 TB
IPv4 / IPv6
1 / /64 routed
Configurer
Clipper

Clipper 32

$ 174 /month
vCPU
12 × dédié
RAM
32 GB
Stockage
800 GB SSD NVMe Gen4
Transfert
40 TB
IPv4 / IPv6
1 / /64 routed
Configurer
Clipper

Clipper 64

$ 329 /month
vCPU
16 × dédié
RAM
64 GB
Stockage
1.6 TB SSD NVMe Gen4
Transfert
50 TB
IPv4 / IPv6
1 / /64 routed
Configurer

Emplacements recommandés

L'emplacement est généralement la décision la plus importante pour ce type de charge de travail — soit parce que la latence domine, soit parce que la juridiction en fait partie.

Pourquoi OnionVPS pour cela

  • Des cœurs EPYC haute fréquence avec AVX-512 rendent llama.cpp réellement utilisable sans GPU.
  • Le NVMe Gen4 charge un fichier de modèle de 40 GB en quelques secondes plutôt qu'en minutes.
  • L'auto-hébergement signifie qu'aucun prompt ne quitte jamais l'infrastructure que vous contrôlez — c'est la vraie raison pour laquelle la plupart des gens font cela.
  • Juridictions de confidentialité pour les équipes traitant des documents sensibles via un modèle.

Comment le configurer

  1. Déployez un Clipper 32 avec Ubuntu 24.04

    Douze cœurs dédiés et 32 GB couvrent la plupart de l'inférence CPU.

  2. Installez Ollama ou llama.cpp

    Ollama est le chemin le plus rapide ; llama.cpp offre un contrôle plus fin sur la quantification.

  3. Téléchargez un modèle quantifié

    Q4_K_M est le compromis habituel entre qualité et vitesse.

  4. Placez une passerelle API devant

    LiteLLM ou un reverse proxy avec authentification et limitation de débit.

  5. Ajoutez une base de données vectorielle si vous construisez un RAG

    Qdrant ou pgvector ; les deux fonctionnent confortablement à côté du modèle.

Questions fréquemment posées

Peut-on exécuter un LLM sur un VPS sans GPU ?

Oui, pour les modèles petits et quantifiés. Un modèle 8B en Q4 produit environ 8 à 15 tokens par seconde sur 8 cœurs dédiés modernes — suffisant pour un assistant personnel ou un pipeline par lots, trop lent pour un produit de chat très fréquenté.

De combien de RAM un LLM local a-t-il besoin ?

Environ la taille du fichier des poids quantifiés plus 2 Go. Un modèle 8B en Q4 fait environ 5 Go, un modèle 70B en Q4 environ 40 Go.

Proposez-vous des instances GPU ?

Dans certaines régions, oui. Contactez-nous avant de commander pour confirmer la disponibilité et le prix actuels.