Clipper 16
- vCPU
- 8 × dédié
- RAM
- 16 GB
- Stockage
- 400 GB SSD NVMe Gen4
- Transfert
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Solution
L'inférence CPU est viable pour les petits modèles : un modèle de 8 milliards de paramètres quantifié à 4 bits fonctionne à vitesse conversationnelle sur 8 cœurs dédiés avec 16 GB de RAM. Tout ce qui est plus gros nécessite un GPU. La plupart du travail d'IA auto-hébergé est en réalité la pile environnante — base de données vectorielle, service d'embedding, passerelle API — et cela fonctionne parfaitement sur un Clipper 32.
| Ressource | Ce dont vous avez réellement besoin |
|---|---|
| CPU | 8+ cœurs dédiés avec AVX-512 pour l'inférence CPU |
| RAM | 16 GB pour un modèle 8B en Q4, 64 GB pour 70B en Q4 |
| Disque | NVMe Gen4 — les poids de modèles sont volumineux et la latence de chargement compte |
| GPU | Disponible dans certaines régions ; demandez avant de commander |
L'emplacement est généralement la décision la plus importante pour ce type de charge de travail — soit parce que la latence domine, soit parce que la juridiction en fait partie.
Douze cœurs dédiés et 32 GB couvrent la plupart de l'inférence CPU.
Ollama est le chemin le plus rapide ; llama.cpp offre un contrôle plus fin sur la quantification.
Q4_K_M est le compromis habituel entre qualité et vitesse.
LiteLLM ou un reverse proxy avec authentification et limitation de débit.
Qdrant ou pgvector ; les deux fonctionnent confortablement à côté du modèle.
Oui, pour les modèles petits et quantifiés. Un modèle 8B en Q4 produit environ 8 à 15 tokens par seconde sur 8 cœurs dédiés modernes — suffisant pour un assistant personnel ou un pipeline par lots, trop lent pour un produit de chat très fréquenté.
Environ la taille du fichier des poids quantifiés plus 2 Go. Un modèle 8B en Q4 fait environ 5 Go, un modèle 70B en Q4 environ 40 Go.
Dans certaines régions, oui. Contactez-nous avant de commander pour confirmer la disponibilité et le prix actuels.