Clipper 16
262,20 $ gesamt · 5% sparen
- vCPU
- 8 × dediziert
- RAM
- 16 GB
- Speicher
- 400 GB NVMe Gen4 SSD
- Transfer
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Lösung
CPU-Inferenz ist für kleine Modelle praktikabel: Ein auf 4 Bit quantisiertes 8-Milliarden-Parameter-Modell läuft mit Gesprächsgeschwindigkeit auf 8 dedizierten Kernen mit 16 GB RAM. Alles Größere benötigt eine GPU. Der Großteil der selbst gehosteten KI-Arbeit ist eigentlich der umgebende Stack – Vektordatenbank, Embedding-Dienst, API-Gateway – und der läuft auf einem Clipper 32 einwandfrei.
| Ressource | Was Sie tatsächlich benötigen |
|---|---|
| CPU | 8+ dedizierte Kerne mit AVX-512 für CPU-Inferenz |
| RAM | 16 GB für ein 8B-Modell bei Q4, 64 GB für 70B bei Q4 |
| Festplatte | NVMe Gen4 – Modellgewichte sind groß und die Ladezeit ist entscheidend |
| GPU | In ausgewählten Regionen verfügbar; fragen Sie vor der Bestellung an |
262,20 $ gesamt · 5% sparen
495,90 $ gesamt · 5% sparen
937,65 $ gesamt · 5% sparen
Der Standort ist normalerweise die Entscheidung, die für diese Arbeitslast am wichtigsten ist – entweder weil die Latenz dominiert oder weil die Rechtshoheit entscheidend ist.
Zwölf dedizierte Kerne und 32 GB decken die meisten CPU-Inferenzen ab.
Ollama ist der schnellste Weg; llama.cpp bietet feinere Kontrolle über die Quantisierung.
Q4_K_M ist der übliche Kompromiss zwischen Qualität und Geschwindigkeit.
LiteLLM oder ein Reverse-Proxy mit Authentifizierung und Rate Limiting.
Qdrant oder pgvector; beide laufen problemlos neben dem Modell.
Ja, für kleine und quantisierte Modelle. Ein 8B-Modell bei Q4 erzeugt etwa 8–15 Token pro Sekunde auf 8 modernen dedizierten Kernen – ausreichend für einen persönlichen Assistenten oder eine Batch-Pipeline, zu langsam für einen stark frequentierten Chat-Dienst.
Ungefähr die Dateigröße der quantisierten Gewichte plus 2 GB. Ein 8B-Modell bei Q4 hat etwa 5 GB, ein 70B-Modell bei Q4 etwa 40 GB.
In ausgewählten Regionen, ja. Kontaktieren Sie uns vor der Bestellung, damit wir die aktuelle Verfügbarkeit und Preise bestätigen können.