Lösung

VPS für KI-Workloads, LLM-Inferenz und RAG-Pipelines

Clipper 16 · $92/moClipper 32 · $174/mo
Kurze Antwort

CPU-Inferenz ist für kleine Modelle praktikabel: Ein auf 4 Bit quantisiertes 8-Milliarden-Parameter-Modell läuft mit Gesprächsgeschwindigkeit auf 8 dedizierten Kernen mit 16 GB RAM. Alles Größere benötigt eine GPU. Der Großteil der selbst gehosteten KI-Arbeit ist eigentlich der umgebende Stack – Vektordatenbank, Embedding-Dienst, API-Gateway – und der läuft auf einem Clipper 32 einwandfrei.

Was Sie benötigen

Mindestspezifikation für ki & llm-inferenz
RessourceWas Sie tatsächlich benötigen
CPU8+ dedizierte Kerne mit AVX-512 für CPU-Inferenz
RAM16 GB für ein 8B-Modell bei Q4, 64 GB für 70B bei Q4
FestplatteNVMe Gen4 – Modellgewichte sind groß und die Ladezeit ist entscheidend
GPUIn ausgewählten Regionen verfügbar; fragen Sie vor der Bestellung an

Empfohlene Tarife

Clipper

Clipper 16

$ 87.4 /month

262,20 $ gesamt · 5% sparen

vCPU
8 × dediziert
RAM
16 GB
Speicher
400 GB NVMe Gen4 SSD
Transfer
30 TB
IPv4 / IPv6
1 / /64 routed
Konfigurieren
Clipper

Clipper 32

$ 165.3 /month

495,90 $ gesamt · 5% sparen

vCPU
12 × dediziert
RAM
32 GB
Speicher
800 GB NVMe Gen4 SSD
Transfer
40 TB
IPv4 / IPv6
1 / /64 routed
Konfigurieren
Clipper

Clipper 64

$ 312.55 /month

937,65 $ gesamt · 5% sparen

vCPU
16 × dediziert
RAM
64 GB
Speicher
1.6 TB NVMe Gen4 SSD
Transfer
50 TB
IPv4 / IPv6
1 / /64 routed
Konfigurieren

Empfohlene Standorte

Der Standort ist normalerweise die Entscheidung, die für diese Arbeitslast am wichtigsten ist – entweder weil die Latenz dominiert oder weil die Rechtshoheit entscheidend ist.

Warum OnionVPS dafür

  • Hochfrequente EPYC-Kerne mit AVX-512 machen llama.cpp auch ohne GPU wirklich nutzbar.
  • NVMe Gen4 lädt eine 40-GB-Modelldatei in Sekunden statt Minuten.
  • Beim Selbsthosten verlässt kein Prompt die von Ihnen kontrollierte Infrastruktur – der eigentliche Grund, warum die meisten dies tun.
  • Datenschutz-Jurisdiktionen für Teams, die vertrauliche Dokumente durch ein Modell verarbeiten.

So richten Sie es ein

  1. Stellen Sie einen Clipper 32 mit Ubuntu 24.04 bereit

    Zwölf dedizierte Kerne und 32 GB decken die meisten CPU-Inferenzen ab.

  2. Installieren Sie Ollama oder llama.cpp

    Ollama ist der schnellste Weg; llama.cpp bietet feinere Kontrolle über die Quantisierung.

  3. Ein quantisiertes Modell laden

    Q4_K_M ist der übliche Kompromiss zwischen Qualität und Geschwindigkeit.

  4. Einen API-Gateway davorstellen

    LiteLLM oder ein Reverse-Proxy mit Authentifizierung und Rate Limiting.

  5. Eine Vektordatenbank hinzufügen, wenn Sie RAG aufbauen

    Qdrant oder pgvector; beide laufen problemlos neben dem Modell.

Häufig gestellte Fragen

Kann man ein LLM auf einem VPS ohne GPU ausführen?

Ja, für kleine und quantisierte Modelle. Ein 8B-Modell bei Q4 erzeugt etwa 8–15 Token pro Sekunde auf 8 modernen dedizierten Kernen – ausreichend für einen persönlichen Assistenten oder eine Batch-Pipeline, zu langsam für einen stark frequentierten Chat-Dienst.

Wie viel RAM benötigt ein lokales LLM?

Ungefähr die Dateigröße der quantisierten Gewichte plus 2 GB. Ein 8B-Modell bei Q4 hat etwa 5 GB, ein 70B-Modell bei Q4 etwa 40 GB.

Bieten Sie GPU-Instanzen an?

In ausgewählten Regionen, ja. Kontaktieren Sie uns vor der Bestellung, damit wir die aktuelle Verfügbarkeit und Preise bestätigen können.