Çözüm

AI iş yükleri, LLM çıkarımı ve RAG hatları için VPS

Clipper 16 · $92/moClipper 32 · $174/mo
Kısa cevap

Küçük modeller için CPU çıkarımı uygundur: 4 bit'e nicelenmiş 8 milyar parametreli bir model, 8 özel çekirdek ve 16 GB RAM ile konuşma hızında çalışır. Daha büyük bir şey GPU ister. Kendi kendine barındırılan AI işinin çoğu aslında çevreleyen yığındır — vektör veritabanı, gömme hizmeti, API ağ geçidi — ve bu, bir Clipper 32'de mükemmel şekilde çalışır.

Neye ihtiyacınız var

ai ve llm çıkarımı için asgari özellikler
KaynakGerçekte ihtiyacınız olan
CPUCPU çıkarımı için AVX-512 destekli 8+ özel çekirdek
RAMQ4'te 8B model için 16 GB, Q4'te 70B için 64 GB
DiskNVMe Gen4 — model ağırlıkları büyüktür ve yükleme gecikmesi önemlidir
GPUSeçili bölgelerde mevcuttur; sipariş vermeden önce sorun

Önerilen planlar

Clipper

Clipper 16

$ 87.4 /month

Toplam $262,20 · %5 tasarruf

Sanal CPU
8 × ayrılmış
RAM
16 GB
Depolama
400 GB NVMe Gen4 SSD
Aktarım
30 TB
IPv4 / IPv6
1 / /64 routed
Yapılandır
Clipper

Clipper 32

$ 165.3 /month

Toplam $495,90 · %5 tasarruf

Sanal CPU
12 × ayrılmış
RAM
32 GB
Depolama
800 GB NVMe Gen4 SSD
Aktarım
40 TB
IPv4 / IPv6
1 / /64 routed
Yapılandır
Clipper

Clipper 64

$ 312.55 /month

Toplam $937,65 · %5 tasarruf

Sanal CPU
16 × ayrılmış
RAM
64 GB
Depolama
1.6 TB NVMe Gen4 SSD
Aktarım
50 TB
IPv4 / IPv6
1 / /64 routed
Yapılandır

Önerilen konumlar

Bu iş yükü için en önemli karar genellikle konumdur — ya gecikme baskın olduğu için ya da yargı yetkisi baskın olduğu için.

Bunun için neden OnionVPS?

  • AVX-512 destekli yüksek frekanslı EPYC çekirdekleri, llama.cpp'yi GPU olmadan gerçekten kullanılabilir kılar.
  • NVMe Gen4, 40 GB'lık bir model dosyasını dakikalar yerine saniyeler içinde yükler.
  • Kendi kendine barındırma, hiçbir istemin kontrol ettiğiniz altyapıdan çıkmaması anlamına gelir — çoğu insanın bunu yapmasının asıl nedeni.
  • Bir model aracılığıyla hassas belgeleri işleyen ekipler için gizlilik yargı bölgeleri.

Nasıl kurulur

  1. Ubuntu 24.04 ile bir Clipper 32 dağıtın

    On iki özel çekirdek ve 32 GB, çoğu CPU çıkarımını kapsar.

  2. Ollama veya llama.cpp kurun

    Ollama en hızlı yoldur; llama.cpp, niceme üzerinde daha ince kontrol sağlar.

  3. Niceh bir model indirin

    Q4_K_M, kalite-hız dengesi için en yaygın seçimdir.

  4. Önüne bir API ağ geçidi koyun

    LiteLLM veya kimlik doğrulama ve hız sınırlama içeren bir ters vekil.

  5. RAG oluşturuyorsanız bir vektör veritabanı ekleyin

    Qdrant veya pgvector; ikisi de modelle rahatça çalışır.

Sık sorulan sorular

GPU olmadan bir VPS üzerinde LLM çalıştırabilir misiniz?

Evet, küçük ve niceh modeller için. Q4'teki 8B model, 8 modern özel çekirdekte saniyede kabaca 8-15 token üretir — kişisel bir asistan veya toplu iş hattı için yeterli, yoğun bir sohbet ürünü için çok yavaş.

Yerel bir LLM için ne kadar RAM gerekir?

Niceh ağırlıkların dosya boyutu artı 2 GB. Q4'teki 8B model yaklaşık 5 GB, Q4'teki 70B model yaklaşık 40 GB'dır.

GPU örnekleri sunuyor musunuz?

Bazı bölgelerde, evet. Sipariş vermeden önce bizimle iletişime geçin; mevcut durumu ve fiyatları teyit edelim.