Solusi

VPS untuk beban kerja AI, inferensi LLM, dan pipeline RAG

Clipper 16 · $92/moClipper 32 · $174/mo
Jawaban singkat

Inferensi CPU layak digunakan untuk model kecil: model dengan parameter 8 miliar yang dikuantisasi ke 4 bit berjalan dengan kecepatan percakapan pada 8 inti khusus dengan RAM 16 GB. Apa pun yang lebih besar membutuhkan GPU. Sebagian besar pekerjaan AI yang dihosting sendiri sebenarnya adalah tumpukan di sekitarnya — basis data vektor, layanan penyematan, gerbang API — dan itu berjalan sangat baik di Clipper 32.

Apa yang Anda butuhkan

Batas bawah spesifikasi untuk inferensi ai & llm
Sumber dayaApa yang sebenarnya Anda butuhkan
CPU8+ inti khusus dengan AVX-512 untuk inferensi CPU
RAM16 GB untuk model 8B pada Q4, 64 GB untuk 70B pada Q4
DiskNVMe Gen4 — bobot model besar dan latensi pemuatan penting
GPUTersedia di wilayah tertentu; tanyakan sebelum memesan

Paket yang direkomendasikan

Clipper

Clipper 16

$ 87.4 /month

US$262,20 total · Hemat 5%

vCPU
8 × khusus
RAM
16 GB
Penyimpanan
400 GB NVMe Gen4 SSD
Transfer
30 TB
IPv4 / IPv6
1 / /64 routed
Konfigurasi
Clipper

Clipper 32

$ 165.3 /month

US$495,90 total · Hemat 5%

vCPU
12 × khusus
RAM
32 GB
Penyimpanan
800 GB NVMe Gen4 SSD
Transfer
40 TB
IPv4 / IPv6
1 / /64 routed
Konfigurasi
Clipper

Clipper 64

$ 312.55 /month

US$937,65 total · Hemat 5%

vCPU
16 × khusus
RAM
64 GB
Penyimpanan
1.6 TB NVMe Gen4 SSD
Transfer
50 TB
IPv4 / IPv6
1 / /64 routed
Konfigurasi

Lokasi yang direkomendasikan

Lokasi biasanya adalah keputusan yang paling menentukan untuk beban kerja ini — baik karena latensi mendominasi, atau karena yurisdiksi yang menentukan.

Mengapa OnionVPS untuk ini

  • Inti EPYC frekuensi tinggi dengan AVX-512 membuat llama.cpp benar-benar dapat digunakan tanpa GPU.
  • NVMe Gen4 memuat file model 40 GB dalam hitungan detik, bukan menit.
  • Self-hosting berarti tidak ada prompt yang pernah meninggalkan infrastruktur yang Anda kendalikan — alasan sebenarnya kebanyakan orang melakukan ini.
  • Yurisdiksi privasi untuk tim yang memproses dokumen sensitif melalui model.

Cara mengaturnya

  1. Deploy Clipper 32 dengan Ubuntu 24.04

    Dua belas inti khusus dan 32 GB mencakup sebagian besar inferensi CPU.

  2. Instal Ollama atau llama.cpp

    Ollama adalah jalur tercepat; llama.cpp memberikan kontrol lebih halus atas kuantisasi.

  3. Menarik model terkuantisasi

    Q4_K_M adalah titik keseimbangan umum antara kualitas dan kecepatan.

  4. Letakkan gateway API di depan

    LiteLLM atau reverse proxy dengan autentikasi dan pembatasan laju.

  5. Tambahkan basis data vektor jika Anda membangun RAG

    Qdrant atau pgvector; keduanya berjalan nyaman berdampingan dengan model.

Pertanyaan yang sering diajukan

Bisakah Anda menjalankan LLM di VPS tanpa GPU?

Ya, untuk model kecil dan terkuantisasi. Model 8B pada Q4 menghasilkan kira-kira 8–15 token per detik pada 8 inti khusus modern — cukup untuk asisten pribadi atau jalur pemrosesan batch, terlalu lambat untuk produk obrolan yang sibuk.

Berapa banyak RAM yang dibutuhkan LLM lokal?

Kira-kira ukuran file dari bobot terkuantisasi ditambah 2 GB. Model 8B pada Q4 sekitar 5 GB, model 70B pada Q4 sekitar 40 GB.

Apakah Anda menawarkan instance GPU?

Di wilayah tertentu, ya. Hubungi kami sebelum memesan agar kami dapat mengonfirmasi ketersediaan dan harga saat ini.