समाधान

AI कार्यभार, LLM अनुमान और RAG पाइपलाइनों के लिए VPS

Clipper 16 · $92/moClipper 32 · $174/mo
संक्षिप्त उत्तर

छोटे मॉडलों के लिए CPU अनुमान व्यवहार्य है: 4 बिट्स पर क्वांटाइज़्ड 8-बिलियन-पैरामीटर मॉडल 8 समर्पित कोर और 16 GB RAM पर संवादी गति पर चलता है। इससे बड़ा कुछ भी GPU चाहता है। अधिकांश सेल्फ-होस्टेड AI कार्य वास्तव में आस-पास का स्टैक है — वेक्टर डेटाबेस, एम्बेडिंग सेवा, API गेटवे — और वह Clipper 32 पर पूरी तरह से चलता है।

आपको क्या चाहिए

ai और llm अनुमान के लिए न्यूनतम विनिर्देश
संसाधनआपको वास्तव में क्या चाहिए
CPUCPU अनुमान के लिए AVX-512 के साथ 8+ समर्पित कोर
RAMQ4 पर 8B मॉडल के लिए 16 GB, Q4 पर 70B के लिए 64 GB
डिस्कNVMe Gen4 — मॉडल वेट बड़े होते हैं और लोड-विलंबता मायने रखती है
GPUचुनिंदा क्षेत्रों में उपलब्ध; ऑर्डर से पहले पूछें

अनुशंसित योजनाएँ

Clipper

Clipper 16

$ 87.4 /month

कुल $262.20 · 5% बचत

vCPU
8 × समर्पित
RAM
16 GB
स्टोरेज
400 GB NVMe Gen4 SSD
ट्रांसफर
30 TB
IPv4 / IPv6
1 / /64 routed
कॉन्फ़िगर करें
Clipper

Clipper 32

$ 165.3 /month

कुल $495.90 · 5% बचत

vCPU
12 × समर्पित
RAM
32 GB
स्टोरेज
800 GB NVMe Gen4 SSD
ट्रांसफर
40 TB
IPv4 / IPv6
1 / /64 routed
कॉन्फ़िगर करें
Clipper

Clipper 64

$ 312.55 /month

कुल $937.65 · 5% बचत

vCPU
16 × समर्पित
RAM
64 GB
स्टोरेज
1.6 TB NVMe Gen4 SSD
ट्रांसफर
50 TB
IPv4 / IPv6
1 / /64 routed
कॉन्फ़िगर करें

अनुशंसित स्थान

इस कार्यभार के लिए स्थान आमतौर पर सबसे महत्वपूर्ण निर्णय होता है — या तो विलंबता प्रभावी होती है, या क्षेत्राधिकार।

इसके लिए OnionVPS क्यों

  • AVX-512 के साथ उच्च-आवृत्ति EPYC कोर llama.cpp को GPU के बिना वास्तव में उपयोग योग्य बनाते हैं।
  • NVMe Gen4 40 GB मॉडल फ़ाइल को मिनटों के बजाय सेकंड में लोड करता है।
  • सेल्फ-होस्टिंग का अर्थ है कि कोई प्रॉम्प्ट उस इन्फ्रास्ट्रक्चर को कभी नहीं छोड़ता जिसे आप नियंत्रित करते हैं — अधिकांश लोग ऐसा करने का वास्तविक कारण।
  • संवेदनशील दस्तावेज़ों को मॉडल के माध्यम से संसाधित करने वाली टीमों के लिए गोपनीयता क्षेत्राधिकार।

इसे कैसे सेट करें

  1. Ubuntu 24.04 के साथ Clipper 32 तैनात करें

    बारह समर्पित कोर और 32 GB अधिकांश CPU अनुमान को कवर करते हैं।

  2. Ollama या llama.cpp स्थापित करें

    Ollama सबसे तेज़ मार्ग है; llama.cpp क्वांटाइज़ेशन पर बेहतर नियंत्रण देता है।

  3. एक क्वान्टाइज़्ड मॉडल खींचें

    Q4_K_M सामान्यतः गुणवत्ता-बनाम-गति का सबसे अच्छा संतुलन है।

  4. सामने एक API गेटवे रखें

    LiteLLM या एक रिवर्स प्रॉक्सी जिसमें प्रमाणीकरण और रेट लिमिटिंग हो।

  5. अगर आप RAG बना रहे हैं तो एक वेक्टर डेटाबेस जोड़ें

    Qdrant या pgvector; दोनों मॉडल के साथ आराम से चलते हैं।

अक्सर पूछे जाने वाले प्रश्न

क्या आप GPU के बिना VPS पर LLM चला सकते हैं?

हाँ, छोटे और क्वान्टाइज़्ड मॉडल के लिए। आधुनिक 8 समर्पित कोर पर Q4 का 8B मॉडल लगभग 8–15 टोकन प्रति सेकंड उत्पन्न करता है — व्यक्तिगत सहायक या बैच पाइपलाइन के लिए ठीक, व्यस्त चैट उत्पाद के लिए बहुत धीमा।

स्थानीय LLM के लिए कितनी RAM चाहिए?

लगभग क्वान्टाइज़्ड वेट का फ़ाइल आकार प्लस 2 GB। Q4 का 8B मॉडल लगभग 5 GB है, Q4 का 70B मॉडल लगभग 40 GB।

क्या आप GPU इंस्टेंस प्रदान करते हैं?

चयनित क्षेत्रों में, हाँ। वर्तमान उपलब्धता और मूल्य निर्धारण की पुष्टि करने के लिए ऑर्डर करने से पहले हमसे संपर्क करें।