Clipper 16
कुल $262.20 · 5% बचत
- vCPU
- 8 × समर्पित
- RAM
- 16 GB
- स्टोरेज
- 400 GB NVMe Gen4 SSD
- ट्रांसफर
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
समाधान
छोटे मॉडलों के लिए CPU अनुमान व्यवहार्य है: 4 बिट्स पर क्वांटाइज़्ड 8-बिलियन-पैरामीटर मॉडल 8 समर्पित कोर और 16 GB RAM पर संवादी गति पर चलता है। इससे बड़ा कुछ भी GPU चाहता है। अधिकांश सेल्फ-होस्टेड AI कार्य वास्तव में आस-पास का स्टैक है — वेक्टर डेटाबेस, एम्बेडिंग सेवा, API गेटवे — और वह Clipper 32 पर पूरी तरह से चलता है।
| संसाधन | आपको वास्तव में क्या चाहिए |
|---|---|
| CPU | CPU अनुमान के लिए AVX-512 के साथ 8+ समर्पित कोर |
| RAM | Q4 पर 8B मॉडल के लिए 16 GB, Q4 पर 70B के लिए 64 GB |
| डिस्क | NVMe Gen4 — मॉडल वेट बड़े होते हैं और लोड-विलंबता मायने रखती है |
| GPU | चुनिंदा क्षेत्रों में उपलब्ध; ऑर्डर से पहले पूछें |
कुल $262.20 · 5% बचत
कुल $495.90 · 5% बचत
कुल $937.65 · 5% बचत
इस कार्यभार के लिए स्थान आमतौर पर सबसे महत्वपूर्ण निर्णय होता है — या तो विलंबता प्रभावी होती है, या क्षेत्राधिकार।
बारह समर्पित कोर और 32 GB अधिकांश CPU अनुमान को कवर करते हैं।
Ollama सबसे तेज़ मार्ग है; llama.cpp क्वांटाइज़ेशन पर बेहतर नियंत्रण देता है।
Q4_K_M सामान्यतः गुणवत्ता-बनाम-गति का सबसे अच्छा संतुलन है।
LiteLLM या एक रिवर्स प्रॉक्सी जिसमें प्रमाणीकरण और रेट लिमिटिंग हो।
Qdrant या pgvector; दोनों मॉडल के साथ आराम से चलते हैं।
हाँ, छोटे और क्वान्टाइज़्ड मॉडल के लिए। आधुनिक 8 समर्पित कोर पर Q4 का 8B मॉडल लगभग 8–15 टोकन प्रति सेकंड उत्पन्न करता है — व्यक्तिगत सहायक या बैच पाइपलाइन के लिए ठीक, व्यस्त चैट उत्पाद के लिए बहुत धीमा।
लगभग क्वान्टाइज़्ड वेट का फ़ाइल आकार प्लस 2 GB। Q4 का 8B मॉडल लगभग 5 GB है, Q4 का 70B मॉडल लगभग 40 GB।
चयनित क्षेत्रों में, हाँ। वर्तमान उपलब्धता और मूल्य निर्धारण की पुष्टि करने के लिए ऑर्डर करने से पहले हमसे संपर्क करें।