Clipper 16
Итого 262,20 $ · Скидка 5%
- vCPU
- 8 × dedicated
- RAM
- 16 GB
- Диск
- 400 GB NVMe Gen4 SSD
- Трафик
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
Решение
Вывод на CPU возможен для небольших моделей: модель с 8 млрд параметров, квантованная до 4 бит, работает на скорости разговора на 8 выделенных ядрах с 16 ГБ RAM. Всё, что больше, требует GPU. На самом деле большая часть самодеплойного ИИ — это окружающий стек: векторная база данных, сервис эмбеддингов, API-шлюз — и это прекрасно работает на Clipper 32.
| Ресурс | Что вам нужно на самом деле |
|---|---|
| CPU | От 8 выделенных ядер с AVX-512 для вывода на CPU |
| RAM | 16 ГБ для модели 8B в Q4, 64 ГБ для 70B в Q4 |
| Диск | NVMe Gen4 — веса моделей большие, и задержка загрузки важна |
| GPU | Доступно в отдельных регионах; уточняйте перед заказом |
Итого 262,20 $ · Скидка 5%
Итого 495,90 $ · Скидка 5%
Итого 937,65 $ · Скидка 5%
Местоположение обычно является решающим фактором для этой нагрузки — либо из-за задержек, либо из-за юрисдикции.
Двенадцать выделенных ядер и 32 ГБ покрывают большинство выводов на CPU.
Ollama — самый быстрый путь; llama.cpp даёт более тонкий контроль над квантованием.
Q4_K_M — обычная золотая середина между качеством и скоростью.
LiteLLM или обратный прокси с аутентификацией и ограничением частоты запросов.
Qdrant или pgvector; обе спокойно работают рядом с моделью.
Да, для небольших и квантизованных моделей. Модель 8B в Q4 выдаёт примерно 8–15 токенов в секунду на 8 современных выделенных ядрах — достаточно для личного ассистента или пакетного конвейера, но слишком медленно для загруженного чат-продукта.
Примерно размер файла квантизованных весов плюс 2 ГБ. Модель 8B в Q4 — около 5 ГБ, модель 70B в Q4 — около 40 ГБ.
В отдельных регионах — да. Свяжитесь с нами перед заказом, чтобы подтвердить текущую доступность и цены.