Решение

VPS для ИИ-нагрузок, вывода LLM и RAG-пайплайнов

Clipper 16 · $92/moClipper 32 · $174/mo
Краткий ответ

Вывод на CPU возможен для небольших моделей: модель с 8 млрд параметров, квантованная до 4 бит, работает на скорости разговора на 8 выделенных ядрах с 16 ГБ RAM. Всё, что больше, требует GPU. На самом деле большая часть самодеплойного ИИ — это окружающий стек: векторная база данных, сервис эмбеддингов, API-шлюз — и это прекрасно работает на Clipper 32.

Что вам нужно

Минимальные характеристики для ии и вывод моделей llm
РесурсЧто вам нужно на самом деле
CPUОт 8 выделенных ядер с AVX-512 для вывода на CPU
RAM16 ГБ для модели 8B в Q4, 64 ГБ для 70B в Q4
ДискNVMe Gen4 — веса моделей большие, и задержка загрузки важна
GPUДоступно в отдельных регионах; уточняйте перед заказом

Рекомендуемые тарифы

Clipper

Clipper 16

$ 87.4 /month

Итого 262,20 $ · Скидка 5%

vCPU
8 × dedicated
RAM
16 GB
Диск
400 GB NVMe Gen4 SSD
Трафик
30 TB
IPv4 / IPv6
1 / /64 routed
Настроить
Clipper

Clipper 32

$ 165.3 /month

Итого 495,90 $ · Скидка 5%

vCPU
12 × dedicated
RAM
32 GB
Диск
800 GB NVMe Gen4 SSD
Трафик
40 TB
IPv4 / IPv6
1 / /64 routed
Настроить
Clipper

Clipper 64

$ 312.55 /month

Итого 937,65 $ · Скидка 5%

vCPU
16 × dedicated
RAM
64 GB
Диск
1.6 TB NVMe Gen4 SSD
Трафик
50 TB
IPv4 / IPv6
1 / /64 routed
Настроить

Рекомендуемые местоположения

Местоположение обычно является решающим фактором для этой нагрузки — либо из-за задержек, либо из-за юрисдикции.

Почему OnionVPS для этого

  • Высокочастотные ядра EPYC с AVX-512 делают llama.cpp реально полезным без GPU.
  • NVMe Gen4 загружает файл модели на 40 ГБ за секунды, а не за минуты.
  • Самодеплой означает, что ни один промпт не покидает инфраструктуру под вашим контролем — вот настоящая причина, по которой это делают.
  • Юрисдикции с приватностью для команд, обрабатывающих чувствительные документы через модель.

Как настроить

  1. Разверните Clipper 32 с Ubuntu 24.04

    Двенадцать выделенных ядер и 32 ГБ покрывают большинство выводов на CPU.

  2. Установите Ollama или llama.cpp

    Ollama — самый быстрый путь; llama.cpp даёт более тонкий контроль над квантованием.

  3. Загрузите квантизованную модель

    Q4_K_M — обычная золотая середина между качеством и скоростью.

  4. Поставьте API-шлюз перед ней

    LiteLLM или обратный прокси с аутентификацией и ограничением частоты запросов.

  5. Добавьте векторную базу данных, если строите RAG

    Qdrant или pgvector; обе спокойно работают рядом с моделью.

Часто задаваемые вопросы

Можно ли запустить LLM на VPS без GPU?

Да, для небольших и квантизованных моделей. Модель 8B в Q4 выдаёт примерно 8–15 токенов в секунду на 8 современных выделенных ядрах — достаточно для личного ассистента или пакетного конвейера, но слишком медленно для загруженного чат-продукта.

Сколько оперативной памяти нужно локальной LLM?

Примерно размер файла квантизованных весов плюс 2 ГБ. Модель 8B в Q4 — около 5 ГБ, модель 70B в Q4 — около 40 ГБ.

Предоставляете ли вы GPU-инстансы?

В отдельных регионах — да. Свяжитесь с нами перед заказом, чтобы подтвердить текущую доступность и цены.