解决方案

适用于 AI 工作负载、LLM 推理和 RAG 管线的 VPS

Clipper 16 · $92/moClipper 32 · $174/mo
简短回答

对于小型模型,CPU 推理是可行的:一个 80 亿参数、4 位量化的模型在 8 个专用核心和 16 GB 内存上能以对话速度运行。更大的模型需要 GPU。大多数自托管 AI 工作实际上是外围技术栈——向量数据库、嵌入服务、API 网关——而这些在 Clipper 32 上运行得非常好。

你需要什么

ai 与 llm 推理 的规格下限
资源你实际需要的东西
CPU8 个以上支持 AVX-512 的专用核心,适用于 CPU 推理
RAM16 GB 内存可运行 8B Q4 模型,64 GB 可运行 70B Q4 模型
磁盘NVMe Gen4——模型权重文件很大,加载延迟至关重要
GPU在部分区域可用;订购前请咨询

推荐套餐

Clipper

Clipper 16

$ 87.4 /month

总计 US$262.20 · 节省 5%

vCPU
8 × 专用
RAM
16 GB
存储
400 GB NVMe Gen4 SSD
流量
30 TB
IPv4 / IPv6
1 / /64 routed
配置
Clipper

Clipper 32

$ 165.3 /month

总计 US$495.90 · 节省 5%

vCPU
12 × 专用
RAM
32 GB
存储
800 GB NVMe Gen4 SSD
流量
40 TB
IPv4 / IPv6
1 / /64 routed
配置
Clipper

Clipper 64

$ 312.55 /month

总计 US$937.65 · 节省 5%

vCPU
16 × 专用
RAM
64 GB
存储
1.6 TB NVMe Gen4 SSD
流量
50 TB
IPv4 / IPv6
1 / /64 routed
配置

推荐位置

对于此工作负载,位置通常是影响最大的决定——要么因为延迟至关重要,要么因为司法管辖区至关重要。

为什么选择OnionVPS

  • 支持 AVX-512 的高频 EPYC 核心使 llama.cpp 在无 GPU 的情况下也能真正可用。
  • NVMe Gen4 可在几秒内加载 40 GB 的模型文件,而非几分钟。
  • 自托管意味着任何提示词都不会离开您控制的基础设施——这是大多数人这样做的真正原因。
  • 适用于通过模型处理敏感文档的团队的隐私司法管辖区。

如何设置

  1. 部署带 Ubuntu 24.04 的 Clipper 32

    十二个专用核心和 32 GB 内存可满足大多数 CPU 推理需求。

  2. 安装 Ollama 或 llama.cpp

    Ollama 是最快的路径;llama.cpp 提供对量化的更细粒度控制。

  3. 拉取量化模型

    Q4_K_M 是通常的质量与速度之间的最佳平衡点。

  4. 在前面放置 API 网关

    使用 LiteLLM 或带身份验证和速率限制的反向代理。

  5. 如果构建 RAG,添加向量数据库

    Qdrant 或 pgvector;两者都可以与模型一起稳定运行。

常见问题

没有 GPU,能在 VPS 上运行 LLM 吗?

可以,对于小型和量化模型来说可以。8B 模型在 Q4 下,在 8 个现代专用核心上大约产生 8-15 tokens/秒——这对个人助手或批处理管道来说足够,但对繁忙的聊天产品来说太慢了。

本地 LLM 需要多少 RAM?

大致为量化权重文件大小加上 2 GB。8B 模型在 Q4 下约为 5 GB,70B 模型在 Q4 下约为 40 GB。

你们提供 GPU 实例吗?

在部分区域提供。订购前请联系我们,以确认当前的可用性和定价。