Clipper 16
$ 87.4 /month
总计 US$262.20 · 节省 5%
- vCPU
- 8 × 专用
- RAM
- 16 GB
- 存储
- 400 GB NVMe Gen4 SSD
- 流量
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
解决方案
对于小型模型,CPU 推理是可行的:一个 80 亿参数、4 位量化的模型在 8 个专用核心和 16 GB 内存上能以对话速度运行。更大的模型需要 GPU。大多数自托管 AI 工作实际上是外围技术栈——向量数据库、嵌入服务、API 网关——而这些在 Clipper 32 上运行得非常好。
| 资源 | 你实际需要的东西 |
|---|---|
| CPU | 8 个以上支持 AVX-512 的专用核心,适用于 CPU 推理 |
| RAM | 16 GB 内存可运行 8B Q4 模型,64 GB 可运行 70B Q4 模型 |
| 磁盘 | NVMe Gen4——模型权重文件很大,加载延迟至关重要 |
| GPU | 在部分区域可用;订购前请咨询 |
总计 US$262.20 · 节省 5%
总计 US$495.90 · 节省 5%
总计 US$937.65 · 节省 5%
对于此工作负载,位置通常是影响最大的决定——要么因为延迟至关重要,要么因为司法管辖区至关重要。
十二个专用核心和 32 GB 内存可满足大多数 CPU 推理需求。
Ollama 是最快的路径;llama.cpp 提供对量化的更细粒度控制。
Q4_K_M 是通常的质量与速度之间的最佳平衡点。
使用 LiteLLM 或带身份验证和速率限制的反向代理。
Qdrant 或 pgvector;两者都可以与模型一起稳定运行。
可以,对于小型和量化模型来说可以。8B 模型在 Q4 下,在 8 个现代专用核心上大约产生 8-15 tokens/秒——这对个人助手或批处理管道来说足够,但对繁忙的聊天产品来说太慢了。
大致为量化权重文件大小加上 2 GB。8B 模型在 Q4 下约为 5 GB,70B 模型在 Q4 下约为 40 GB。
在部分区域提供。订购前请联系我们,以确认当前的可用性和定价。