Clipper 16
合計$262.20 · 5%割引
- vCPU
- 8 × 専用
- RAM
- 16 GB
- ストレージ
- 400 GB NVMe Gen4 SSD
- 転送量
- 30 TB
- IPv4 / IPv6
- 1 / /64 routed
解決策
对于小模型,CPU 推理可行:一个 80 亿参数的模型经过 4 位量化后,可在 8 个专用核心和 16 GB 内存上以对话速度运行。更大的模型则需要 GPU。大多数自托管 AI 工作实际上是周边栈——向量数据库、嵌入服务、API 网关——这些在 Clipper 32 上运行得非常好。
| リソース | 実際に必要なもの |
|---|---|
| CPU | 8+ 专用核心,支持 AVX-512,用于 CPU 推理 |
| RAM | 16 GB 用于 8B 模型(Q4 量化),64 GB 用于 70B 模型(Q4 量化) |
| ディスク | NVMe Gen4——模型权重很大,加载延迟很重要 |
| GPU | 在特定区域可用;下单前请咨询 |
合計$262.20 · 5%割引
合計$495.90 · 5%割引
合計$937.65 · 5%割引
このワークロードでは、通常ロケーションの選択が最も重要です—レイテンシが支配的になるか、管轄権が支配的になるかのどちらかだからです。
12 个专用核心和 32 GB 可覆盖大多数 CPU 推理。
Ollama 是最快路径;llama.cpp 提供对量化更精细的控制。
Q4_K_Mは、品質と速度の一般的なスイートスポットです。
LiteLLMまたは認証とレート制限を備えたリバースプロキシ。
Qdrantまたはpgvector。どちらもモデルと一緒に快適に実行できます。
はい、小規模で量子化されたモデルであれば可能です。Q4の8Bモデルは、最新の専用コア8つで毎秒約8~15トークンを生成します。個人用アシスタントやバッチパイプラインには十分ですが、混雑するチャット製品には遅すぎます。
量子化された重みのファイルサイズに約2GBを加えたもの。Q4の8Bモデルは約5GB、Q4の70Bモデルは約40GBです。
一部の地域では提供しています。注文前にご連絡いただければ、現在の在庫状況と価格を確認いたします。