解決策

适用于 AI 工作负载、LLM 推理和 RAG 管道的 VPS

Clipper 16 · $92/moClipper 32 · $174/mo
短い回答

对于小模型,CPU 推理可行:一个 80 亿参数的模型经过 4 位量化后,可在 8 个专用核心和 16 GB 内存上以对话速度运行。更大的模型则需要 GPU。大多数自托管 AI 工作实际上是周边栈——向量数据库、嵌入服务、API 网关——这些在 Clipper 32 上运行得非常好。

必要なもの

ai 与 llm 推理の仕様の下限
リソース実際に必要なもの
CPU8+ 专用核心,支持 AVX-512,用于 CPU 推理
RAM16 GB 用于 8B 模型(Q4 量化),64 GB 用于 70B 模型(Q4 量化)
ディスクNVMe Gen4——模型权重很大,加载延迟很重要
GPU在特定区域可用;下单前请咨询

推奨プラン

Clipper

Clipper 16

$ 87.4 /month

合計$262.20 · 5%割引

vCPU
8 × 専用
RAM
16 GB
ストレージ
400 GB NVMe Gen4 SSD
転送量
30 TB
IPv4 / IPv6
1 / /64 routed
設定
Clipper

Clipper 32

$ 165.3 /month

合計$495.90 · 5%割引

vCPU
12 × 専用
RAM
32 GB
ストレージ
800 GB NVMe Gen4 SSD
転送量
40 TB
IPv4 / IPv6
1 / /64 routed
設定
Clipper

Clipper 64

$ 312.55 /month

合計$937.65 · 5%割引

vCPU
16 × 専用
RAM
64 GB
ストレージ
1.6 TB NVMe Gen4 SSD
転送量
50 TB
IPv4 / IPv6
1 / /64 routed
設定

推奨ロケーション

このワークロードでは、通常ロケーションの選択が最も重要です—レイテンシが支配的になるか、管轄権が支配的になるかのどちらかだからです。

これにOnionVPSを選ぶ理由

  • 高频 EPYC 核心搭配 AVX-512 使 llama.cpp 在无 GPU 时也能真正可用。
  • NVMe Gen4 在几秒内即可加载 40 GB 模型文件,而非几分钟。
  • 自托管意味着提示词永远不会离开你控制的基础设施——这正是大多数人这样做的真正原因。
  • 适用于通过模型处理敏感文档的团队的隐私司法管辖区。

設定方法

  1. 部署一台 Ubuntu 24.04 的 Clipper 32

    12 个专用核心和 32 GB 可覆盖大多数 CPU 推理。

  2. 安装 Ollama 或 llama.cpp

    Ollama 是最快路径;llama.cpp 提供对量化更精细的控制。

  3. 量子化モデルを取得する

    Q4_K_Mは、品質と速度の一般的なスイートスポットです。

  4. 前面にAPIゲートウェイを配置する

    LiteLLMまたは認証とレート制限を備えたリバースプロキシ。

  5. RAGを構築する場合は、ベクターデータベースを追加する

    Qdrantまたはpgvector。どちらもモデルと一緒に快適に実行できます。

よくある質問

GPUなしのVPSでLLMを実行できますか?

はい、小規模で量子化されたモデルであれば可能です。Q4の8Bモデルは、最新の専用コア8つで毎秒約8~15トークンを生成します。個人用アシスタントやバッチパイプラインには十分ですが、混雑するチャット製品には遅すぎます。

ローカルLLMにはどのくらいのRAMが必要ですか?

量子化された重みのファイルサイズに約2GBを加えたもの。Q4の8Bモデルは約5GB、Q4の70Bモデルは約40GBです。

GPUインスタンスを提供していますか?

一部の地域では提供しています。注文前にご連絡いただければ、現在の在庫状況と価格を確認いたします。