Giải pháp

VPS cho khối lượng công việc AI, suy luận LLM và pipeline RAG

Clipper 16 · $92/moClipper 32 · $174/mo
Câu trả lời ngắn

Suy luận CPU khả thi cho các mô hình nhỏ: mô hình 8 tỷ tham số được lượng tử hóa 4 bit chạy ở tốc độ hội thoại trên 8 lõi chuyên dụng với 16 GB RAM. Bất kỳ thứ gì lớn hơn cần GPU. Hầu hết công việc AI tự lưu trữ thực sự là phần cơ sở hỗ trợ xung quanh — cơ sở dữ liệu vector, dịch vụ nhúng, cổng API — và phần đó chạy rất tốt trên Clipper 32.

Những gì bạn cần

Mức tối thiểu về thông số kỹ thuật cho ai & suy luận llm
Tài nguyênNhững gì bạn thực sự cần
CPU8+ lõi chuyên dụng với AVX-512 cho suy luận CPU
RAM16 GB cho mô hình 8B ở Q4, 64 GB cho 70B ở Q4
Ổ đĩaNVMe Gen4 — trọng lượng mô hình lớn và độ trễ tải có ý nghĩa quan trọng
GPUKhả dụng tại một số khu vực; vui lòng hỏi trước khi đặt hàng

Gói đề xuất

Clipper

Clipper 16

$ 87.4 /month

262,20 US$ tổng cộng · Tiết kiệm 5%

vCPU
8 × riêng
RAM
16 GB
Lưu trữ
400 GB NVMe Gen4 SSD
Băng thông
30 TB
IPv4 / IPv6
1 / /64 routed
Cấu hình
Clipper

Clipper 32

$ 165.3 /month

495,90 US$ tổng cộng · Tiết kiệm 5%

vCPU
12 × riêng
RAM
32 GB
Lưu trữ
800 GB NVMe Gen4 SSD
Băng thông
40 TB
IPv4 / IPv6
1 / /64 routed
Cấu hình
Clipper

Clipper 64

$ 312.55 /month

937,65 US$ tổng cộng · Tiết kiệm 5%

vCPU
16 × riêng
RAM
64 GB
Lưu trữ
1.6 TB NVMe Gen4 SSD
Băng thông
50 TB
IPv4 / IPv6
1 / /64 routed
Cấu hình

Vị trí đề xuất

Vị trí thường là quyết định quan trọng nhất cho khối lượng công việc này — hoặc vì độ trễ chiếm ưu thế, hoặc vì thẩm quyền pháp lý.

Vì sao chọn OnionVPS cho việc này

  • Các lõi EPYC tần số cao với AVX-512 giúp llama.cpp thực sự sử dụng được mà không cần GPU.
  • NVMe Gen4 tải tệp mô hình 40 GB trong vài giây thay vì vài phút.
  • Tự lưu trữ nghĩa là không có prompt nào rời khỏi hạ tầng bạn kiểm soát — lý do thực sự khiến hầu hết mọi người làm điều này.
  • Các khu vực pháp lý về quyền riêng tư dành cho nhóm xử lý tài liệu nhạy cảm qua mô hình.

Cách thiết lập

  1. Triển khai Clipper 32 với Ubuntu 24.04

    Mười hai lõi chuyên dụng và 32 GB đủ cho hầu hết suy luận CPU.

  2. Cài đặt Ollama hoặc llama.cpp

    Ollama là con đường nhanh nhất; llama.cpp cho phép kiểm soát chi tiết hơn về lượng tử hóa.

  3. Tải mô hình lượng tử hóa

    Q4_K_M là điểm cân bằng thông thường giữa chất lượng và tốc độ.

  4. Đặt một API gateway phía trước

    LiteLLM hoặc một reverse proxy có xác thực và giới hạn tốc độ.

  5. Thêm cơ sở dữ liệu vector nếu bạn đang xây dựng RAG

    Qdrant hoặc pgvector; cả hai đều chạy tốt cùng mô hình.

Câu hỏi thường gặp

Bạn có thể chạy LLM trên VPS không có GPU không?

Có, với các mô hình nhỏ và đã lượng tử hóa. Mô hình 8B ở Q4 tạo ra khoảng 8–15 token mỗi giây trên 8 lõi chuyên dụng hiện đại — đủ tốt cho trợ lý cá nhân hoặc pipeline hàng loạt, quá chậm cho sản phẩm chat đông người dùng.

RAM cần thiết cho LLM cục bộ là bao nhiêu?

Gần bằng kích thước tệp của trọng số đã lượng tử hóa cộng thêm 2 GB. Mô hình 8B ở Q4 khoảng 5 GB, mô hình 70B ở Q4 khoảng 40 GB.

Bạn có cung cấp instance GPU không?

Có, tại một số khu vực chọn lọc. Liên hệ chúng tôi trước khi đặt hàng để xác nhận tình trạng sẵn có và giá hiện tại.