N°610 PROVIDER DETAIL · 提供商详情
Updated · 2026.07.26

vLLM

高吞吐推理引擎,自部署免费
永久免费
2
Views · 浏览

vLLM 是加州大学伯克利分校开源的高吞吐大模型推理引擎,支持 PagedAttention 技术,可高效部署主流开源模型,是自建推理服务的首选。

SECTION · 01

关键信息一览

免费额度

完全免费(需本地算力)

使用限制

需要 NVIDIA GPU

网络要求
国内直连 无需代理,国内可直接访问
所属分组
开源自部署
模型列表
Llama-3.3 Qwen2.5 Mixtral
收录时间
2026-07-26
SECTION · 02

特色功能标签

高吞吐推理|PagedAttention|分布式部署|OpenAI 兼容
SECTION · 03

详细介绍

vLLM 是加州大学伯克利分校开源的高吞吐大模型推理引擎,支持 PagedAttention 技术,可高效部署主流开源模型,是自建推理服务的首选。