N°610
PROVIDER DETAIL · 提供商详情
Updated · 2026.07.26
vLLM
高吞吐推理引擎,自部署免费
永久免费
2
Views · 浏览
vLLM 是加州大学伯克利分校开源的高吞吐大模型推理引擎,支持 PagedAttention 技术,可高效部署主流开源模型,是自建推理服务的首选。
SECTION · 01
关键信息一览
免费额度
完全免费(需本地算力)
使用限制
需要 NVIDIA GPU
网络要求
国内直连
无需代理,国内可直接访问
所属分组
开源自部署
模型列表
Llama-3.3
Qwen2.5
Mixtral
收录时间
2026-07-26
SECTION · 02
特色功能标签
高吞吐推理|PagedAttention|分布式部署|OpenAI 兼容
SECTION · 03
详细介绍
vLLM 是加州大学伯克利分校开源的高吞吐大模型推理引擎,支持 PagedAttention 技术,可高效部署主流开源模型,是自建推理服务的首选。