跳到索引

vLLM

vLLM Project

开源AI 平台第 2 名

现代大模型推理服务背后的开源引擎:PagedAttention 带来业界领先的吞吐,提供 OpenAI 兼容 API,在你自己的 GPU 上支持广泛的模型。

产品预览

vllm.ai
vLLM 的产品预览

深度介绍

vLLM 是开源大模型服务领域低调的默认选项。其 PagedAttention 技术——像操作系统管理内存那样管理 KV 缓存——问世时带来台阶式吞吐提升,至今仍是其他引擎追赶的基准。在自己的硬件上启动一个 OpenAI 兼容服务,把现有 OpenAI SDK 指向它,同一段应用代码即可服务 Llama、Qwen、Mistral 或数百种受支持的架构。

它是基础设施而非产品:需要自备 GPU、做容量规划与运维。连续批处理、张量并行、量化支持,以及“兼容 vLLM”端点几乎成为云厂商标配的生态,使它成为自托管最不会后悔的选择——也是全行业 token 价格持续下降的原因。

优点 / 缺点

优点

  • 吞吐与显存效率业界领先
  • OpenAI 兼容,现有代码即插即用
  • 模型与硬件覆盖面巨大
  • 免费开源且经社区充分验证

缺点

  • GPU、扩容与运维都归你
  • 无图形界面——API 优先的基础设施
  • 峰值性能需按模型调优

适合谁用

01

出于隐私或成本自托管开源模型

02

自有 GPU 上的大批量推理

03

支撑内部 LLM 网关

04

可复现栈的研究服务

编辑结论

只要你在真实规模上服务开源模型,问题不是“用不用 vLLM”,而是“怎么调优它”。

核心功能

PagedAttention 高吞吐
OpenAI 兼容服务
连续批处理
广泛模型支持
多卡与量化支持

标签

推理开源自托管

vLLM 与替代品对比

常见问题

vLLM 是什么?

vLLM 是由 vLLM Project 开发的AI 平台工具。该公司成立于 2023 年,总部位于开源社区。现代大模型推理服务背后的开源引擎:PagedAttention 带来业界领先的吞吐,提供 OpenAI 兼容 API,在你自己的 GPU 上支持广泛的模型。

vLLM 是免费的吗?

是的——vLLM 可以免费使用。

vLLM 是开源的吗?

是的——vLLM 是开源软件,源代码可在 https://github.com/vllm-project/vllm 公开获取。

vLLM 有哪些最佳替代品?

值得关注的AI 平台替代品包括 Hugging Face、Replicate、Ollama。你可以在我们的AI 平台分类中浏览全部 4 个工具。

这个页面有帮助吗?

访问官网查看源码

基本信息

定价
免费
评分
4.8 (3,100 评价) 评分说明
平台
Self-hostedAPI
成立年份
2023
总部
开源社区
最近核验
2026-09-08