机器翻译正文由机器翻译自项目原始文档(英文),排版经程序统一处理,可能存在偏差,请以原项目仓库为准。
简单、快速、廉价的 LLM 服务,面向所有人
| Documentation | Blog | Paper | Twitter/X | User Forum | Developer Slack |
🔥 我们已经建立了一个 vLLM 网站来帮助您入门 vLLM。请访问 vllm.ai 了解更多信息。有关活动,请访问 vllm.ai/events 加入我们。
关于
vLLM 是一个用于大语言模型推理和服务的快速且易于使用的库。
vLLM 最初在加州大学伯克利分校的 Sky Computing Lab 开发,由来自 2000 多名贡献者的众多学术机构和公司组成的多元化社区构建和维护,现已发展成为最活跃的开源 AI 项目之一。
vLLM 速度快,具备以下特点:
- 最先进的服务吞吐量
- 通过 PagedAttention 高效管理注意力键和值的内存
- 对接收请求进行连续批处理、分块预填充、前缀缓存
- 使用分片和完整的 CUDA/HIP 图进行快速且灵活的模型执行
- 量化:FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, 压缩张量, ModelOpt, TorchAO,以及更多 链接
- 优化的注意力内核,包括 FlashAttention、FlashInfer、TRTLLM-GEN、FlashMLA 和 Triton
- 使用 CUTLASS、TRTLLM-GEN、CuTeDSL 为各种精度优化的 GEMM/MoE 内核
- 包含 n-gram、后缀、EAGLE、DFlash 的推测性解码
- 使用 torch.compile 进行自动内核生成和图级转换
- 分离的预填充、解码和编码
vLLM 灵活且易于使用,具备以下特点:
- 与流行的 Hugging Face 模型无缝集成
- 使用多种解码算法进行高吞吐量服务,包括 并行采样、束搜索 等
- 分布式推理支持张量、流水线、数据、专家和上下文并行
- 流式输出
- 使用 xgrammar 或 guidance 生成结构化输出
- 工具调用和推理解析器
- 兼容 OpenAI 的 API 服务器,同时支持 Anthropic Messages API 和 gRPC
- 高效的多 LoRA 支持,适用于稠密层和 MoE 层
- 支持 NVIDIA GPU、AMD GPU、Intel GPU 以及 x86/ARM/PowerPC CPU。此外,还支持各种硬件插件,如 Google TPU、Intel Gaudi、IBM Spyre、华为昇腾、Rebellions NPU、Apple Silicon、MetaX GPU 等。
vLLM 无缝支持 Hugging Face 上的 200 种模型架构,包括:
- 仅解码器 LLM(例如:Llama、Qwen、Gemma)
- 专家混合 LLM(例如:Mixtral、DeepSeek-V3、Qwen-MoE、GPT-OSS)
- 混合注意力和状态空间模型(例如:Mamba、Qwen3.5)
- 多模态模型(例如:LLaVA、Qwen-VL、Pixtral)
- 嵌入与检索模型(例如:E5-Mistral、GTE、ColBERT)
- 奖励与分类模型(例如:Qwen-Math)
完整支持模型列表请点击这里。
入门指南
使用 uv (推荐)或 pip 安装 vLLM:
uv pip install vllm
或者为开发目的从源代码构建。
访问我们的文档以了解更多信息。
贡献
我们欢迎并重视任何贡献与合作。请查看 Contributing to vLLM 了解如何参与。
引用
如果您在研究中使用 vLLM,请引用我们的论文:
@inproceedings{kwon2023efficient,
title={Efficient Memory Management for Large Language Model Serving with PagedAttention},
author={Woosuk Kwon and Zhuohan Li and Siyuan Zhuang and Ying Sheng and Lianmin Zheng and Cody Hao Yu and Joseph E. Gonzalez and Hao Zhang and Ion Stoica},
booktitle={Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles},
year={2023}
}
联系我们
- 对于技术问题和功能请求,请使用 GitHub 问题
- 与其他用户讨论,请使用 vLLM 论坛
- 协调贡献和开发,请使用 Slack
- 关于安全漏洞披露,请使用 GitHub 的 安全咨询 功能
- 关于合作与伙伴关系,请通过 collaboration@vllm.ai 联系我们
媒体套件
- 如果您希望使用 vLLM 的标志,请参阅 我们的媒体工具包仓库
本站来源与版权声明
- 本文标题:vllm - 一个用于大型语言模型的高吞吐量且内存高效的推理和服务
- 本文链接:https://www.cn121.com/llm/vllm-project-vllm.html
- 原项目:vllm-project/vllm 版权归原作者 vllm-project 及贡献者所有
- 收录信息:本站于 2026-09-22 收录本项目,本页所列协议与仓库指标均为收录当时的状态;该日期之后原项目的版本更新与协议变更,本页不作同步。
- 开源协议:收录时本项目采用 Apache-2.0(查看 LICENSE 原文),本站译文为其衍生内容;使用、修改、分发请以该仓库 LICENSE 原文为准。本站对原文仅作排版与图片地址适配, 并保留原项目的 NOTICE 与署名要求。
- 站点出处:本文首发于 OneTwoOne,收录自 GitHub 开源项目 vllm-project/vllm。
- 翻译说明:本页正文为人工智能生成内容——由机器翻译对原项目 README 初译、经程序校验排版,可能存在错漏,请以原项目文档为准。
- 引用声明:商业转载、第三方聚合或 AI 检索训练引用时,请务必保留以上来源出处、本文永久链接,以及原项目的版权声明与许可信息。
- 下架通道:若原项目此后变更或收紧了许可协议、或作者/权利人认为本站的收录方式(译文、排版适配、简介翻译等)超出其授权范围,请通过 xyd3302001@163.com 发送下架通知,并附上项目地址与本页链接。本站核实后将第一时间删除本页内容,或改为不复制原文的目录性收录;署名更正等其他要求可一并提出。