返回 GitHub 雷达在 GitHub 打开
vllm-project/vllm
42 天前首次出现未被群岛收录1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。 2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
Python创建于 2023 年 2 月最近提交 2026 年 8 月
累计 Star
88.1k
近 7 日新增
+765
近 30 日新增
+2,990
Fork
20,223
Star 趋势
共 17 个采集点 · 近 30 日 +2,9902026-06-232026-08-03
项目介绍
由 AI 摘自仓库 README1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。
2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
仓库信息
Topics
#amd#blackwell#cuda#deepseek#deepseek-v3#gpt#gpt-oss#inference#kimi#llama#llm#llm-serving
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。