GitHub 雷达
首次出现 88 天前
vllm-project/vllm
1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。 2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
近 7 日
+685
累计 Star
92.1k
Fork
22,391
近 30 日
+2,747
Star 趋势 · 57 个采集点
+10%6 月 23 日9 月 19 日
语言Python
分类AI/机器学习
最近提交9 月 19 日
创建时间2 月 9 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。
2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
中文摘要由 AI 生成,仅供参考。
返回 GitHub 雷达在 GitHub 打开
vllm-project/vllm
88 天前首次出现未被群岛收录1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。 2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
Python创建于 2023 年 2 月最近提交 2026 年 9 月
累计 Star
92.1k
近 7 日新增
+685
近 30 日新增
+2,747
Fork
22,391
Star 趋势
共 57 个采集点 · 近 30 日 +2,7472026-06-232026-09-18
项目介绍
由 AI 摘自仓库 README1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。
2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
仓库信息
Topics
#amd#blackwell#cuda#deepseek#deepseek-v3#gpt#gpt-oss#inference#kimi#llama#llm#llm-serving
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。