GitHub 雷达
首次出现 88 天前

vllm-project/vllm

1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。 2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续

近 7 日
+685
累计 Star
92.1k
Fork
22,391
近 30 日
+2,747
Star 趋势 · 57 个采集点
+10%
6 月 23 日9 月 19 日
语言Python
分类AI/机器学习
最近提交9 月 19 日
创建时间2 月 9 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。 2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开