返回 GitHub 雷达在 GitHub 打开
ggml-org/llama.cpp
7 天前首次出现未被群岛收录llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
C++创建于 2023 年 3 月最近提交 2026 年 8 月
累计 Star
122.6k
近 7 日新增
+780
近 30 日新增
+790
Fork
21,284
Star 趋势
共 9 个采集点 · 近 30 日 +7902026-07-272026-08-03
项目介绍
由 AI 摘自仓库 READMEllama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
仓库信息
Topics
#ggml
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。