GitHub 雷达
首次出现 53 天前
ggml-org/llama.cpp
llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
近 7 日
+979
累计 Star
128.7k
Fork
23,400
近 30 日
+4,182
Star 趋势 · 49 个采集点
+6%7 月 28 日9 月 19 日
语言C++
分类AI/机器学习
最近提交9 月 19 日
创建时间3 月 11 日
首次收录7 月 28 日 · 自动扫描
README 摘要
llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
中文摘要由 AI 生成,仅供参考。
返回 GitHub 雷达在 GitHub 打开
ggml-org/llama.cpp
53 天前首次出现未被群岛收录llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
C++创建于 2023 年 3 月最近提交 2026 年 9 月
累计 Star
128.7k
近 7 日新增
+979
近 30 日新增
+4,182
Fork
23,400
Star 趋势
共 49 个采集点 · 近 30 日 +4,1822026-07-272026-09-18
项目介绍
由 AI 摘自仓库 READMEllama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
仓库信息
Topics
#ggml
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。