GitHub 雷达
首次出现 53 天前

ggml-org/llama.cpp

llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。

近 7 日
+979
累计 Star
128.7k
Fork
23,400
近 30 日
+4,182
Star 趋势 · 49 个采集点
+6%
7 月 28 日9 月 19 日
语言C++
分类AI/机器学习
最近提交9 月 19 日
创建时间3 月 11 日
首次收录7 月 28 日 · 自动扫描
README 摘要
llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开