返回 GitHub 雷达在 GitHub 打开
lyogavin/airllm
41 天前首次出现未被群岛收录AirLLM 是一个开源项目,它解决了在显存极低的 GPU(如单张 4GB 显卡)上运行 70B 甚至 671B 等超大参数大语言模型进行推理的问题,无需量化、蒸馏或剪枝。 主要技术栈基于 Python 和 Jupyter Notebook,通过创新的分层模型分解与块级量化压缩技术,将模型按层拆分并动态加载到显存中,从而大幅降低单次推理的内存占用。 其亮点在于能让普通用户或资源受限的环境(如个人电脑、低配云服务器)轻松运行 Llama 3.1 405B、DeepSeek-V3 等顶级大模型,适用于低成本部署、本地实验和隐私敏感场景。
Jupyter Notebook创建于 2023 年 6 月最近提交 2026 年 7 月
累计 Star
26.9k
近 7 日新增
+3,744
近 30 日新增
+5,776
Fork
2,961
Star 趋势
共 5 个采集点 · 近 30 日 +5,7762026-06-232026-08-03
项目介绍
由 AI 摘自仓库 READMEAirLLM 是一个开源项目,它解决了在显存极低的 GPU(如单张 4GB 显卡)上运行 70B 甚至 671B 等超大参数大语言模型进行推理的问题,无需量化、蒸馏或剪枝。 主要技术栈基于 Python 和 Jupyter Notebook,通过创新的分层模型分解与块级量化压缩技术,将模型按层拆分并动态加载到显存中,从而大幅降低单次推理的内存占用。 其亮点在于能让普通用户或资源受限的环境(如个人电脑、低配云服务器)轻松运行 Llama 3.1 405B、DeepSeek-V3 等顶级大模型,适用于低成本部署、本地实验和隐私敏感场景。
仓库信息
Topics
#chinese-llm#chinese-nlp#finetune#generative-ai#instruct-gpt#instruction-set#llama#llm#lora#open-models#open-source#open-source-models
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。