返回 GitHub 雷达在 GitHub 打开
deepseek-ai/DeepSeek-V3
42 天前首次出现未被群岛收录1. DeepSeek‑V3 是拥有 671B 总参数(每 token 激活 37B)的混合专家(MoE)开源大语言模型,在多个基准上媲美或超越闭源前沿模型。 2. 采用多头潜在注意力(MLA)与 DeepSeekMoE 架构,结合无辅助损失的负载均衡策略、多令牌预测训练目标以及 FP8 混合精度训练,实现跨节点计算与通信高度重叠。 3. 仅用 2.788M H800 GPU 小时完成 14.8T token 预训练,训练全程无不可恢复的损失尖峰,且通过从 DeepSeek‑R1 蒸馏长链推理能力进一步提升推理表现,适合高性能、低训练成本的大模型研究与部署。
Python创建于 2024 年 12 月最近提交 2025 年 8 月
累计 Star
104.1k
近 7 日新增
+69
近 30 日新增
+245
Fork
16,719
Star 趋势
共 17 个采集点 · 近 30 日 +2452026-06-232026-08-03
项目介绍
由 AI 摘自仓库 README1. DeepSeek‑V3 是拥有 671B 总参数(每 token 激活 37B)的混合专家(MoE)开源大语言模型,在多个基准上媲美或超越闭源前沿模型。
2. 采用多头潜在注意力(MLA)与 DeepSeekMoE 架构,结合无辅助损失的负载均衡策略、多令牌预测训练目标以及 FP8 混合精度训练,实现跨节点计算与通信高度重叠。
3. 仅用 2.788M H800 GPU 小时完成 14.8T token 预训练,训练全程无不可恢复的损失尖峰,且通过从 DeepSeek‑R1 蒸馏长链推理能力进一步提升推理表现,适合高性能、低训练成本的大模型研究与部署。
仓库信息
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。