GitHub 雷达
首次出现 88 天前

deepseek-ai/DeepSeek-V3

1. DeepSeek‑V3 是拥有 671B 总参数(每 token 激活 37B)的混合专家(MoE)开源大语言模型,在多个基准上媲美或超越闭源前沿模型。 2. 采用多头潜在注意力(MLA)与 DeepSeekMoE 架构,结合无辅助损失的负载均衡策略、多令牌预测训练目标以及 FP8 混合精度训练,实现跨节点计算与通信高度重叠。 3. 仅用 2.788M H800 GPU 小时完成 14.8T token 预训练,训练全程无不可恢复的损失尖峰,且通过从 DeepSeek‑R1 蒸馏长链推理能力进一步提升推理表现,适合高性能、低训练成本的大模型研究与部署。

近 7 日
+37
累计 Star
104.5k
Fork
16,731
近 30 日
+141
Star 趋势 · 57 个采集点
+1%
6 月 23 日9 月 19 日
语言Python
分类AI/机器学习
最近提交8 月 28 日
创建时间12 月 26 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. DeepSeek‑V3 是拥有 671B 总参数(每 token 激活 37B)的混合专家(MoE)开源大语言模型,在多个基准上媲美或超越闭源前沿模型。 2. 采用多头潜在注意力(MLA)与 DeepSeekMoE 架构,结合无辅助损失的负载均衡策略、多令牌预测训练目标以及 FP8 混合精度训练,实现跨节点计算与通信高度重叠。 3. 仅用 2.788M H800 GPU 小时完成 14.8T token 预训练,训练全程无不可恢复的损失尖峰,且通过从 DeepSeek‑R1 蒸馏长链推理能力进一步提升推理表现,适合高性能、低训练成本的大模型研究与部署。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开