跳转至

04 | DeepSeek-V3

68 个字 预计阅读时间不到 1 分钟

DeepSeek-V3 Technical Report — DeepSeek, 2024

核心贡献

  • MoE 架构671B 总参数,37B 激活参数
  • Multi-Token Prediction:多 token 预测提升训练效率和推理能力
  • 极致训练效率:仅 2.788M H800 GPU hours,成本约 $5.6M
  • 在数学、代码等基准上媲美 GPT-4o/Claude 3.5