04 | DeepSeek-V3¶ 约 68 个字 预计阅读时间不到 1 分钟 DeepSeek-V3 Technical Report — DeepSeek, 2024 核心贡献 ¶ MoE 架构:671B 总参数,37B 激活参数 Multi-Token Prediction:多 token 预测提升训练效率和推理能力 极致训练效率:仅 2.788M H800 GPU hours,成本约 $5.6M 在数学、代码等基准上媲美 GPT-4o/Claude 3.5 Was this note helpful? 感谢支持~ 感谢指出,欢迎提 issue 或发邮件反馈~