512 卡 · DeepSeek-V4-Pro
在昇腾 NPU SuperPOD 上验证 1.6 万亿参数 MoE 模型全参数后训练的工程可行性,建立国产算力大规模训练实践路径。
面向高校科研与教育核心需求,提供覆盖继续预训练(CPT)、监督微调(SFT)、全参数后训练与评测对齐的一站式训练微调能力,支持万亿参数模型在国产算力上的高效稳定训练,帮助科研团队低成本注入领域知识、塑造学科专长,打通从“用模型”到“造模型”的完整闭环。
深圳河套学院团队在昇腾 NPU SuperPOD 上完成 DeepSeek-V4-Pro(1.6 万亿参数)全参数后训练工程验证,并打通运筹优化领域 CPT + SFT 后训练闭环。
在昇腾 NPU SuperPOD 上验证 1.6 万亿参数 MoE 模型全参数后训练的工程可行性,建立国产算力大规模训练实践路径。
分别验证 Pro 与 Flash 版本在运筹优化领域后训练闭环中的全流程协同稳定性,覆盖 CPT、SFT 与评测反馈。
训练效率、Pro 版本综合表现和 Flash 版本专项优化三条结果链路,构成可验证的模型训练微调成效。
DeepSeek-V4-Pro 训练 MFU 达到开源基线的 2.93 倍。
加入 CPT 初始化后,结构等价性提升 25.13 个百分点。
四项运筹优化评测平均零样本 Pass@4,同设置模型横向比较。
注:比较结果采用项目技术报告披露的相同评测设置;MFU 与模型能力评测属于不同指标,不作跨指标比较。
从系统工程、算子优化到领域微调与开源复现,形成国产算力大模型训练的全链路能力。
昇腾 SuperPOD 上首次公开的万亿参数 MoE 全参数训练实践,验证国产算力支撑大规模训练的工程可行性。
运筹学引导的算子优化 Agent,突破单纯依赖启发式搜索的局限,持续优化关键瓶颈算子。
CPT + SFT 流程建立运筹学建模先验,兼顾模型结构等价性与求解器可行性。
开放技术报告、模型权重与训练代码,为非 GPU 集群大规模模型训练提供可复现路径。
通过系统级训练优化、AuraKernel 与领域微调流程,将传统训练瓶颈转化为可量化成果。
技术报告、模型权重与代码仓库已开放,支持高校师生和产业开发者访问、复现与二次开发。