模型训练微调

面向高校科研与教育核心需求,提供覆盖继续预训练(CPT)、监督微调(SFT)、全参数后训练与评测对齐的一站式训练微调能力,支持万亿参数模型在国产算力上的高效稳定训练,帮助科研团队低成本注入领域知识、塑造学科专长,打通从“用模型”到“造模型”的完整闭环。

万亿参数全参数后训练
支持万亿参数级 MoE 模型在昇腾 SuperPOD 上高效稳定运行
继续预训练 CPT
通过领域语料注入专业知识,建立学科建模先验
监督微调 SFT
利用高质量指令数据对齐任务需求,提升领域求解能力

标杆成果 · SLAI T-Rex

深圳河套学院团队在昇腾 NPU SuperPOD 上完成 DeepSeek-V4-Pro(1.6 万亿参数)全参数后训练工程验证,并打通运筹优化领域 CPT + SFT 后训练闭环。

1.6T
DeepSeek-V4-Pro 参数规模
512 卡
全参数后训练工程验证
34.22%
训练 MFU
77.33%
T-Rex-Pro 零样本 Pass@4
工程可行性

512 卡 · DeepSeek-V4-Pro

在昇腾 NPU SuperPOD 上验证 1.6 万亿参数 MoE 模型全参数后训练的工程可行性,建立国产算力大规模训练实践路径。

领域训练闭环

256 卡 Pro + 128 卡 Flash

分别验证 Pro 与 Flash 版本在运筹优化领域后训练闭环中的全流程协同稳定性,覆盖 CPT、SFT 与评测反馈。

STEP 01数据准备领域语料、指令数据、评测集
STEP 02继续预训练 CPT注入知识,建立建模先验
STEP 03监督微调 SFT对齐任务与求解器可行性
STEP 04评测优化结构、可行性、Pass@4 闭环

性能评测结果

训练效率、Pro 版本综合表现和 Flash 版本专项优化三条结果链路,构成可验证的模型训练微调成效。

训练效率提升

DeepSeek-V4-Pro 训练 MFU 达到开源基线的 2.93 倍。

2.93×
开源基线
11.67%
SLAI T-Rex
34.22%

Flash 版本专项优化

加入 CPT 初始化后,结构等价性提升 25.13 个百分点。

+25.13pp
基础模型
34.26%
CPT 初始化后
59.39%

Pro 版本综合性能领先

四项运筹优化评测平均零样本 Pass@4,同设置模型横向比较。

TOP 1 · 77.33%
SLAI T-Rex-Pro
77.33%
DeepSeek-V4-Pro
70.16%
GPT-5.4-Mini
67.83%
DeepSeek-V4-Flash
60.54%
GLM-5.2
56.60%

注:比较结果采用项目技术报告披露的相同评测设置;MFU 与模型能力评测属于不同指标,不作跨指标比较。

核心贡献及技术突破

从系统工程、算子优化到领域微调与开源复现,形成国产算力大模型训练的全链路能力。

01

系统级优化

昇腾 SuperPOD 上首次公开的万亿参数 MoE 全参数训练实践,验证国产算力支撑大规模训练的工程可行性。

02

AuraKernel 创新

运筹学引导的算子优化 Agent,突破单纯依赖启发式搜索的局限,持续优化关键瓶颈算子。

03

OR 领域应用

CPT + SFT 流程建立运筹学建模先验,兼顾模型结构等价性与求解器可行性。

04

开源贡献

开放技术报告、模型权重与训练代码,为非 GPU 集群大规模模型训练提供可复现路径。

从技术痛点到实测突破

通过系统级训练优化、AuraKernel 与领域微调流程,将传统训练瓶颈转化为可量化成果。

传统训练痛点

算子优化
依赖启发式方法,性能上限难以持续突破
领域适配
通用模型缺乏运筹学建模先验
算力底座
非 GPU 集群的大规模训练路径不足

SLAI T-Rex 方案

算子优化
AuraKernel 运筹学引导优化 Agent
领域适配
CPT + SFT 建立领域建模先验
算力底座
昇腾 NPU SuperPOD 全参数训练闭环

实测效果

训练效率
MFU 11.67% → 34.22%
领域适配
结构等价性 34.26% → 59.39%
综合能力
零样本 Pass@4 77.33%

开源资源

技术报告、模型权重与代码仓库已开放,支持高校师生和产业开发者访问、复现与二次开发。