AMD 最强开源混合专家模型:Instella-MoE 系列 AI 登场,16B 参数、自有 GPU 训练
来源:IT之家 13 小时前

IT之家 7 月 28 日消息,AMD 于 7 月 24 日发布博文,宣布推出 Instella-MoE 系列模型,总参数量为 16B,激活参数量为 2.8B,采用 27 层解码器架构,使用 AMD 自研的 GPU 和软件开发而成。

IT之家援引博文介绍,AMD 本次推出的 Instella-MoE 系列模型共有 6 个版本:

模型

阶段

描述

Instella-MoE-16B-A3B-Pretrain

预训练

基于大型多样化训练语料库从头开始训练的 MoE 基础模型。

Instella-MoE-16B-A3B-Midtrain

Mid-training

在高质量混合数据上进一步训练的预训练模型,完善关键能力。

Instella-MoE-16B-A3B-Base

Long-context

长上下文训练旨在提升模型处理和推理更长序列的能力。我们将其作为最终的基础检查点。

Instella-MoE-16B-A3B-SFT

SFT

通过监督微调 (SFT) 扩展基础检查点,实现指令跟踪和链式推理能力。

Instella-MoE-16B-A3B-DPO

DPO

基于对比偏好数据的直接偏好优化(DPO)以提高模型性能。

Instella-MoE-16B-A3B-Think

RL

通过强化学习(RL)对最终思维检查点进行改进,以进一步加强对指令的遵循和整体反应质量。

性能方面,下图为 Instella-MoE-16B-A3B-Base 模型和其它模型的对比,横轴代表活跃参数量,而纵轴代表各种跑分测试,可以看到该模型跑分要低  Qwen3.5-4B-Base,不过高于其它模型。

以下是 Instella-MoE-16B-A3B-Think 与同类产品的性能对比。与 Gemma-4-E4B-it 相比,它在启用参数更少的情况下获得了更高的分数。

Instella-MoE 是 AMD 开发的最先进开源混合专家语言模型,在 AMD Instinct™ MI300X 和 MI325X GPU 上从头开始训练。

该模型训练完全基于 AMD ROCm™ 软件栈,以 Primus 训练和 Miles RL 框架为基础,融合了包括门控多头潜在注意力(Gated MLA)在内尖端的架构和系统创新,让 AMD 硬件上高效地进行大规模训练和推理。

在预训练阶段,FarSkip-Collective 通过专家并行带来的通信重叠,将模型预训练速度提升了 12.7%。

Instella-MoE-16B-A3B 训练流程。

Instella-MoE-16B-A3B RL 训练流程。

在推理阶段,我们使用 SGLang 推理框架实现了 Instella-MoE。通过将通信与计算重叠,当模型采用专家并行服务时,该实现可将首次 Token 响应时间 (TTFT) 最多缩短 39.2%。

简体中文 English