2026年8月12日,Qwen正式开放Qwen3.8-2.4T-A95B模型权重。作为Qwen新一代旗舰模型,Qwen3.8-2.4T-A95B拥有2.4T总参数量、95B激活参数,并采用超大规模MoE与混合线性注意力架构,对专家并行、跨卡通信、线性注意力计算及显存效率提出了更高要求。
Qwen3.8-2.4T-A95B开源后,昇腾Atlas 800 A3超节点通过vLLM-Ascend/SGLang开源推理引擎快速实现了推理支持。围绕该模型的结构特点,昇腾采用大规模专家并行、MoE通算融合、GDN线性注意力、量化及Decode加速等关键路径进行针对性优化,充分释放Qwen3.8-2.4T-A95B在昇腾上的推理性能。
Qwen3.8-2.4T-A95B——新一代超大规模MoE旗舰模型
Qwen3.8-2.4T-A95B采用稀疏MoE架构,每个Token仅激活部分专家,在扩展模型容量的同时控制单Token计算开销。
在Attention层,Qwen3.8采用Gated DeltaNet(GDN)与标准Attention相结合的混合线性注意力架构,兼顾长序列处理效率与上下文建模能力。
MoE与混合线性注意力的结合,也对推理系统提出新的挑战:大规模Expert的跨NPU部署带来更高的通信开销,GDN则引入区别于传统Attention的计算与状态管理模式,需要针对模型架构进行专项优化。
基于昇腾实现Qwen3.8-2.4T-A95B的推理部署
昇腾持续深耕大模型推理关键技术,从EP64大规模专家并行、Fused MC2通算融合,到GDN线性注意力与Hybrid Cache优化,再到W8A8量化、MTP与ACL Graph Decoe加速,昇腾不断完善面向前沿模型架构的高性能推理能力,通过vLLM-Ascend/SGLang开源推理引擎实现Qwen3.8-2.4T-A95B在昇腾AI基础软硬件上的高效部署。
大规模专家并行:EP64支撑MoE高效部署
针对Qwen3.8 2.4T参数规模的MoE架构,vLLM-Ascend/SGLang支持EP64大规模专家并行,将不同Expert分布至多NPU协同执行,降低单卡模型权重与计算压力,充分发挥MoE稀疏计算优势。
MoE通算融合:Fused MC2提升大规模EP效率
随着Expert Parallel规模扩大,Token在不同NPU之间的Dispatch与Combine通信成为影响MoE推理效率的关键因素。
vLLM-Ascend使能Fused MC2通算融合能力,围绕Token Dispatch、Expert Compute与Combine等关键阶段进行通信与计算协同,减少通信等待和Host侧调度开销,提升大规模专家并行场景下的执行效率。
混合线性注意力优化:GDN融合算子与Hybrid Cache管理
Qwen3.8-2.4T-A95B采用Gated DeltaNet(GDN)与标准Attention相结合的混合线性注意力架构,GDN通过固定规模状态承载历史信息,有效降低长序列场景下的计算与存储开销,同时也引入新的线性注意力计算路径。
针对GDN的计算特点,vLLM-Ascend/SGLang在Prefill阶段采用GDN融合算子,以Chunk方式高效处理长序列,并融合关键计算过程,减少中间数据搬运和算子调度开销。
同时,针对GDN与标准Attention混合存在的模型结构,vLLM-Ascend/SGLang采用Hybrid KV Cache / Mamba State管理机制,统一管理Attention层KV Cache与GDN层状态缓存,提升显存利用效率。
W8A8量化:降低超大参数模型部署的资源开销
面对2.4T参数规模带来的显存压力,vLLM-Ascend/SGLang支持Qwen3.8的W8A8量化部署,适配模型及MoE Expert等关键模块的量化权重加载与执行,在兼顾模型精度的同时,降低显存占用和部署资源需求。
Decode加速:MTP与ACL Graph协同优化
Qwen3.8-2.4T-A95B具备Multi-Token Prediction(MTP)能力。vLLM-Ascend/SGLang支持MTP投机推理,通过预测后续Token并由主模型进行校验,提升单次模型执行产生的有效Token数量,加速Decode过程。
同时,Decode阶段支持ACL Graph,通过将高频执行的计算路径捕获为设备侧执行图,降低Host调度与Kernel下发开销,并与MTP协同优化,进一步提升Token生成效率。
星空人工智能技术网 倡导尊重与保护知识产权。如发现本站文章存在版权等问题,烦请30天内提供版权疑问、身份证明、版权证明、联系方式等发邮件至1851688011@qq.com我们将及时沟通与处理。!:首页 > 星空人工智能产业 > AI大模型 » 昇腾支持Qwen3.8-2.4T-A95B,释放超大规模MoE模型推理潜能