Warning: mkdir(): No space left on device in /www/wwwroot/X21X22X26Z2Z5.COM/func.php on line 127

Warning: file_put_contents(./cachefile_yuan/shengzhihan.com/cache/62/980e3/08792.html): failed to open stream: No such file or directory in /www/wwwroot/X21X22X26Z2Z5.COM/func.php on line 115
昇騰支持Qwen3.8-2.4T-A95B,釋放超大規模MoE模型推理潛能--星空人工智能美女福利导航網

星空人工智能美女福利导航網

昇騰支持Qwen3.8-2.4T-A95B,釋放超大規模MoE模型推理潛能

 2026年8月12日,Qwen正式開放Qwen3.8-2.4T-A95B模型權重。作為Qwen新一代旗艦模型,Qwen3.8-2.4T-A95B擁有2.4T總參數量、95B激活參數,並采用超大規模MoE與混合線性注意力架構,對專家並行、跨卡通信、線性注意力計算及顯存效率提出了更高要求。

Qwen3.8-2.4T-A95B開源後,昇騰Atlas 800 A3超節點通過vLLM-Ascend/SGLang開源推理引擎快速實現了推理支持。圍繞該模型的結構特點,昇騰采用大規模專家並行、MoE通算融合、GDN線性注意力、量化及Decode加速等關鍵路徑進行針對性優化,充分釋放Qwen3.8-2.4T-A95B在昇騰上的推理性能。

Qwen3.8-2.4T-A95B——新一代超大規模MoE旗艦模型

Qwen3.8-2.4T-A95B采用稀疏MoE架構,每個Token僅激活部分專家,在擴展模型容量的同時控製單Token計算開銷。

在Attention層,Qwen3.8采用Gated DeltaNet(GDN)與標準Attention相結合的混合線性注意力架構,兼顧長序列處理效率與上下文建模能力。

MoE與混合線性注意力的結合,也對推理係統提出新的挑戰:大規模Expert的跨NPU部署帶來更高的通信開銷,GDN則引入區別於傳統Attention的計算與狀態管理模式,需要針對模型架構進行專項優化。

基於昇騰實現Qwen3.8-2.4T-A95B的推理部署

昇騰持續深耕大模型推理關鍵美女福利导航,從EP64大規模專家並行、Fused MC2通算融合,到GDN線性注意力與Hybrid Cache優化,再到W8A8量化、MTP與ACL Graph Decoe加速,昇騰不斷完善麵向前沿模型架構的高性能推理能力,通過vLLM-Ascend/SGLang開源推理引擎實現Qwen3.8-2.4T-A95B在昇騰AI基礎軟硬件上的高效部署。

大規模專家並行:EP64支撐MoE高效部署

針對Qwen3.8 2.4T參數規模的MoE架構,vLLM-Ascend/SGLang支持EP64大規模專家並行,將不同Expert分布至多NPU協同執行,降低單卡模型權重與計算壓力,充分發揮MoE稀疏計算優勢。

MoE通算融合:Fused MC2提升大規模EP效率

隨著Expert Parallel規模擴大,Token在不同NPU之間的Dispatch與Combine通信成為影響MoE推理效率的關鍵因素。

vLLM-Ascend使能Fused MC2通算融合能力,圍繞Token Dispatch、Expert Compute與Combine等關鍵階段進行通信與計算協同,減少通信等待和Host側調度開銷,提升大規模專家並行場景下的執行效率。

混合線性注意力優化:GDN融合算子與Hybrid Cache管理

Qwen3.8-2.4T-A95B采用Gated DeltaNet(GDN)與標準Attention相結合的混合線性注意力架構,GDN通過固定規模狀態承載曆史信息,有效降低長序列場景下的計算與存儲開銷,同時也引入新的線性注意力計算路徑。

針對GDN的計算特點,vLLM-Ascend/SGLang在Prefill階段采用GDN融合算子,以Chunk方式高效處理長序列,並融合關鍵計算過程,減少中間數據搬運和算子調度開銷。

同時,針對GDN與標準Attention混合存在的模型結構,vLLM-Ascend/SGLang采用Hybrid KV Cache / Mamba State管理機製,統一管理Attention層KV Cache與GDN層狀態緩存,提升顯存利用效率。

W8A8量化:降低超大參數模型部署的資源開銷

麵對2.4T參數規模帶來的顯存壓力,vLLM-Ascend/SGLang支持Qwen3.8的W8A8量化部署,適配模型及MoE Expert等關鍵模塊的量化權重加載與執行,在兼顧模型精度的同時,降低顯存占用和部署資源需求。

Decode加速:MTP與ACL Graph協同優化

Qwen3.8-2.4T-A95B具備Multi-Token Prediction(MTP)能力。vLLM-Ascend/SGLang支持MTP投機推理,通過預測後續Token並由主模型進行校驗,提升單次模型執行產生的有效Token數量,加速Decode過程。

同時,Decode階段支持ACL Graph,通過將高頻執行的計算路徑捕獲為設備側執行圖,降低Host調度與Kernel下發開銷,並與MTP協同優化,進一步提升Token生成效率。

星空人工智能美女福利导航網 倡導尊重與保護知識產權。如發現本站文章存在版權等問題,煩請30天內提供版權疑問、身份證明、版權證明、聯係方式等發郵件至1851688011@qq.com美女直播全婐APP免费下载將及時溝通與處理。!:首頁 > 星空人工智能產業 > AI大模型 » 昇騰支持Qwen3.8-2.4T-A95B,釋放超大規模MoE模型推理潛能

感覺不錯,很讚哦! ()
分享到:

相關推薦

留言與評論(共有 0 條評論)
   
驗證碼:
網站地圖