阿里巴巴已开放 Qwen3.8-2.4T-A95B(Qwen3.8-Max)模型权重。该模型总参数量达 2.4 万亿,每个 token 激活 950 亿参数,采用细粒度混合专家(MoE)架构,并融合全注意力与线性注意力,支持最高 100 万 token 的上下文窗口和 12.8 万 token 的输出长度,面向复杂推理与智能体工作负载设计。
NVIDIA 宣布与开源生态合作,将这一模型引入多节点部署。在未做额外调优的情况下,Qwen3.8-2.4T-A95B 在 GB300 NVL72 平台上以 FP8 精度实现每 GPU 每秒超 4000 token、每用户每秒超 350 token 的吞吐。NVIDIA 表示,后续包括 NVFP4 精度在内的进一步优化有望带来更明显的性能提升。
GB300 NVL72 将 72 块 Blackwell Ultra GPU 整合为机架级平台,72-GPU NVLink 域提供 130 TB/s 的全对全通信带宽,可有效消除大规模 MoE 模型专家流量跨网络传输的瓶颈。该模型内置低、高、超高三档推理控制,开发者可按任务需求在算力开销与推理质量之间权衡。
开发者可通过 SGLang、vLLM 与 NVIDIA Dynamo 等开源推理方案部署该模型,也可使用无模型 NVIDIA NIM 容器在发布当日完成部署,并通过 NeMo AutoModel 直接基于现有检查点进行全量 SFT 或 LoRA 微调。模型权重已上架 Hugging Face 与 ModelScope,DeepInfra、Fireworks AI、OpenRouter 等平台也提供了托管 API。
WeChat
Profile