英伟达:Qwen3.8-Flash-Next在GB300 NVL72单卡吞吐超1.6万Token/秒
英伟达宣布支持阿里最新预览模型
英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获其 GB300 NVL72 平台支持。
核心数据与架构
该模型总参数规模达 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,可通过 YaRN 扩展至 100 万 Token,主要面向智能编程、文档处理及工具调用等长上下文 Agent 应用。
- 吞吐表现:在 GB300 NVL72 上,单 GPU 吞吐量超 1.6 万 Token/秒,单用户吞吐超 200 Token/秒
- 混合架构:采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA),降低长上下文场景下的计算和 KV 缓存开销
- 框架支持:兼容 SGLang、vLLM 及 TensorRT-LLM 等主流推理框架