跳到主要内容
项目档案开源项目

MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks 是什么?用途、安装与使用指南

MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks:本项目是MiaAI Lab推出的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,面向DGX Spark(GB10)硬件,基于v本页整理它解决什么问题、适用场景、安装方式和使用方法。

310HTMLStar 于 2026年9月6日2026年9月9日 更新

AI 总结

本项目是MiaAI Lab推出的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,面向DGX Spark(GB10)硬件,基于vLLM实现双节点TP2+EP+MTP3多节点推理,提供全套适配脚本与内核补丁,解决该模型在特定硬件上的部署适配问题。

中文项目介绍

本项目是MiaAI Lab开源的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,基于vLLM框架,针对NVIDIA DGX Spark(GB10架构、sm_121)硬件定制适配,核心目标是实现该量化模型的高效多节点推理。 项目解决了Qwen3.8-Flash-Next-NVFP4模型在DGX Spark硬件上的适配痛点,包括GB10架构无CUDA流内存操作导致的PLE卸载死锁、MXFP8量化内核与FlashInfer不兼容、双节点权重高效分发等问题,提供定制化的PLE/MXFP8内核补丁、权重同步与NFS共享方案。 项目适用于双DGX Spark节点部署TP2+EP+MTP3多节点推理场景,也支持单节点TP1推理;仓库提供一键启动脚本、基准测试工具、性能评估文档,实测双节点推理可达55.8 tok/s(batch-1 greedy),单节点TP1推理可达35.1 tok/s(代码场景、MTP3开启)。

详细信息与使用说明

1. 项目定位与用途

本项目是MiaAI Lab推出的面向DGX Spark硬件的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,基于vLLM框架实现多节点/单节点推理服务,提供从权重下载、内核适配到服务启动的全套自动化脚本,降低该模型在特定硬件上的部署门槛,同时支持官方FP8权重的推理部署。

2. 解决的问题

项目针对Qwen3.8-Flash-Next-NVFP4在DGX Spark(GB10)上的适配痛点提供解决方案,包括修复GB10无CUDA流内存操作导致的PLE卸载死锁问题、适配MXFP8量化内核与FlashInfer的兼容性问题、解决双节点权重分发与KV缓存优化问题,覆盖模型部署的全流程适配需求。

3. 适用场景

主要适用于2台DGX Spark(GB10、128GB统一内存、sm_121)节点部署Qwen3.8-Flash-Next-NVFP4双节点TP2+EP+MTP3多节点推理场景,也支持单DGX Spark节点部署TP1推理场景,可用于模型推理性能基准测试、长上下文推理验证等用途。

4. 安装方式

安装前需准备2台DGX Spark节点,配置节点间免密SSH、Docker环境,每节点预留约126GiB空闲空间;复制.env.sample为.env并配置头/工作节点IP、网络接口、IB HCA等参数;在头节点执行./download.sh下载模型权重,添加--fp8参数可下载官方FP8版本权重。

5. 使用方式

执行./start.sh --no-download完成权重同步、内核补丁应用并启动双节点推理服务,或执行./start-fp8.sh启动官方FP8权重推理服务;通过docker logs vllm-fn查看KV缓存分配与服务状态;执行./stop.sh停止推理服务;运行bench/目录下的脚本开展解码、长上下文等基准测试。

6. 补充说明与实现特点

项目采用定制Triton/CUDA内核实现QSA稀疏注意力与GDN线性注意力,不依赖FlashAttention2;支持NFS权重共享或rsync分发两种权重同步方案;PLE表采用内存映射方式加载降低内存占用;仓库附带性能评估文档与单节点适配交接文档,提供完整的部署与运维参考。

思维导图

Qwen3.8-Flash-Next-DGX-Spark推理部署方案
多节点推理部署
start.sh/start-fp8.sh启动脚本
stop.sh停止脚本
TP2+EP+MTP3配置
单节点推理部署
tp1目录启动脚本
TP1配置
内存预算计算
权重与PLE管理
download.sh权重下载
NFS/rsync权重分发
PLE内存映射表构建
内核补丁适配
PLE卸载补丁
MXFP8内核补丁
QSA稀疏注意力适配
基准测试工具
解码基准测试
长上下文测试
MTP验证脚本
文档与运维参考
性能评估文档
单节点适配交接文档

常见问题

MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks 是做什么的?

本项目是MiaAI Lab推出的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,面向DGX Spark(GB10)硬件,基于vLLM实现双节点TP2+EP+MTP3多节点推理,提供全套适配脚本与内核补丁,解决该模型在特定硬件上的部署适配问题。

MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks 适合用在什么场景?

本项目是MiaAI Lab推出的面向DGX Spark硬件的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,基于vLLM框架实现多节点/单节点推理服务,提供从权重下载、内核适配到服务启动的全套自动化脚本,降低该模型在特定硬件上的部署门槛,同时支持官方FP8权重的推理部署。

MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks 如何安装?

安装前需准备2台DGX Spark节点,配置节点间免密SSH、Docker环境,每节点预留约126GiB空闲空间;复制.env.sample为.env并配置头/工作节点IP、网络接口、IB HCA等参数;在头节点执行./download.sh下载模型权重,添加--fp8参数可下载官方FP8版本权重。

MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks 如何开始使用?

执行./start.sh --no-download完成权重同步、内核补丁应用并启动双节点推理服务,或执行./start-fp8.sh启动官方FP8权重推理服务;通过docker logs vllm-fn查看KV缓存分配与服务状态;执行./stop.sh停止推理服务;运行bench/目录下的脚本开展解码、长上下文等基准测试。