1. 项目定位与用途
本项目是MiaAI Lab推出的面向DGX Spark硬件的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,基于vLLM框架实现多节点/单节点推理服务,提供从权重下载、内核适配到服务启动的全套自动化脚本,降低该模型在特定硬件上的部署门槛,同时支持官方FP8权重的推理部署。
MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks:本项目是MiaAI Lab推出的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,面向DGX Spark(GB10)硬件,基于v本页整理它解决什么问题、适用场景、安装方式和使用方法。
本项目是MiaAI Lab推出的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,面向DGX Spark(GB10)硬件,基于vLLM实现双节点TP2+EP+MTP3多节点推理,提供全套适配脚本与内核补丁,解决该模型在特定硬件上的部署适配问题。
本项目是MiaAI Lab推出的面向DGX Spark硬件的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,基于vLLM框架实现多节点/单节点推理服务,提供从权重下载、内核适配到服务启动的全套自动化脚本,降低该模型在特定硬件上的部署门槛,同时支持官方FP8权重的推理部署。
项目针对Qwen3.8-Flash-Next-NVFP4在DGX Spark(GB10)上的适配痛点提供解决方案,包括修复GB10无CUDA流内存操作导致的PLE卸载死锁问题、适配MXFP8量化内核与FlashInfer的兼容性问题、解决双节点权重分发与KV缓存优化问题,覆盖模型部署的全流程适配需求。
主要适用于2台DGX Spark(GB10、128GB统一内存、sm_121)节点部署Qwen3.8-Flash-Next-NVFP4双节点TP2+EP+MTP3多节点推理场景,也支持单DGX Spark节点部署TP1推理场景,可用于模型推理性能基准测试、长上下文推理验证等用途。
安装前需准备2台DGX Spark节点,配置节点间免密SSH、Docker环境,每节点预留约126GiB空闲空间;复制.env.sample为.env并配置头/工作节点IP、网络接口、IB HCA等参数;在头节点执行./download.sh下载模型权重,添加--fp8参数可下载官方FP8版本权重。
执行./start.sh --no-download完成权重同步、内核补丁应用并启动双节点推理服务,或执行./start-fp8.sh启动官方FP8权重推理服务;通过docker logs vllm-fn查看KV缓存分配与服务状态;执行./stop.sh停止推理服务;运行bench/目录下的脚本开展解码、长上下文等基准测试。
项目采用定制Triton/CUDA内核实现QSA稀疏注意力与GDN线性注意力,不依赖FlashAttention2;支持NFS权重共享或rsync分发两种权重同步方案;PLE表采用内存映射方式加载降低内存占用;仓库附带性能评估文档与单节点适配交接文档,提供完整的部署与运维参考。
本项目是MiaAI Lab推出的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,面向DGX Spark(GB10)硬件,基于vLLM实现双节点TP2+EP+MTP3多节点推理,提供全套适配脚本与内核补丁,解决该模型在特定硬件上的部署适配问题。
本项目是MiaAI Lab推出的面向DGX Spark硬件的Qwen3.8-Flash-Next-NVFP4模型推理部署方案,基于vLLM框架实现多节点/单节点推理服务,提供从权重下载、内核适配到服务启动的全套自动化脚本,降低该模型在特定硬件上的部署门槛,同时支持官方FP8权重的推理部署。
安装前需准备2台DGX Spark节点,配置节点间免密SSH、Docker环境,每节点预留约126GiB空闲空间;复制.env.sample为.env并配置头/工作节点IP、网络接口、IB HCA等参数;在头节点执行./download.sh下载模型权重,添加--fp8参数可下载官方FP8版本权重。
执行./start.sh --no-download完成权重同步、内核补丁应用并启动双节点推理服务,或执行./start-fp8.sh启动官方FP8权重推理服务;通过docker logs vllm-fn查看KV缓存分配与服务状态;执行./stop.sh停止推理服务;运行bench/目录下的脚本开展解码、长上下文等基准测试。