跳到主要内容
项目档案应用项目

Qwen3.5-9B ToolHub 本地部署指南:多模态 AI 助手与工具集成 Web 应用安装使用详解

Qwen3.5-9B ToolHub 是基于 Qwen3.5-9B 的本地多模态 AI 助手部署方案,集成联网搜索、图像分析、文件读取工具,提供 Web 界面与 OpenAI 兼容 API。适用于需数据隐私和离线推理的场景,支持 Windows、Docker、WSL 部署。本页涵盖安装、启动、配置及使用详解。

274PythonStar 于 2026年3月5日2026年9月15日 更新

AI 总结

Qwen3.5-9B ToolHub 是一个本地一体化多模态 AI 助手部署方案,集成搜索、图像、文件工具,提供 Web 界面与 OpenAI 兼容 API,实现数据隐私与离线推理。

中文项目介绍

Qwen3.5-9B ToolHub 是基于 Qwen3.5-9B 多模态大模型的本地一体化部署方案,旨在提供无需云端依赖的私有 AI 助手服务。 项目通过集成联网搜索、图像分析(包括局部放大与以图搜图)、本地文件只读访问等实用工具,使用户能在安全隔离的环境中处理多模态任务,避免数据外泄。 其适用场景包括:本地 AI 助手日常问答、私有文档与日志分析、离线环境下的信息检索与摘要生成、图像内容理解,以及作为 OpenAI 兼容后端接入现有应用生态。 技术实现上,采用网关-后端分离架构:网关基于 FastAPI 提供 Web 界面与 API 接口,后端基于 llama.cpp 进行 GPU 推理;工具以函数调用形式动态触发;支持 Windows 原生、Docker Compose 和 WSL 三种部署方式;并提供 Q4_K_M 与 Q8 两种量化选择,通过环境变量灵活配置推理参数与文件访问范围。

详细信息与使用说明

1. 项目定位与用途

Qwen3.5-9B ToolHub 是一个基于 Qwen3.5-9B 多模态大模型的本地一体化部署方案,定位为私有化、离线的 AI 助手服务。它提供友好的 Web 交互界面和标准的 OpenAI 兼容 API,使用户能够在本地环境中安全地使用多模态推理能力,同时集成多种实用工具,无需依赖任何云端服务。

2. 解决的问题

项目主要解决三个问题:一是避免云端 API 依赖与数据外泄风险,实现完全本地私有化推理;二是降低多模态模型与工具集成的部署复杂度,提供开箱即用的一体化方案;三是满足离线或网络受限环境下的 AI 助手需求,同时保持与现有 OpenAI 生态的兼容性。

3. 适用场景

适用场景包括:个人或组织在本地部署 AI 助手进行日常问答与任务处理;安全读取和分析本地敏感文档、日志等私有数据;在离线环境下进行联网信息检索(需配置代理)与摘要生成;理解图像内容、进行局部放大和以图搜图;以及作为 OpenAI 兼容后端,无缝接入 OpenWebUI、Chatbox 等现有客户端应用。

4. 安装方式

安装方式分三种:Windows 原生路线,双击 bootstrap.bat 或运行 install.cmd,自动创建虚拟环境、安装依赖并下载约 6 GB 模型;Docker Compose 路线,确保 Docker 与 NVIDIA Container Toolkit 可用后,执行 docker compose up --build,模型将缓存在命名卷中;WSL 路线,在 WSL 环境中运行 ./install.sh,底层复用 Windows 主链路。系统要求为 Windows 10/11、NVIDIA GPU 显存 ≥8 GB、Python 3.10+、约 20 GB 磁盘空间。

5. 使用方式

使用步骤如下:启动服务,运行 start_8080_toolhub_stack.cmd start(或对应 Docker/WSL 脚本),首次加载模型需 30–60 秒;访问 Web 界面,浏览器打开 http://127.0.0.1:8080;调用 API,使用 OpenAI 兼容端点 http://127.0.0.1:8080/v1,支持 /chat/completions 等标准接口;服务管理,通过相同脚本加 stop/restart/status/logs 参数控制服务生命周期。所有工具由模型通过函数调用动态触发。

6. 实现特点与配置

项目实现特点包括:网关-后端分离架构,网关(FastAPI)处理请求与工具编排,后端(llama.cpp server)专注 GPU 推理;工具即函数,搜索、图像、文件等能力以独立工具模块形式集成;多环境兼容,提供 Windows、Docker、WSL 三种入口;量化灵活,默认 Q4_K_M(约 6.1 GB 显存),支持 Q8(约 10.2 GB)以提升精度。配置通过 .env 文件完成,可调整端口、模型路径、上下文大小、图像 token 范围、文件系统只读根目录等参数。

思维导图

Qwen3.5-9B ToolHub
网关服务
FastAPI 框架
Web 界面
OpenAI 兼容 API
模型推理后端
llama.cpp server
GPU 推理
GGUF 模型 (Q4_K_M/Q8)
工具集
搜索工具
网页抓取
图像工具
文件工具
代码与系统工具
工作流编排
部署方式
Windows 原生
Docker Compose
WSL
配置管理
环境变量 (.env)
量化选择 (Q4_K_M/Q8)
文件访问范围
推理参数调整

常见问题

Qwen3.5-9B ToolHub 的系统要求是什么?

需要 Windows 10/11 系统、NVIDIA GPU(显存 ≥8 GB)、Python 3.10+,以及约 20 GB 可用磁盘空间。Docker 路线需 Docker 和 NVIDIA Container Toolkit。

如何安装和启动 ToolHub?

Windows 用户双击 bootstrap.bat 或运行 install.cmd 完成安装;Docker 用户执行 docker compose up --build;WSL 用户运行 ./install.sh。启动使用 start_8080_toolhub_stack.cmd start,然后访问 http://127.0.0.1:8080。

ToolHub 支持哪些工具功能?

内置联网搜索(DuckDuckGo)、网页抓取与摘要、图像上传与分析(局部放大、以图搜图)、本地文件只读访问、代码执行、系统工具及工作流编排,所有工具通过函数调用由模型动态触发。

如何配置模型和推理参数?

通过修改项目根目录的 .env 文件进行配置,可设置网关/后端端口、模型路径、上下文大小、图像 token 范围、文件系统只读根目录等。Q8 量化可通过运行 install_q8.cmd 一键切换。

ToolHub 的 API 接口如何调用?

服务启动后,提供 OpenAI 兼容 API 端点 http://127.0.0.1:8080/v1,支持 /chat/completions 等标准接口,可对接任意兼容客户端,如 OpenWebUI、Chatbox 等。