1. 项目定位与用途
Qwen3.5-9B ToolHub 是一个基于 Qwen3.5-9B 多模态大模型的本地一体化部署方案,定位为私有化、离线的 AI 助手服务。它提供友好的 Web 交互界面和标准的 OpenAI 兼容 API,使用户能够在本地环境中安全地使用多模态推理能力,同时集成多种实用工具,无需依赖任何云端服务。
Qwen3.5-9B ToolHub 是基于 Qwen3.5-9B 的本地多模态 AI 助手部署方案,集成联网搜索、图像分析、文件读取工具,提供 Web 界面与 OpenAI 兼容 API。适用于需数据隐私和离线推理的场景,支持 Windows、Docker、WSL 部署。本页涵盖安装、启动、配置及使用详解。
Qwen3.5-9B ToolHub 是一个本地一体化多模态 AI 助手部署方案,集成搜索、图像、文件工具,提供 Web 界面与 OpenAI 兼容 API,实现数据隐私与离线推理。
Qwen3.5-9B ToolHub 是一个基于 Qwen3.5-9B 多模态大模型的本地一体化部署方案,定位为私有化、离线的 AI 助手服务。它提供友好的 Web 交互界面和标准的 OpenAI 兼容 API,使用户能够在本地环境中安全地使用多模态推理能力,同时集成多种实用工具,无需依赖任何云端服务。
项目主要解决三个问题:一是避免云端 API 依赖与数据外泄风险,实现完全本地私有化推理;二是降低多模态模型与工具集成的部署复杂度,提供开箱即用的一体化方案;三是满足离线或网络受限环境下的 AI 助手需求,同时保持与现有 OpenAI 生态的兼容性。
适用场景包括:个人或组织在本地部署 AI 助手进行日常问答与任务处理;安全读取和分析本地敏感文档、日志等私有数据;在离线环境下进行联网信息检索(需配置代理)与摘要生成;理解图像内容、进行局部放大和以图搜图;以及作为 OpenAI 兼容后端,无缝接入 OpenWebUI、Chatbox 等现有客户端应用。
安装方式分三种:Windows 原生路线,双击 bootstrap.bat 或运行 install.cmd,自动创建虚拟环境、安装依赖并下载约 6 GB 模型;Docker Compose 路线,确保 Docker 与 NVIDIA Container Toolkit 可用后,执行 docker compose up --build,模型将缓存在命名卷中;WSL 路线,在 WSL 环境中运行 ./install.sh,底层复用 Windows 主链路。系统要求为 Windows 10/11、NVIDIA GPU 显存 ≥8 GB、Python 3.10+、约 20 GB 磁盘空间。
使用步骤如下:启动服务,运行 start_8080_toolhub_stack.cmd start(或对应 Docker/WSL 脚本),首次加载模型需 30–60 秒;访问 Web 界面,浏览器打开 http://127.0.0.1:8080;调用 API,使用 OpenAI 兼容端点 http://127.0.0.1:8080/v1,支持 /chat/completions 等标准接口;服务管理,通过相同脚本加 stop/restart/status/logs 参数控制服务生命周期。所有工具由模型通过函数调用动态触发。
项目实现特点包括:网关-后端分离架构,网关(FastAPI)处理请求与工具编排,后端(llama.cpp server)专注 GPU 推理;工具即函数,搜索、图像、文件等能力以独立工具模块形式集成;多环境兼容,提供 Windows、Docker、WSL 三种入口;量化灵活,默认 Q4_K_M(约 6.1 GB 显存),支持 Q8(约 10.2 GB)以提升精度。配置通过 .env 文件完成,可调整端口、模型路径、上下文大小、图像 token 范围、文件系统只读根目录等参数。
需要 Windows 10/11 系统、NVIDIA GPU(显存 ≥8 GB)、Python 3.10+,以及约 20 GB 可用磁盘空间。Docker 路线需 Docker 和 NVIDIA Container Toolkit。
Windows 用户双击 bootstrap.bat 或运行 install.cmd 完成安装;Docker 用户执行 docker compose up --build;WSL 用户运行 ./install.sh。启动使用 start_8080_toolhub_stack.cmd start,然后访问 http://127.0.0.1:8080。
内置联网搜索(DuckDuckGo)、网页抓取与摘要、图像上传与分析(局部放大、以图搜图)、本地文件只读访问、代码执行、系统工具及工作流编排,所有工具通过函数调用由模型动态触发。
通过修改项目根目录的 .env 文件进行配置,可设置网关/后端端口、模型路径、上下文大小、图像 token 范围、文件系统只读根目录等。Q8 量化可通过运行 install_q8.cmd 一键切换。
服务启动后,提供 OpenAI 兼容 API 端点 http://127.0.0.1:8080/v1,支持 /chat/completions 等标准接口,可对接任意兼容客户端,如 OpenWebUI、Chatbox 等。