跳到主要内容
项目档案应用项目

Parlor:本地实时多模态 AI 对话应用 | 基于 Gemma 4 与 Kokoro 的语音视觉交互工具安装使用指南

Parlor 是一个完全在设备上运行的多模态 AI 应用,支持自然语音和视觉对话。使用 Gemma 4 E2B 理解语音图像,Kokoro TTS 生成回复,无需云端。适用于语言学习、隐私敏感场景。本文提供项目介绍、安装步骤、使用方法和技术细节。

2,068PythonStar 于 2026年4月8日2026年9月19日 更新

AI 总结

Parlor 是一个完全本地运行的多模态 AI 应用,支持实时语音和视觉对话,使用 Gemma 4 E2B 理解语音图像,Kokoro TTS 生成回复,无需云端服务,保护隐私并降低延迟。

中文项目介绍

Parlor 是一个创新的本地多模态 AI 对话系统,允许用户通过自然语音和摄像头与 AI 进行实时交互。它完全在设备上运行,无需任何云端服务,从而消除了成本、隐私和网络依赖问题。 项目核心使用 Google 的 Gemma 4 E2B 模型进行语音和视觉理解,结合 Kokoro 文本转语音引擎生成自然语音回复。通过 WebSocket 实现浏览器与 FastAPI 服务器之间的低延迟通信,支持语音活动检测(VAD)、打断(Barge-in)和句子级流式 TTS,确保对话体验流畅自然。 主要适用场景包括语言学习(如英语口语练习)、本地 AI 助手、隐私敏感对话以及离线环境下的 AI 交互。当前为研究预览版,存在已知的 rough edges 和 bugs,不适合生产环境使用。

详细信息与使用说明

1. 项目定位与用途

Parlor 是一个完全在设备上运行的多模态 AI 应用,旨在提供自然、实时的语音与视觉对话体验。用户可以通过麦克风说话、展示摄像头画面,与 AI 进行交互,所有处理均在本地完成,无需网络连接或云端 API。主要用途包括语言学习练习、本地 AI 助手以及隐私敏感的对话场景,特别适合希望避免云端成本和数据外泄的用户。

2. 解决的问题

Parlor 解决了传统云端 AI 服务的三大痛点:一是消除服务器成本,所有计算在用户设备上进行;二是保护用户隐私,语音和图像数据无需上传第三方;三是摆脱网络依赖,实现离线可用。此外,通过使用高效的 Gemma 4 E2B 模型,它在消费级硬件(如 M3 Pro 或带 GPU 的 Linux 机器)上实现了实时推理,使本地多模态 AI 成为可能。

3. 适用场景

主要适用场景包括:语言学习(如英语口语练习,AI 可实时纠正和对话)、本地 AI 助手(在无网络环境下提供交互)、隐私敏感场景(医疗、个人对话等数据不愿上传云端)、以及离线环境(如旅行、偏远地区)。由于模型支持多语言,用户可随时用母语交流,适合全球语言学习者。注意,当前为研究预览版,不适合生产环境。

4. 安装方式

安装需满足:Python 3.12+,macOS with Apple Silicon 或 Linux with 支持的 GPU,约 3GB 空闲 RAM。步骤:1. 克隆仓库:git clone https://github.com/fikrikarim/parlor.git;2. 安装 uv 包管理器(如未安装):curl -LsSf https://astral.sh/uv/install.sh | sh;3. 进入 src 目录,运行 uv sync 安装依赖;4. 运行 uv run server.py 启动服务器。模型首次运行自动下载(约 2.6GB)。也可通过 .env.example 设置 MODEL_PATH 和 PORT 环境变量。

5. 使用方式

启动服务器后,在浏览器打开 http://localhost:8000,授予摄像头和麦克风访问权限。即可开始与 AI 对话:说话时 AI 会通过 VAD 检测语音活动,无需 push-to-talk;展示摄像头画面可让 AI 看到视觉内容;说话可打断 AI 回复(Barge-in);TTS 流式输出,句子生成后立即播放。浏览器界面会显示实时转录。所有通信通过 WebSocket,音频为 PCM 格式,视频为 JPEG 帧。

6. 补充说明与实现特点

项目采用 FastAPI 作为后端服务器,通过 LiteRT-LM 运行 Gemma 4 E2B 模型进行多模态推理。TTS 引擎平台感知:macOS 使用 MLX 后端,Linux 使用 ONNX 后端,统一调用 Kokoro 模型。前端 index.html 集成 Silero VAD 实现浏览器端语音活动检测。性能方面,在 Apple M3 Pro 上端到端延迟约 2.5-3.0 秒,解码速度约 83 tokens/sec。仓库包含 benchmarks 目录用于性能测试。注意:此为研究预览版,存在 rough edges 和 bugs。

思维导图

Parlor 项目
核心组件
Gemma 4 E2B 模型
Kokoro TTS 引擎
Silero VAD(浏览器端)
前端
index.html 单页应用
摄像头捕获
音频播放与转录
WebSocket 通信
后端
FastAPI WebSocket 服务器
平台感知 TTS 引擎(MLX/ONNX)
LiteRT-LM 推理
流式响应与打断支持
依赖与配置
uv 包管理器
pyproject.toml
.env 环境变量(MODEL_PATH, PORT)
自动模型下载
性能与优化
实时推理(~2.5-3.0s 延迟)
流式 TTS
GPU 加速(Apple Silicon/Linux)
内存占用 ~3GB

常见问题

Parlor 支持哪些操作系统和硬件?

需要 Python 3.12+,macOS with Apple Silicon 或 Linux with 支持的 GPU,约 3GB 空闲 RAM。具体 GPU 支持未在仓库中详细列出,但参考性能数据基于 Apple M3 Pro。

模型文件如何获取?需要网络吗?

首次运行服务器时,会自动从 HuggingFace 下载 Gemma 4 E2B(约 2.6GB)和 TTS 模型,需要网络连接。之后可离线使用。也可通过设置 MODEL_PATH 环境变量指定本地模型路径,避免重复下载。

是否支持离线使用?

是的,一旦模型下载完成,所有语音和视觉处理均在本地设备进行,无需网络连接。但首次下载模型需要网络。

支持哪些语言?

Gemma 4 是多语言模型,用户可随时用母语交流。Kokoro TTS 也支持多种语言。但具体支持的语言列表未在仓库中明确给出,需参考模型本身文档。

这是生产级应用吗?

否。README 明确标注为“Research preview”,是早期实验,存在 rough edges 和 bugs,不适合生产环境使用。