1. 项目定位与用途
Pixelle-Video 是一个 AI 全自动短视频引擎,定位为让视频创作成为“一句话的事”的零门槛工具。用户只需提供视频主题,系统即可自动完成从文案撰写、AI 配图/视频生成、语音合成到最终视频合成的全流程。它适用于需要快速产出短视频内容的各类场景,如社交媒体运营、知识分享、产品宣传等,旨在降低视频制作对专业剪辑技能和时间的依赖。
Pixelle-Video 是由 AIDC-AI 开发的 AI 短视频自动化工具,用户只需输入主题即可自动生成完整视频,涵盖文案、配图、配音、配乐和合成。支持 GPT、通义千问等模型,提供 Streamlit Web 界面和 FastAPI 接口,适合内容创作者、营销人员快速制作高质量短视频。本页包含安装指南、使用教程和常见问题解答。
Pixelle-Video 是一个基于 ComfyUI 的 AI 全自动短视频生成引擎,用户只需输入主题,即可自动完成文案撰写、AI 配图/视频生成、语音合成、背景音乐添加和视频合成,实现零门槛视频创作。
Pixelle-Video 是一个 AI 全自动短视频引擎,定位为让视频创作成为“一句话的事”的零门槛工具。用户只需提供视频主题,系统即可自动完成从文案撰写、AI 配图/视频生成、语音合成到最终视频合成的全流程。它适用于需要快速产出短视频内容的各类场景,如社交媒体运营、知识分享、产品宣传等,旨在降低视频制作对专业剪辑技能和时间的依赖。
传统短视频创作需要专业的脚本撰写、素材准备、剪辑合成技能,过程繁琐且成本高。Pixelle-Video 通过 AI 自动化解决了这一问题:利用大语言模型生成文案,使用图像/视频生成模型制作视觉内容,通过 TTS 技术合成语音,并自动合成背景音乐与最终视频。这显著降低了创作门槛、缩短了制作周期,使无经验用户也能高效产出质量较高的短视频。
主要适用场景包括:内容创作者快速生成短视频脚本与成片;营销人员制作产品宣传或广告视频;教育工作者生成教学讲解视频;个人用户记录生活、分享知识或表达观点。此外,支持自定义素材上传与 AI 分析,也适用于需要整合自有媒体资源的创作需求。项目提供的多种模板、视觉风格和视频尺寸(如竖屏 1080x1920)进一步拓宽了其在社交媒体、 presentations 等场景的适用性。
Pixelle-Video 提供多种安装方式:推荐使用 uv 包管理器,运行 `uv sync` 即可自动创建虚拟环境并安装依赖;传统方式可使用 `python -m venv` 创建环境后,通过 `pip install -e .` 安装。Windows 用户可直接下载整合包,双击 `start.bat` 启动。此外,支持 Docker 部署,通过 `docker-compose up` 启动服务。安装后需配置 ComfyUI(部分 AI 生成模板需要)及相应的 AI 服务 API 密钥(如 OpenAI 兼容模型)。
主要使用方式有两种:通过 Streamlit Web 界面,访问 http://localhost:8501,输入视频主题后即可自动生成,过程中可调整模板、视觉风格、视频尺寸、TTS 音色等参数;通过 FastAPI 提供的 REST 接口,以编程方式提交视频生成任务并查询状态。Web 界面支持上传自定义素材(照片/视频),AI 会智能分析并整合到脚本中。生成完成的视频自动保存至 `output/` 目录。
项目采用三层分层架构:Web 层(Streamlit 界面)、服务层(核心业务逻辑)、ComfyUI 层(AI 生成服务)。核心协调器 PixelleVideoCore 整合四大服务:LLM Service(调用大模型生成文案)、Image Service(调用 ComfyUI 或 RunningHub 生成配图)、TTS Service(生成语音解说)、Video Generator(合成最终视频)。支持异步处理,使用 YAML 管理配置,并提供 Python SDK 与 HTTP API。原子能力灵活组合,用户可替换生图模型(如 FLUX)或 TTS 引擎(如 ChatTTS)。
运行命令:`curl -LsSf https://astral.sh/uv/install.sh | sh`,具体可参考项目安装文档。
不一定,取决于所选模板:文本-only 模板(如 simple.html)不需要 ComfyUI;使用 AI 图片模板(如 default.html)则需要。如需 AI 生成但不想本地部署,可使用 RunningHub 云服务替代。
支持所有 OpenAI 兼容的 LLM,包括通义千问(Qianwen)、GPT-4o、DeepSeek 以及本地运行的 Ollama 等。
根据复杂度不同,生成一个 3-5 场景的视频大约需要 2-5 分钟。首次使用可能因模型加载而稍慢。
可尝试以下优化:更换 LLM 模型、调整图片生成尺寸与提示词前缀、更换 TTS 工作流或音色、尝试不同的视频模板,或上传自定义素材进行整合。