1. 项目定位与用途
AI漫导(DirectorAI)是一款基于Flutter框架开发的移动应用程序,专注于AI驱动的漫剧(漫画风格视频)内容生成。项目核心定位是降低动画视频创作门槛,使普通用户能够在手机上通过简单的文字描述,快速生成包含剧本、分镜图片和合成视频的完整漫剧作品。应用采用智能体架构,能够自主理解用户意图,协调多个AI模型完成从创意到成片的端到端流程,适合内容创作者、教育工作者和娱乐用户进行快速原型制作或成品输出。
AI漫导是一款基于Flutter的移动应用,采用ReAct智能体架构,集成GLM-4.7、Gemini等AI模型,能理解用户文字描述并自动生成剧本、分镜图片及合成完整漫剧视频。核心创新是角色三视图方案确保多场景人物一致性,适合个人创作者快速制作短篇漫剧、营销动画等内容。本页提供项目介绍、安装指南、使用教程及技术架构详解。
AI漫导是一款基于Flutter的移动应用,采用ReAct智能体架构集成GLM-4.7、Gemini等AI模型,实现从文本描述一键生成剧本、分镜及完整漫剧视频,核心创新在于角色三视图方案确保多场景人物一致性。
AI漫导(DirectorAI)是一款基于Flutter框架开发的移动应用程序,专注于AI驱动的漫剧(漫画风格视频)内容生成。项目核心定位是降低动画视频创作门槛,使普通用户能够在手机上通过简单的文字描述,快速生成包含剧本、分镜图片和合成视频的完整漫剧作品。应用采用智能体架构,能够自主理解用户意图,协调多个AI模型完成从创意到成片的端到端流程,适合内容创作者、教育工作者和娱乐用户进行快速原型制作或成品输出。
项目主要解决两类问题:一是创作门槛问题,传统动画制作需要专业技能和工具,而AI漫导通过全流程自动化,让无经验用户也能生成高质量漫剧;二是人物一致性问题,在多场景视频中保持角色外观统一是AI生成的难点,本项目创新性地引入角色三视图方案,将正面、侧面、背面组合图作为角色身份证,使AI在生成各场景时能准确识别并保持角色特征,从而实现跨场景人物高度一致。此外,项目还解决了移动端高效运行和多模型协同编排的技术挑战。
AI漫导适用于多种创作场景:个人用户可快速生成短篇AI漫剧故事,用于社交分享或创意表达;内容创作者能制作营销广告、教育讲解或产品演示动画,提升内容吸引力;教育工作者可以创建教学视频,使知识点更生动;手机端用户可随时进行分镜原型设计,验证创意构思;此外,系列视频创作者能利用角色一致性方案,制作保持角色统一的连续剧集。项目特别适合需要频繁产出动画内容但资源有限的个人或小团队。
根据仓库信息,安装步骤如下:首先确保环境满足Flutter SDK >= 3.0.0和Dart SDK >= 3.0.0,并安装Android Studio或VS Code及Android设备/模拟器。然后克隆项目仓库到本地,在项目根目录运行`flutter pub get`安装依赖包。接着配置API Token:在`lib/services/api_service.dart`中设置智谱AI API Token,或使用苍何API Key(推荐)。最后连接Android设备或启动模拟器,执行`flutter run`启动应用。注意:仓库中未明确给出iOS或Web端的详细安装步骤,当前主要支持Android平台。
使用应用时,打开主聊天界面,输入创意描述(如"制作一个雪地里的冒险故事"或"生成一个小姐姐做草莓蛋糕的10秒视频")。AI智能体通过ReAct循环理解需求:先由GLM-4.7分析意图并生成剧本,然后提取角色特征生成三视图,接着调用Gemini生成各场景分镜图,再调用Veo将图片转换为视频,最后合并所有视频片段。用户可在应用中预览生成的分镜和视频,进行审核或调整,确认无误后合成完整漫剧视频并保存到相册。仓库中未明确给出批量生成或高级编辑功能的详细操作。
项目实现上具有几个显著特点:一是采用ReAct(Reasoning + Acting)智能体架构,通过观察-思考-行动循环实现自主决策与工具调用;二是创新的人物一致性方案,角色三视图作为身份证被用于所有场景图片生成,确保角色外观统一;三是模块化设计,代码结构清晰分离控制器、服务、模型和界面,便于维护;四是支持多AI模型集成,通过API服务层抽象可灵活替换或扩展模型;五是提供本地缓存机制(Hive、视频缓存)优化性能;六是包含丰富的配置选项,如最大迭代次数、API端点等可调整。仓库中的文档详细描述了图像生成、视频处理等接口规范。
在 lib/services/api_service.dart 文件中找到 ApiConfig 类,将 bearerToken 字段替换为你的智谱 AI API Token;或使用苍何 API,将 baseUrl 设为 https://api.canghe.ai/v1 并配置相应 Key。具体获取方式见仓库文档。
项目集成智谱 AI 的 GLM-4.7 用于智能决策与剧本生成,Google 的 Gemini-3-Pro-Image-Preview 用于文本生成图片,以及基于 Sora 技术的 Veo3.1 用于图片生成视频。也可通过苍何 API 调用其他模型。
角色三视图将同一角色的正面、侧面、背面组合成一张图片作为角色身份证。在生成各场景分镜时,AI 会参考此身份证识别角色完整外观特征,从而确保在多个场景中生成的人物形象高度统一。方案支持最多 2 个主要角色。
根据仓库信息,当前主要支持 Android 平台,需连接 Android 设备或模拟器运行。项目基于 Flutter 开发理论上可跨平台,但 iOS 和 Web 端的详细安装步骤在仓库中未明确给出。
生成时间取决于场景数量、图片生成速度和视频处理复杂度。通常每个场景的图片生成需数秒至数十秒,视频转换需更长时间。具体耗时受 API 响应、网络状况和设备性能影响,仓库中未提供确切时间承诺。