1. 项目定位与用途
MiroFlow 是 MiroMindAI 团队开发的性能优先型开源 Agent 框架,定位为"让任何模型变得更好"的统一 Agent 执行平台。其核心用途是为研究人员和开发者提供一个标准化环境,用于构建、优化和评测基于大语言模型的智能 Agent。框架通过统一的工具集、提示词模板和执行引擎,使不同 LLM(如 GPT-5、Claude、Kimi、MiroThinker 等)能够在相同的条件下进行 Agent 任务,从而公平地比较和提升各模型的 Agent 能力。项目已实现 1.7.0 版本,在 FutureX、GAIA、HLE、xBench-DeepSearch、BrowseComp 等 9+ 个权威基准测试中取得 Top-1 成绩,并通过 Web UI 降低使用门槛。
2. 核心问题与解决方案
MiroFlow 主要解决三大问题:一是不同大语言模型在 Agent 任务上性能差异巨大,缺乏统一的优化手段;二是 Agent 评测标准不统一,难以进行公平对比;三是工具集成复杂,重复造轮子现象严重。针对这些问题,框架提供以下解决方案:通过智能回滚(rollback)、迭代推理(iterative reasoning)和优化的工具 orchestration 机制,在不修改模型本身的情况下提升 Agent 表现;建立标准化的基准评测系统,支持自动化多轮运行、统计聚合(均值、标准差、最值)和可复现结果;提供丰富的内置工具集(网页浏览、代码解释、文档解析等)并通过 MCP 协议封装,实现即插即用。框架证明,相同的工具、提示词和环境配置下,通过 MiroFlow 执行能显著提升各模型的 Agent 性能。
3. 典型应用场景
MiroFlow 适用于以下典型场景:第一,AI Agent 研究与竞赛,研究人员可利用框架快速验证新算法或模型在标准基准上的表现,如 GAIA、HLE、FutureX 等;第二,多模型能力对比分析,企业或团队需要客观评估不同 LLM(GPT 系列、Claude、Kimi、DeepSeek、MiniMax 等)在真实 Agent 任务中的实际效果时,MiroFlow 提供公平的对比环境;第三,生产环境部署与演示,内置的 FastAPI + React Web 应用支持快速搭建交互式界面,适用于客户演示、内部测试或轻量级生产部署;第四,Agent 系统开发,开发者可利用其技能系统(SKILL.md 定义)、Agent 图编排和插件架构(@register 装饰器)构建复杂多 Agent 工作流,而无需从零实现底层逻辑。
4. 安装与环境要求
根据 pyproject.toml 定义,MiroFlow 的安装需满足以下环境要求:Python 版本必须介于 3.11 至 3.13 之间(含边界),低于或高于此范围均不支持。安装方式为通过 pip 安装项目及其依赖,具体命令在仓库中未明确给出,但可推断为 `pip install .` 或 `pip install -e .`(开发模式)。依赖包分为多个类别:核心依赖(hydra-core、mcp、fastmcp、rich、tenacity 等)、LLM 提供商(openai、anthropic、google-genai、tiktoken)、Web 服务(fastapi、uvicorn)、基准测试(datasets、pandas)、文件处理(mammoth、pdfminer、python-pptx、markitdown 等)、爬虫(playwright、pypdf)、沙箱(e2b-code-interpreter)等。安装后需配置相应 LLM 服务商的 API Key 至环境变量(如 OPENAI_API_KEY、ANTHROPIC_API_KEY 等)才能正常调用模型服务。仓库中未提供 Docker 或容器化部署说明。
5. 配置与使用指南
MiroFlow 采用配置驱动模式,所有核心参数通过 config/ 目录下的 YAML 文件管理。使用流程如下:首先,选择或创建配置文件,如 agent_quickstart.yaml 定义 Agent 类型(如 IterativeAgentWithToolAndRollback)、模型(provider_class、model_name)和工具列表;其次,根据需要调整提示词模板(config/prompts/ 目录)或工具配置(config/tool/ 目录);然后,通过命令行运行 Agent 任务或基准测试,具体命令未在仓库中明确给出,但 config/benchmark/ 目录下的 YAML(如 gaia-validation.yaml)展示了任务数、并发数、重试次数等参数;最后,如需 Web 界面,可启动 FastAPI 后端与 React 前端服务。框架支持"一行代码"式模型切换,只需修改 YAML 中的 provider_class 和 model_name 即可在 GPT-5、Claude、Kimi 等模型间切换,工具集和提示词保持不变。对于基准评测,系统会自动执行多轮任务、收集结果并生成排行榜。
6. 架构与扩展特性
MiroFlow 的架构设计体现三大核心层次:底层为 LLM 抽象层,通过统一接口封装 OpenAI、Anthropic、Google、MiroThinker 等不同提供商的 API,使上层无需关心模型差异;中间层是工具集成层,基于 MCP(Model Context Protocol)协议将 Playwright(网页浏览)、e2b(代码解释)、Markitdown(文档转换)等外部能力封装为标准化工具,供 Agent 调用;顶层为 Agent 执行引擎,实现迭代推理、智能回滚、多 Agent 图编排等逻辑,并支持通过 SKILL.md 文件定义技能、通过 @register 装饰器注册插件,实现零代码扩展。此外,框架内置基于 Hydra 的配置管理系统,支持组合与覆盖;提供 Jinja2 模板引擎实现提示词动态生成;并包含完整的基准评测流水线,可自动化执行 9+ 个基准测试并输出统计结果。Web 应用部分采用 FastAPI 提供 REST API,React 构建前端界面,二者分离部署。