跳到主要内容
项目档案应用项目

MiroFlow 开源 Agent 框架:让任何大语言模型性能更优,支持多模型切换、9+ 基准评测与 Web 界面

MiroFlow 是一个性能优先的开源 Agent 框架,通过智能回滚和迭代推理提升任何 LLM 的 Agent 表现。支持 GPT-5、Claude、Kimi 等模型,在 FutureX、GAIA 等 9+ 基准测试中验证效果。本页提供项目介绍、安装指南、配置使用方法和架构详解。

3,113PythonStar 于 2026年1月9日2026年9月17日 更新

AI 总结

MiroFlow 是一个性能优先的开源 Agent 框架,通过智能回滚、迭代推理和工具编排提升任何大语言模型的 Agent 表现,在 9+ 基准测试中验证效果,并提供 Web 界面与插件化架构。

中文项目介绍

MiroFlow 是一个以性能为导向的开源 Agent 框架,旨在提升任何大语言模型在 Agent 任务上的表现。它解决了不同 LLM 在 Agent 性能上差异显著、缺乏统一评测标准、以及工具集成复杂的问题。通过智能回滚、迭代推理和优化的工具编排,MiroFlow 能让 GPT-5、Claude、Kimi、DeepSeek 等模型在相同工具和环境配置下获得更好的 Agent 效果。 该框架适用于 AI Agent 研究与竞赛、多模型能力对比分析、以及需要快速部署 Web 界面的 Agent 应用场景。其技术特征包括:基于 Hydra 的配置驱动架构,实现模型、工具、提示词和 Agent 图的模块化管理;三层核心设计(LLM 抽象层、工具集成层、Agent 执行引擎);内置 FastAPI + React Web 应用;支持 9+ 基准测试的自动化评测系统;以及通过 @register 装饰器实现的插件化扩展机制。所有配置通过 YAML 文件管理,支持一键模型切换和可复现的基准评估。

详细信息与使用说明

1. 项目定位与用途

MiroFlow 是 MiroMindAI 团队开发的性能优先型开源 Agent 框架,定位为"让任何模型变得更好"的统一 Agent 执行平台。其核心用途是为研究人员和开发者提供一个标准化环境,用于构建、优化和评测基于大语言模型的智能 Agent。框架通过统一的工具集、提示词模板和执行引擎,使不同 LLM(如 GPT-5、Claude、Kimi、MiroThinker 等)能够在相同的条件下进行 Agent 任务,从而公平地比较和提升各模型的 Agent 能力。项目已实现 1.7.0 版本,在 FutureX、GAIA、HLE、xBench-DeepSearch、BrowseComp 等 9+ 个权威基准测试中取得 Top-1 成绩,并通过 Web UI 降低使用门槛。

2. 核心问题与解决方案

MiroFlow 主要解决三大问题:一是不同大语言模型在 Agent 任务上性能差异巨大,缺乏统一的优化手段;二是 Agent 评测标准不统一,难以进行公平对比;三是工具集成复杂,重复造轮子现象严重。针对这些问题,框架提供以下解决方案:通过智能回滚(rollback)、迭代推理(iterative reasoning)和优化的工具 orchestration 机制,在不修改模型本身的情况下提升 Agent 表现;建立标准化的基准评测系统,支持自动化多轮运行、统计聚合(均值、标准差、最值)和可复现结果;提供丰富的内置工具集(网页浏览、代码解释、文档解析等)并通过 MCP 协议封装,实现即插即用。框架证明,相同的工具、提示词和环境配置下,通过 MiroFlow 执行能显著提升各模型的 Agent 性能。

3. 典型应用场景

MiroFlow 适用于以下典型场景:第一,AI Agent 研究与竞赛,研究人员可利用框架快速验证新算法或模型在标准基准上的表现,如 GAIA、HLE、FutureX 等;第二,多模型能力对比分析,企业或团队需要客观评估不同 LLM(GPT 系列、Claude、Kimi、DeepSeek、MiniMax 等)在真实 Agent 任务中的实际效果时,MiroFlow 提供公平的对比环境;第三,生产环境部署与演示,内置的 FastAPI + React Web 应用支持快速搭建交互式界面,适用于客户演示、内部测试或轻量级生产部署;第四,Agent 系统开发,开发者可利用其技能系统(SKILL.md 定义)、Agent 图编排和插件架构(@register 装饰器)构建复杂多 Agent 工作流,而无需从零实现底层逻辑。

4. 安装与环境要求

根据 pyproject.toml 定义,MiroFlow 的安装需满足以下环境要求:Python 版本必须介于 3.11 至 3.13 之间(含边界),低于或高于此范围均不支持。安装方式为通过 pip 安装项目及其依赖,具体命令在仓库中未明确给出,但可推断为 `pip install .` 或 `pip install -e .`(开发模式)。依赖包分为多个类别:核心依赖(hydra-core、mcp、fastmcp、rich、tenacity 等)、LLM 提供商(openai、anthropic、google-genai、tiktoken)、Web 服务(fastapi、uvicorn)、基准测试(datasets、pandas)、文件处理(mammoth、pdfminer、python-pptx、markitdown 等)、爬虫(playwright、pypdf)、沙箱(e2b-code-interpreter)等。安装后需配置相应 LLM 服务商的 API Key 至环境变量(如 OPENAI_API_KEY、ANTHROPIC_API_KEY 等)才能正常调用模型服务。仓库中未提供 Docker 或容器化部署说明。

5. 配置与使用指南

MiroFlow 采用配置驱动模式,所有核心参数通过 config/ 目录下的 YAML 文件管理。使用流程如下:首先,选择或创建配置文件,如 agent_quickstart.yaml 定义 Agent 类型(如 IterativeAgentWithToolAndRollback)、模型(provider_class、model_name)和工具列表;其次,根据需要调整提示词模板(config/prompts/ 目录)或工具配置(config/tool/ 目录);然后,通过命令行运行 Agent 任务或基准测试,具体命令未在仓库中明确给出,但 config/benchmark/ 目录下的 YAML(如 gaia-validation.yaml)展示了任务数、并发数、重试次数等参数;最后,如需 Web 界面,可启动 FastAPI 后端与 React 前端服务。框架支持"一行代码"式模型切换,只需修改 YAML 中的 provider_class 和 model_name 即可在 GPT-5、Claude、Kimi 等模型间切换,工具集和提示词保持不变。对于基准评测,系统会自动执行多轮任务、收集结果并生成排行榜。

6. 架构与扩展特性

MiroFlow 的架构设计体现三大核心层次:底层为 LLM 抽象层,通过统一接口封装 OpenAI、Anthropic、Google、MiroThinker 等不同提供商的 API,使上层无需关心模型差异;中间层是工具集成层,基于 MCP(Model Context Protocol)协议将 Playwright(网页浏览)、e2b(代码解释)、Markitdown(文档转换)等外部能力封装为标准化工具,供 Agent 调用;顶层为 Agent 执行引擎,实现迭代推理、智能回滚、多 Agent 图编排等逻辑,并支持通过 SKILL.md 文件定义技能、通过 @register 装饰器注册插件,实现零代码扩展。此外,框架内置基于 Hydra 的配置管理系统,支持组合与覆盖;提供 Jinja2 模板引擎实现提示词动态生成;并包含完整的基准评测流水线,可自动化执行 9+ 个基准测试并输出统计结果。Web 应用部分采用 FastAPI 提供 REST API,React 构建前端界面,二者分离部署。

思维导图

MiroFlow
项目定位
性能优先 Agent 框架
让任何模型更好
9+ 基准 Top-1
核心特性
模型无关优化
智能回滚与迭代推理
工具编排
插件化架构
技术架构
LLM 抽象层
工具集成层 (MCP)
Agent 执行引擎
配置系统
Hydra + YAML
零代码提示词 (Jinja2)
Agent 图编排
工具生态
网页浏览 (Playwright)
代码解释 (e2b)
文档处理 (Markitdown)
搜索与爬虫
基准评测
FutureX / GAIA / HLE
xBench / BrowseComp
自动化多轮执行
统计聚合与排行榜
Web 应用
FastAPI 后端
React 前端
交互式界面

常见问题

MiroFlow 支持哪些大语言模型?

MiroFlow 支持多种 LLM,包括 GPT-5、Claude、MiroThinker、Kimi K2.5、DeepSeek、MiniMax 以及任何 OpenAI 兼容模型。通过修改 YAML 配置中的 provider_class 和 model_name 即可一键切换。

如何安装 MiroFlow?

需确保 Python 版本在 3.11 至 3.13 之间,然后通过 pip 安装项目依赖(具体命令未在仓库中明确给出,但可推断为 `pip install .`)。同时需配置对应 LLM 服务商的 API Key 至环境变量。

MiroFlow 的主要技术特点是什么?

主要特点包括:配置驱动架构(Hydra + YAML)、三层核心设计(LLM 抽象层、工具集成层、Agent 执行引擎)、插件化扩展(@register 装饰器)、零代码提示词(Jinja2 模板)、内置 Web 应用(FastAPI + React)以及自动化基准评测系统。

如何使用 MiroFlow 进行基准测试?

在 config/benchmark/ 目录下选择或修改基准配置文件(如 gaia-validation.yaml),设置任务数、并发数、重试次数等参数,然后通过命令行运行(具体命令未明确给出)。框架会自动执行多轮任务、聚合结果并生成排行榜。

MiroFlow 的 Agent 执行引擎有哪些核心机制?

核心机制包括:智能回滚(rollback)——在任务失败时自动恢复;迭代推理(iterative reasoning)——通过多轮思考提升答案质量;工具编排(tool orchestration)——优化工具调用顺序和参数;多 Agent 图编排——支持层次化多 Agent 工作流。这些机制共同提升任何模型的 Agent 表现。