跳到主要内容
项目档案库 / SDK

STORM:斯坦福开源LLM知识策展系统,自动生成带引用的类维基百科长文,支持pip安装与多模型适配

STORM是斯坦福Oval团队开源的LLM驱动知识策展系统,可自动完成主题研究、大纲生成到带引用长文产出的全流程,支持人机协作,适用于学术调研、内容创作等场景,本文介绍其定位、安装与使用方法。

31,409PythonStar 于 2026年9月15日2026年9月16日 更新

AI 总结

STORM是斯坦福Oval团队开源的LLM驱动知识策展系统,可自动围绕指定主题开展网络研究、生成带引用的类维基百科长文,辅助学术调研、内容创作等场景的预写作工作。

中文项目介绍

STORM(Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking)是斯坦福大学Oval团队开源的基于大语言模型的知识策展系统,已发布为`knowledge-storm` Python包,核心能力是自动围绕用户指定的主题开展网络研究,最终生成带引用的类维基百科长文。 传统知识类长文撰写需要人工完成大量调研、大纲梳理、引用溯源工作,耗时且门槛高,STORM将全流程自动化,其扩展版本Co-STORM还支持人机协作式知识策展,可让用户对齐需求调整知识产出方向。 系统架构解耦为STORM核心Pipeline、Co-STORM人机协作模块、多源检索模块、多模型适配模块四大核心部分,支持接入OpenAI、Azure OpenAI、Ollama、Groq等多类大语言模型,也支持网络搜索引擎、用户自定义Qdrant向量语料库等多类检索数据源,可灵活适配不同使用需求。 适用于学术研究预调研、知识类内容创作、维基百科条目预写作、企业知识库内容策展等场景,已有超7万用户试用其在线预览版本,配套轻量Streamlit演示界面与多类定制化示例脚本,降低使用门槛。

详细信息与使用说明

1. 项目定位与用途

STORM全称为Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking,是斯坦福大学Oval团队开源的LLM驱动知识策展系统,已发布为`knowledge-storm` Python包。其核心能力是自动围绕用户指定的主题开展网络研究,最终生成带引用的类维基百科长文;扩展版本Co-STORM进一步支持人机协作式知识策展,可让人类用户与AI协同完成知识内容的梳理与产出,相关研究成果已被NAACL 2024、EMNLP 2024接收。

2. 解决的问题

知识类长文(尤其是类维基百科条目)的传统撰写流程需要人工完成主题调研、多视角问题梳理、大纲搭建、内容撰写、引用溯源等多个环节,耗时久且对撰写者的专业背景要求高,难以快速产出结构完整、引用可靠的长文内容。STORM将上述全流程自动化,通过多视角问题探索与模拟对话机制提升调研深度,最终输出带引用的完整长文,大幅降低知识类内容产出的门槛与时间成本。

3. 适用场景

STORM适用于多类知识策展与内容产出的场景:一是学术研究预调研,可快速生成研究方向的综述性内容,辅助研究者快速了解领域现状;二是知识类内容创作,可快速产出主题长文初稿,降低创作门槛;三是维基百科编辑的预写作辅助,可快速搭建条目框架、收集参考资料,提升编辑效率;四是企业/团队知识库的自动化内容策展,可基于自有语料库生成标准化知识内容。

4. 安装方式

项目核心功能已发布为`knowledge-storm` Python包,可通过pip直接安装:执行`pip install knowledge-storm`即可获取最新稳定版本,v1.1.0起已集成litellm以支持更多语言模型与嵌入模型的接入。若需运行特定定制化示例或前端演示界面,可根据对应目录下的`requirements.txt`安装额外依赖,完成本地开发环境的配置。

5. 使用方式

使用前需先配置对应大语言模型与检索服务的API密钥,支持通过`secrets.toml`文件或环境变量两种方式配置,覆盖OpenAI、Azure OpenAI、各类网络搜索引擎、Qdrant向量数据库等服务的密钥配置。配置完成后可参考`examples`目录下的示例脚本调整参数运行:如`run_storm_wiki_gpt.py`演示基于GPT模型生成维基风格文章,`run_costorm_gpt.py`演示人机协作式知识策展流程;也可启动`frontend/demo_light`下的Streamlit轻量演示界面进行可视化操作。

6. 实现特点与补充说明

项目架构高度解耦,四大核心模块可独立替换适配:一是`storm_wiki`模块实现STORM核心Pipeline,包含大纲生成、知识策展、文章生成、文章润色等子环节,各环节可配置不同能力的大语言模型平衡成本与质量;二是`collaborative_storm`模块实现Co-STORM人机协作能力,包含协作引擎、专家生成、grounded问答等子模块;三是`rm`模块集成多源检索能力,支持网络搜索引擎、用户自定义向量语料库等多类数据源;四是`lm`模块统一封装多类大语言模型接入逻辑,降低多模型适配成本。

思维导图

STORM知识策展系统
STORM核心Pipeline
大纲生成
知识策展
文章生成
文章润色
Co-STORM人机协作模块
协作引擎
专家生成
Grounded问答
用户模拟
多源检索模块
网络搜索引擎
向量语料检索
多模型适配模块
OpenAI系列
开源本地模型
其他云服务模型

常见问题

STORM支持哪些大语言模型?

项目通过litellm集成支持多类大语言模型,包括OpenAI GPT系列、Claude系列、Ollama本地部署的开源模型、Groq、Mistral等,也可适配Azure OpenAI等云服务模型。

STORM的检索数据源有哪些?

默认支持You.com、Bing、Brave、Serper、DuckDuckGo、Tavily等多类网络搜索引擎,也支持用户自定义Qdrant向量语料库作为检索数据源,满足自有知识库的检索需求。

如何运行Co-STORM的人机协作模式?

参考examples/costorm_examples/run_costorm_gpt.py示例脚本,配置好对应LLM与搜索引擎的API密钥后运行即可启动Co-STORM流程,支持人类用户与AI协同完成知识策展。

STORM生成的内容可以直接发布吗?

仓库说明STORM目前无法产出直接可发布的成品文章,通常需要一定数量的编辑修改,但已被经验丰富的维基百科编辑证实可在预写作阶段提供有效辅助。