学术前沿

Chat-RFB:一种基于知识图谱与大型语言模型的流电池聊天系统

来源:

时间:2026.03.05

分享:

作者:王昊天ⁿᵇ、白雪峰ⁿᵇ、郑志玲ᶜ、张鑫ⁿᵇ*、金瑞鹏ⁿᵇ、安昊天ⁿᵇ、谢正和ⁿᵇᵈ、吕秀良ⁿᵇ*、李建荣ⁿᵇ*

(作者单位标注:a、b、c、d 为不同合作研究单位)


摘要


氧化还原液流电池(RFBs)的跨学科特性(涵盖化学、材料科学与工程领域)导致研究体系庞大且碎片化,阻碍了知识的有效整合。因此,构建智能问答系统对组织分散知识、提升信息检索效率、降低全面理解门槛至关重要。本研究利用大型语言模型(LLMs)的自然语言处理能力与知识图谱(KGs)的结构化特性,开发了名为Chat-RFB的液流电池领域聊天模型。通过分析5353篇液流电池相关文献并解构文本内容,我们识别出近164,232个节点,并构建了853,939个节点间关联关系。该过程显著提升了LLMs在专业领域知识问答中的能力。鉴于液流电池领域评估模型响应性研究有限,我们采用选择题与非选择题相结合的方式对模型性能进行了评估。研究结果表明,通过整合专业知识库,Chat-RFB显著提升了专业领域知识水平。在选择题准确率 方 面 ,Chat-RFB 达 到 94.9%,DeepSeek-v3 为 90.9%,GPT-4o 为 90.7%,Qwen-Max 为 90.4%,Gemini-2.5-Flash为91.1%;在非选择题准确率方面,Chat-RFB为93.3%,DeepSeek-v3为73.3%,GPT-4o为68.9%,Qwen-Max为75.6%,Gemini-2.5-Flash为86.7%。


引言

随着不间断电源、应急备用电源、智能电网等可再生能源技术的飞速发展,大规模电池储能系统的市场需求持续攀升。在各类并网可充电储能技术中,液流电池凭借其独特优势成为极具发展前景的技术方向。液流电池是储能研究领域的重要交叉学科方向,融合了化学、材料科学和系统工程学等多领域知识,其设计具备灵活的模块化特征,可独立调节储能容量和功率输出,同时拥有循环寿命长、安全性能高的特点,这些优势使其成为液流电池技术领域的研究热点。


目前液流电池相关研究成果丰硕,学术文献中积累了大量有价值、可验证的研究数据,但人工从海量文献中提取材料基础信息的过程耗时费力,严重降低研究效率,增加科研时间成本。大语言模型经过海量语料预训练,具备强大的语言理解能力,能响应用户的自然语言查询,自动完成文献内容的提取、语义分析和逻辑推理。凭借良好的泛化能力、多任务处理能力和语境理解能力,大语言模型有望融入智能体系统,成为辅助科学研究的智能工具。


但需注意的是,大语言模型在科学研究应用中存在显著局限性:其基于通用知识数据集训练,在专业领域的知识储备不足;同时,大语言模型的上下文窗口容量有限,单次可处理的信息规模受限,分析长文档时易出现大量信息丢失或 “语境遗忘” 问题。传统的文献检索方式也存在类似短板,往往仅能从文章摘要中提取表层信息。为解决上述问题,人工智能框架中的检索增强生成技术应运而生。该技术能让系统根据用户输入,从知识库中精准检索最相关的信息片段,再由大语言模型将这些检索信息作为上下文,生成更准确、贴合事实、内容丰富的回答。例如,ChemReactSeek 平台就是基于文本向量化的检索增强生成技术构建的多相加氢反应人工智能平台。


融合知识图谱的检索增强生成框架成为解决该问题的理想方案,任何结构化数据都能提升大语言模型的信息密度,而知识图谱凭借其对科学知识复杂多关系特征的建模能力,具备其他简单结构化格式无法比拟的优势。知识图谱通过图形模型描绘实体、概念及其相互关系,构建清晰的逻辑结构,为科学问答所需的深度推理和关系遍历提供支撑,助力研究人员理解复杂概念。此外,知识图谱能高度凝练从全文提取的关键信息,在有限空间内呈现核心节点信息,加速科学发现进程。目前,大语言模型与知识图谱的融合应用已在医学、材料科学、化学等领域展开探索,但构建一套涵盖自动化知识提取、领域专属知识图谱构建、检索增强生成式问答,且经过系统评估的端到端框架,仍是当前的前沿挑战。


本研究正是针对这一挑战展开,通过在液流电池领域搭建并验证这套综合框架,证实其作为下一代科研辅助工具的巨大潜力。为填补该领域的研究空白,我们研发了 Chat-RFB 这一领域专属智能助手,将大语言模型与结构化知识库融合,实现液流电池相关知识的精准、高效检索。研究中,我们利用大语言模型对 5000 余篇相关文献组成的海量语料进行高通量解析和关键词提取,构建出包含 164232 个节点、853939 条关联关系的知识图谱,且以每篇文献的数字对象唯一标识符(DOI)作为专属标识。同时,我们构建了自动化测试集,评估该系统在液流电池领域的专业分析和总结能力。测试结果表明,Chat-RFB 的性能显著优于基础大语言模型;且在测试过程中,通过构建覆盖全文的节点信息知识图谱,可对文献中无法通过总结获取的重要信息进行查询,有效拓展了系统的应用场景。Chat-RFB 的工作流程如图 1 所示,其技术实现细节和具体应用将在后续章节详细阐述。

图 1 液流电池领域知识图谱增强的大语言模型系统(Chat-RFB)的构建与应用流程

(注:黄色区域为知识图谱构建环节,蓝色区域为 Chat-RFB 系统构建环节,流程包含文献导入、DOI 匹配、文本拆分、节点与关系生成、数据库存储、知识图谱构建,以及用户提问、提示词输入、密码学查询编码、知识图谱检索、增强型人工智能分析、结果输出等关键步骤。)


研究方法

相关文献信息收集

为筛选液流电池相关期刊文献,我们在 Web of Science 数据库中进行全面检索,收集了截至 2025 年 5 月发表的所有相关文献。为最大限度覆盖该领域的相关研究,我们以 “flow battery(液流电池)” 为关键词,采用标题检索方式(TI = (flow battery))开展检索。


从 Web of Science 数据库中导出所有检索文献的 DOI 信息,基于这些 DOI,通过高通量方法将文献全文下载至本地。具体而言,我们编写了定制化 Python 脚本,结合 requests 和 langchain_text_splitters 库,从出版商网站自动获取 PDF 格式的文献全文。考虑到大语言模型的上下文输入令牌限制,我们将长文本分割为可处理的文本块,采用基于字符的文本分割器(CharacterTextSplitter),以空格为分割依据,设置每个文本块的最大字符数为 20000,相邻文本块的重叠字符数为 500。该方式既能保证文本分割后的语义连续性,又能适配模型的输入限制(详见补充材料图 S2、S3)。


随后,利用 DeepSeek-v3 模型从分割后的文本段中高通量提取节点和关联关系信息。为方便后续检索,我们通过提示词工程对大语言模型进行约束,使其在输出节点信息时添加标签,提升检索效率和节点的信息含量。提示词中明确了任务要求和输出格式(详见补充材料图 S1),最终生成标准化的 JSON 文件(详见补充材料图 S4、S5)。为定量评估信息提取的质量,我们建立了由领域专家执行的严格人工评估流程,将信息提取任务定义为决策过程:模型需针对源文本中的每一条潜在知识,判断是否将其提取为准确、相关的关联关系,以此为基础,采用基于真阳性、假阳性、假阴性的标准评估框架开展评估。


本研究由两名液流电池领域的研究人员,对随机抽取的 500 组由模型提取的 “节点 - 关系” 三元组,结合原始文献进行独立评估,意见分歧处通过讨论达成共识。评估标准定义如下:


真阳性(TP):若提取的关联关系符合源文本事实,且是液流电池领域有意义的核心信息,则判定为真阳性;
假阳性(FP):若提取的关联关系与源文本事实不符、对源文本存在误读,或属于模型无依据的生成内容(幻觉),则判定为假阳性;
假阴性(FN):若源文本中明确记载的核心信息未被模型提取,则判定为假阴性。
基于该框架,可计算精确率、召回率等标准指标,对知识提取流程的性能进行可靠评估。


KG的构建与使用
为搭建适用于后续分析的结构化、可靠数据集,我们首先将所有 JSON 文件整合为原始的逗号分隔值(CSV)文件,再从 CSV 文件中提取目标列表信息,该数据提取过程采用标准解析技术,确保准确获取所有相关条目。为实现对单个记录的精准追踪和引用,我们为每条条目分配全局唯一标识符(UUID),通过跨所有记录的 UUID 比对,识别并删除重复条目,得到无冗余的纯净数据集。去重过程是消除冗余引发的偏差、提升数据集整体完整性和分析有效性的关键。


本研究采用 Neo4j 软件构建知识图谱,通过 Neo4j admin 的导入命令批量处理 CSV 文件并创建数据库,再调用 Neo4j 图数据库对数据进行可视化和分析,研究所用 Neo4j 软件版本为 5.25.1。


LLM与KGs的集成
基于大语言模型的检索增强生成流程将问答过程分为四个步骤(详见图 2):


  1. 生成密码学查询语句:大语言模型首先从用户问题中提取关键词,识别推理节点或关联关系信息,随后构建密码学(Cypher)查询语句,访问 Neo4j 数据库并检索相关信息;
  2. 执行查询并检索数据:在 Neo4j 数据库中执行上述 Cypher 查询语句,从知识图谱中提取与用户问题相关的数据;
  3. 生成回答:大语言模型将从知识图谱中检索到的数据作为提示信息,理解并分析用户问题,生成精准、专业的回答;
  4. 生成新的对话内容:受大语言模型上下文长度限制,无法将前序交互中无限量的数查询结果保存为对话历史。因此,开启新的对话内容时,系统会删除前序检索数据,仅保留对话文本内容;接收到新问题后,重复上述 1-3 步骤。

本研究通过 OpenAI 扩展库应用程序编程接口(API)调用大语言模型,具体版本信息详见补充材料表 S1,除上下文长度限制外,所有模型均采用相同参数设置。


(注:为克服模型的上下文容量限制,系统将移除前序对话中使用过的检索数据,仅保留对话内容本身。)



LLM-KGs系统的评价

为全面评估大语言模型在化学领域的知识储备、直觉判断和推理能力,ChemBench 数据集常被用作评估化学能力的基准数据集,能有效评估大语言模型在分子性质、化学反应、材料科学、模型设计等通用科学领域的应用能力。但该数据集虽覆盖化学领域多个方向,并非针对液流电池这一高度交叉的特定领域设计。


为评估知识图谱增强的大语言模型在液流电池领域的性能,我们设计了一套液流电池相关问题测试集,包含 450 道选择题(203 道判断题、247 道单项 / 多项选择题)和 45 道非选择题。测试集的所有问题均由大语言模型随机批量读取文献后,基于文献内容生成,覆盖液流电池从基础材料科学(分子设计、电解质化学、电极材料)、电化学性能(氧化还原反应、反应动力学、衰减机制)、系统工程(流道设计、能量密度提升、热管理)到应用层面(经济性、环境友好性、安全性、极端条件适应性)的全领域研究内容,并突出了表征分析技术在揭示反应机制、优化性能中的重要作用。测试集的问题及参考答案详见补充材料 SI2。


为保证测试集的公平性和严谨性,所有问题的设置均经过严格推敲,答案均来源于相关文献。在对选择题进行系统评估的同时,我们进一步采用 45 道非选择题测试模型性能,使评估更贴近日常自然语言对话场景。本研究制定评分标准对大语言模型的回答进行评估,为便于分析模型的可用性,若模型输出存在明确的错误信息,则判定其回答不合格。具体评估标准如下:


优秀(完全正确):回答完全符合问题要求,内容准确、逻辑清晰,能彻底解答提问者的疑问;
良好(部分正确):回答存在一定合理性,但仅覆盖问题部分关键点,或存在轻微的信息偏差;
一般(无明显错误,但回答过于笼统,缺乏专业性):回答无明显错误,但内容泛化,未针对问题核心展开,缺乏必要的深度;
较差(存在明显错误):回答包含明显的错误信息,可能对提问者产生误导,无法解决问题。


为便于评估模型能力,本研究将未出现严重错误(评分高于 “较差”)的回答判定为 “合格”。


结果与讨论

Chat-RFB 系统的构建
在数据预处理阶段,我们检索并收集了 5353 篇发表的液流电池高相关度学术论文,通过文本转换对文献内容进行分割和格式转换,存储为.txt 文件,既方便大语言模型检索,又不破坏文章的语义结构。随后,利用 DeepSeek-v3 模型对这些文件进行深度解析,识别关键信息并将其整理为带标签的节点和关联关系,最终将文本内容转换为关系数据格式,构建出包含 164232 个节点、853939 条关联关系的知识图谱。
如补充材料图 S2-S5 所示,大语言模型能准确识别文章的核心要素,包括研究内容、研究方法、理论概念等;通过定制化的提示词工程,这些信息被成功转换为结构化的 JSON 格式。该步骤对知识图谱的构建至关重要,直接影响图谱中节点的质量和准确性。
为进一步保证质量,我们对大语言模型提取的 500 个节点及其相关关联关系进行人工审核,评估模型在文本实体提取任务中的表现(详见补充材料图 S6)。结果显示,模型在精准、全面的信息提取方面,真阳性率达 97.8%;关键信息缺失的假阴性案例占比 2%;信息提取不准确的假阳性案例占比仅 0.2%,综合评估的 F1 分数高达 0.9889。这表明,在提示词工程的引导下,大语言模型在液流电池文献文本信息提取任务中表现优异。基于此,我们将该模型应用于大规模自动化信息提取,随后对提取的信息进行批量标注,并整合至 Neo4j 数据库,最终构建出融合知识图谱的大语言模型智能系统,详细实现代码见研究源文件。

Chat-RFB 系统的应用
Chat-RFB 系统不仅能帮助用户通过自然语言高效查询知识图谱,还能通过知识图谱的输出数据反馈,解决大语言模型事实性错误、领域针对性不足等核心问题。尤其是将知识图谱的查询结果作为上下文提示信息传递给大语言模型后,可根据用户需求灵活调整知识信息的呈现形式,保证模型知识获取的高相关性,显著提升模型的推理质量和解释性,同时减少模型幻觉现象,为科研人员提供精准的研究指导。


软 - 硬两性离子捕获剂(SH-ZITs)是一种新型添加剂材料,具有溶解性好、稳定性高、电化学性能优异的特点,可用于研发高效、高性能的电池技术。在提示词工程的有效引导下(详见补充材料图 S10),大语言模型能准确识别相关问题内容,并通过简单的 Cypher 语句,在知识图谱中检索与软 - 硬两性离子捕获剂相关的信息。图 3 为以软 - 硬两性离子捕获剂为核心的关系节点示意图,高度凝练了相关文献的核心内容。

图 3 软 - 硬两性离子捕获剂的关系节点示意图

知识图谱不仅为研究人员提供了全面、多维的材料信息数据库,还为材料科学的研发工作提供了强有力的数据支撑。研究人员可通过自然语言对话访问该聊天系统,获取液流电池领域的前沿信息,这种结构化的数据呈现形式,能帮助研究人员直观把握材料间的关联关系,以及材料在不同应用场景中的潜在价值。


目前,知识图谱与大语言模型融合以提升问答能力的应用已在多个领域展开。本研究以 DeepSeek-v3 为基础模型,采用检索增强生成方法,基于液流电池领域的文献构建知识图谱,研发出 Chat-RFB 系统,有效提升了模型在液流电池领域的信息获取能力和专业问题解答能力。如图 4 左右两侧的对比所示,我们将知识图谱增强的 DeepSeek-v3 模型(即 Chat-RFB)与基础大语言模型,以及 GPT-4o、通义千问 Max、Gemini 2.5 Flash 等常用大语言模型进行性能对比。对于 “液流电池中的软 - 硬两性离子捕获剂是什么?” 这类专业问题,通用大语言模型常因知识储备不足或产生幻觉,给出模糊甚至错误的回答;而 Chat-RFB 通过对结构化知识图谱的 Cypher 查询,能直接从文献中检索到准确的定义和来源参考文献,这种结构化的检索方式大幅降低了模型幻觉的概率,保证回答的事实性和可溯源性。

图.4 Chat-RFB与五种原生LLM多轮问答格式的对比:“流电池中的SH-ZIT是什么?”及“使用高斯模拟分析这些分子性质的计算方法是什么?


值得注意的是,与网络检索增强的 DeepSeek-v3(网络检索版)和 GPT-4o(网络检索版)模型相比,Chat-RFB 的信息准确性更高,具体问答过程详见补充材料图 S13-S19。当被问及软 - 硬两性离子捕获剂的实验细节(如文献中使用的高斯模拟计算方法)时,网络检索因信息片面,无法获取详细的实验数据;而 Chat-RFB 依托内容丰富的实时数据库查询,能获取密度泛函理论(DFT)计算的实时参数数据,给出准确、有效的回答,这对研究人员在相同条件下开展实验对比具有重要意义。


该案例充分体现了知识图谱增强的大语言模型在提升科学研究准确性方面的优势,使其成为领域专属研究更可靠的辅助工具。这一过程也展现了知识图谱对关联关系的显性建模能力 —— 从材料(软 - 硬两性离子捕获剂)到来源文献(DOI),再从文献到具体的计算方法,这种关联建模让系统能解答复杂的多步骤问题,而这类问题对仅依赖非结构化文本或低维度关系数据结构的模型而言,往往难以解决。


Chat-RFB 能提供准确的信息来源,有效解决了大语言模型在文献引用和溯源方面的局限性。当用户对模型进行追问时,系统能进一步理解上下文内容,开展深度检索,为用户提供高度相关的文献索引。选择题答题准确率近 4% 的提升表明,Chat-RFB 有助于提升事实性回答的准确性,但由于许多问题的答案已包含在大语言模型的预训练知识中,其提升效果相对有限;而非选择题答题合格率 16%-22% 的大幅提升,凸显了知识图谱在减少模型幻觉、提升回答完整性方面的核心作用。与选择题不同,非选择题要求模型完成知识的检索、整合和阐述,纯预训练模型在这类任务中往往表现不佳,而 Chat-RFB 通过结构化检索,保证回答均基于已验证的文献,有效提升了答题准确率。这表明,知识图谱增强的大语言模型在复杂推理任务中表现优异,而对基于事实的记忆类任务的提升作用相对温和。


随后,我们通过 450 道选择题对 Chat-RFB 模型的性能提升效果进行定量分析,如图 5a 所示,当前主流通用大语言模型的选择题答题准确率相近,而在知识图谱数据的辅助下,Chat-RFB 的答题准确率达 94.9%(详见补充材料表 S3)。考虑到大语言模型常应用于自然语言对话场景,我们除设计有固定答案的选择题外,还构建了由领域专家审核的 45 道非选择题测试集。如图 5b 所示,展示了通用大语言模型与经知识图谱优化的 Chat-RFB 在非选择题答题性能上的对比结果。所幸,在知识图谱数据的引导下,大语言模型的幻觉现象得到有效抑制,Chat-RFB 的非选择题答题合格率达 93.3%。

图.5 Chat-RFB与DeepSeek-v3、GPT-4o、Qwen-Max及Gemini的应答能力对比:(a)非选择性应答任务准确率对比;(b)选择性与非选择性问题准确率柱状图对比。


除整体合格率外,对 “优秀(完全正确)” 回答的统计进一步凸显了 Chat-RFB 的优势:在 45 道非选择题中,Chat-RFB 给出 27 道完全正确的回答,优秀率达 60.0%(详见补充材料表 S2),显著优于基础模型(优秀率均低于 30%)。这表明,Chat-RFB 不仅能提升整体答题准确率,还能增强回答的精准度和完整性,二者之间的显著差距证明,知识图谱的融合有助于模型生成更可靠的领域专属回答,进一步验证了其在处理复杂科学问题时的有效性。


系统的模块化设计与长期可持续性
任何依托大语言模型实现快速迭代的科学工具,都需考虑其长期可持续性。本研究认为,将 Chat-RFB 的未来发展完全绑定于某一商业 API,缺乏可持续性。为解决这一问题,我们采用模块化架构设计,保证系统的鲁棒性、灵活性和长期可用性。


Chat-RFB 被清晰地解耦为两个核心模块:持久化知识库和可替换的大语言模型交互层。这种设计分离使底层大语言模型的替换成为标准化的工程任务,而非对系统的颠覆性重构。为应对特定 API 版本被弃用或无法访问的风险,我们规划了清晰的迁移路径:
向其他商业大语言模型 API 迁移:通过动态 API 调用模块实现与大语言模型的交互,该模块本质上是一个封装层,可调用不同的 Python 库(如 OpenAI、anthropic、google.generativeai)。我们设计了 “优先级 - 备用” 调用机制:系统首先尝试调用首选模型(目前为 DeepSeek-v3),若 API 调用失败(如网络错误、API 弃用、访问权限变更),模块会自动捕获异常,并按照预设的优先级顺序无缝切换至备用模型(如 GPT-4、Gemini Pro 等),保证服务的连续性。


此外,需重点强调的是,在知识提取阶段,大语言模型主要用于一次性的离线批量处理,其生成的知识图谱是独立、持久的资产;系统对实时 API 的依赖主要体现在问答生成阶段,而这正是我们的模块化和动态调用机制解决的核心问题。
但目前,知识图谱的构建仅涵盖液流电池领域的关联关系,旨在高效获取模型的核心内容信息,尚未融入其他领域的知识,因此模型现阶段仅能对已知知识进行总结,缺乏对相关课题的创新思考能力。


结论
本研究研发了 Chat-RFB—— 首个融合大语言模型与知识图谱的液流电池领域智能问答系统。研究利用大语言模型的自然语言处理能力,对 5000 余篇科学文献中的知识进行分析和结构化处理,构建了包含 164232 个节点、853939 条关联关系的全面领域专属知识图谱。依托知识图谱的支撑,Chat-RFB 的性能得到显著提升,在专业问答任务中的选择题准确率达 94.9%,且相比通用大语言模型,幻觉现象大幅减少。为定量验证研究结果,我们还设计了结合选择题和非选择题的新型评估方法,评估模型对复杂科学问题的理解能力。


在功能层面,Chat-RFB 提升了文献检索、知识结构化和自动化推理的效率,成为储能研究领域的实用工具;与网络检索增强的大语言模型相比,Chat-RFB 在专业领域的细节挖掘能力更强。大语言模型与知识图谱的融合,是人工智能在科学研究领域发展的关键一步。


Chat-RFB 的未来发展方向包括:拓展知识库规模、融合跨领域知识、实现知识库的实时更新,以及将该系统应用于其他储能技术领域。预计这套融合系统将为科学研究、生产制造和定制化应用提供自动化、智能化的支撑,强化其人工智能驱动的科研助手定位,加速可持续储能技术的发展进程。


作者贡献
李建荣与王浩天共同构思并设计了本研究。王浩天负责撰写初稿。金瑞鹏、安浩天及谢正和参与了稿件讨论。李建荣、吕秀亮、张欣与郑志玲负责监督、审阅及编辑工作。

文章来源:DOI: 10.1038/s41597-024-03039-z.


  • GAI
    工具
  • Copyright © 知孔(上海)科技发展有限公司 沪ICP备2025111862号-2