
研究背景
近年来,大语言模型 (LLMs) 在材料/化学研究中展现出强大的信息处理与知识整合能力,但其本质仍偏向于基于语料的模式匹配,难以胜任涉及多步逻辑推导的复杂科学问题。尤其在金属有机框架 (MOFs) 等材料体系中,研究往往依赖“提出假设—分析机制—实验验证”的科学推理过程,而现有模型缺乏对这一过程的系统学习能力。
因此,如何使大模型不仅“知道知识”,更能够“像科学家一样思考”,成为推动AI深度参与材料设计与机理研究的关键问题。
研究内容
近日,北京工业大学李建荣教授、张鑫教授研究团队提出 MOFReasoner,通过构建文献驱动的链式思维 (CoT) 推理数据体系,并结合知识蒸馏与多源数据融合策略,实现了面向 MOF 吸附的科学推理型大语言模型构建。

该工作基于 8200 余篇研究论文与 500 余篇综述构建数据基础,结合多类材料/化学与推理数据对模型进行训练与评估。在四类典型任务测试中,模型取得 25.5 的综合评分,整体表现相较通用模型有所提升。在复杂科学问题分析中,模型能够较为准确地给出关键结论,并在部分案例中与 DFT 计算趋势保持一致。该工作为构建具备科学推理能力的领域大模型提供了有益思路。
该成果以“MOFReasoner: think like a scientist—a reasoning large language model via knowledge distillation”(《MOFReasoner:基于知识蒸馏的 MOF 科学推理大模型构建》)为题,发表在英国皇家化学会期刊 Digital Discovery 上。

文献来源:https://doi.org/10.1039/D5DD00429B
文章来源:公众号【RSC Chemical Sciences】