|
|
|
|
|
AS | 西北工业大学张悦周:提示工程+大模型协同:加速数据驱动的光催化材料发现 |
|
|


研究背景:
近年来,人工智能正加速融入科学研究,尤其是在材料科学领域,数据驱动方法正在逐渐改变传统依赖经验的研究范式。然而,大量关键材料信息仍散落在非结构化科学文献中,难以被机器直接利用。这种“数据碎片化”问题严重制约了机器学习在材料发现中的应用,也成为AI for Science领域亟待解决的重要挑战。如何从海量文献中高效提取结构化知识,并进一步用于材料设计,成为当前数据驱动材料研究的核心问题之一。

文章概述:
近日,西北工业大学张悦周团队在Advanced Science发表研究,提出了一种基于大模型协同的自动化文献挖掘与材料发现框架。该工作通过提示工程与多模型集成策略,实现了从文献知识提取到机器学习建模再到实验验证的完整闭环,为AI驱动材料设计提供了新范式。研究以石墨型氮化碳(g-C3N4)光催化剂为对象,成功构建高质量结构化数据库,并基于机器学习揭示关键结构参数与催化性能之间的定量关系,最终通过实验验证了模型预测的可靠性。
图文导读
构建AI驱动的材料发现闭环
作者首先构建了一个多模块协同的自动化研究框架。该框架从文献采集出发,依次完成多模态信息提取、数据结构化、机器学习建模以及实验验证,形成完整的“数据—模型—实验”闭环流程。这一流程不仅能够自动解析论文中的文本、表格和图像信息,还能将提取的数据直接用于后续建模与材料优化,实现真正意义上的自动化科学研究流程。

图1.数据提取整体流程示意图。(a) 文献预处理及自动化数据提取管线的构建;(b) 基于多种大语言模型协同的数据提取与高质量数据集整合;(c) 利用构建的数据集进行机器学习建模,并通过实验合成进行验证
提示工程驱动高质量文献挖掘
针对材料科学文献中术语复杂、数据分散的特点,作者设计了一套结构化提示工程策略。通过引入CO-STAR提示框架,明确任务目标与输出格式,并结合XML结构化标签,提高了模型解析科学文本的稳定性与一致性。此外,作者采用迭代式提示优化策略,通过分析模型输出不断调整提示内容,从而显著提升参数提取的准确率。实验表明,该自动化流程相较人工整理效率提升约5倍,大幅降低了文献数据整理成本。

图2.提示工程设计策略与自动化性能概览。(a) 提示输入示例及对应的大模型输出;(b) 基于CO-STAR框架的提示设计细节;(c) 提示迭代优化过程示意图;(d) 自动化方法与人工处理在执行时间上的对比
多模型协同提升信息抽取精度
单一大模型在专业领域往往存在能力偏差。为此,作者提出参数级模型路由策略,根据不同模型的优势,将特定参数分配给最擅长的模型进行提取。例如:多模态模型负责图表信息解析;推理型模型用于复杂结构分析;通用模型负责基础参数抽取。最终,四种大模型协同组成的集成系统显著优于单模型方案,多个关键参数的提取精度和召回率均超过90%。这一结果表明,大模型“协同作战”在科学信息抽取任务中具有明显优势。

图3.数据提取性能评估。(a) 十种大模型在不同参数提取任务中的精度箱线图;(b) 数据条目质量评估的频率分布热图;(c) 最终数据集中各参数的精度与召回率;(d) 集成模型与单模型性能对比
数据驱动揭示关键结构参数
基于构建的结构化数据库,作者进一步引入机器学习模型分析影响光催化性能的关键因素。结果显示,比表面积(SSA)和带隙是决定光催化制氢效率的核心参数。
通过SHAP可解释性分析,研究揭示了一个重要现象:带隙与催化性能呈现非单调关系。当带隙过大时光吸收不足,而过小则会加剧电荷复合,存在最佳窗口区间。模型给出了明确的设计建议:最优比表面积约为170 m2/g;最优带隙范围为2.2–2.4 eV。这些结论为光催化材料设计提供了可量化的理论依据。

图4.机器学习模型性能及SHAP可解释性分析。(a) 五种机器学习模型的R2性能对比;(b) 特征重要性的SHAP汇总图;(c) 各特征组的平均SHAP值;(d) 比表面积(SSA)的SHAP依赖关系图;(e) 带隙的SHAP依赖关系图
实验验证模型预测可靠性
为验证模型预测的有效性,作者进一步合成了一系列缺陷工程g-C3N4光催化剂样品,并系统调控其比表面积与带隙。实验结果显示,材料的制氢性能随结构参数优化呈现明显提升趋势,与模型预测高度一致。更重要的是,模型预测值与实验测量值之间的偏差均低于5%,充分证明了该数据驱动方法的可靠性。这一结果表明,大模型辅助的材料设计不仅具有理论意义,也具备实际应用潜力。

图5.g-C3N4材料的形貌与物化性质表征。(a) 扫描电子显微镜(SEM)图像;(b) (Ahν)2–hν关系曲线;(c) Mott–Schottky曲线;(d) 能带结构示意图;(e) 元素分析得到的C/N质量比;(f) 氮气吸附–脱附等温线;(g) 产氢速率预测值与实验值对比
总结与展望
本研究建立了一种可扩展、可迁移的研究范式,将碎片化的文献信息转化为可操作的材料设计智能。该框架的核心贡献包括:基于提示工程的LLM数据提取方法、多模型集成策略、以及从数据挖掘到实验验证的完整闭环。
从方法论角度,本研究展示了如何通过系统化的提示设计将通用大语言模型适配于特定科学领域,这一策略具有广泛的可迁移性。从应用角度,所揭示的带隙-性能非单调关系为g-C3N4光催化剂的理性设计提供了定量指导。未来,随着模型能力提升与数据规模扩大,此类自动化框架有望推广至更多材料体系,加速AI for Science的发展进程。
论文信息:
Prompt Engineering Accelerates the Data-Driven Discovery of Photocatalysts via an LLM-Based Model Ensemble Strategy
Dianyuan Li, Xichen Sun, Shaohua Sun, Runzhou Wang, Miaomiao Zhang, Meng Xiao, Yue Wang, Yuezhou Zhang*
Advanced Science
DOI:10.1002/advs.202524215
原文链接:
https://doi.org/10.1002/advs.202524215
期刊介绍:

Advanced Science 是 Wiley旗舰期刊 Advanced 系列中的一种完全开放获取的跨学科科学期刊,发表材料科学、物理、化学、医学、生命科学、环境科学、工程和社会科学等领域的前沿基础和应用研究。我们的使命是通过开放获取出版,使前沿创新的科学研究具有更广泛的可访问性。Wiley 的 Advanced 系列是全球公认的高影响力期刊系列,传播来自资深和青年研究人员的科学成果,帮助他们实现使命并扩大科学发现的影响力。
Advanced Science 2025年影响因子为14.1,五年平均影响因子为15.6,期刊引文指标1.74,CiteScore 为 18.1。在 2025年中国科学院院文献情报中心期刊分区表中,Advanced Science 入选综合类期刊一区TOP。

特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。