|
|
|
|
|
FCS 中国人民大学、蒙特利尔大学等研究者发表综述文章——大模型继续变强,但研究者正面对新的瓶颈:数据、评估与安全 |
|
|
论文标题:A Survey of Large Language Models
期刊:Frontiers of Computer Science
作者:Wayne Xin Zhao, Kun Zhou, Junyi Li, Tianyi Tang, Zican Dong, Yupeng Hou, Beichen Zhang, Yingqian Min, Junjie Zhang, Peiyu Liu, Xiaolei Wang, Yifan Du, Chen Yang, Yushuo Chen, Zhipeng Chen, Jinhao Jiang, Ruiyang Ren, Yifan Li, Xinyu Tang, Zikang Liu, Yiwen Hu, Jian-Yun Nie, Ji-Rong Wen
发表时间:24 Mar 2026
DOI:10.1007/s11704-026-60308-3
微信链接:点击此处阅读微信文章

文章题目:A Survey of Large Language Models
期刊:Frontiers of Computer Science
DOI:10.1007/s11704-026-60308-3
机构:中国人民大学、蒙特利尔大学

扫码读原文
中国人民大学、蒙特利尔大学等研究者发表综述文章,系统梳理大语言模型从预训练、后训练到使用和评估的技术链条,指出大模型发展正在从单纯扩大规模,转向围绕数据质量、可信评估、对齐安全和智能体能力的全流程竞争。
过去几年,大语言模型的进展几乎总是和“更大”联系在一起:更大的参数规模,更多的训练数据,更高的计算资源,以及一次次刷新榜单的模型性能。从 GPT-3 到 ChatGPT,再到一系列开源和闭源模型的快速迭代,大语言模型已经从自然语言处理研究中的专门技术,变成影响科研、产业和日常应用的基础设施。
但当模型继续变强,新的问题也开始显现。未来的大模型竞争,可能不再只是“谁的模型更大”,而是谁能更有效地获得高质量数据,谁能建立更可靠的评估体系,谁能让模型在真实场景中更安全、更可控地发挥作用。
近期,来自中国人民大学和蒙特利尔大学等机构的研究者在 Frontiers of Computer Science 发表综述文章,对大语言模型的发展脉络和关键技术进行了系统梳理。文章没有把大模型理解为单一算法或单个产品,而是将其放在一个完整生命周期中讨论:预训练建立基础能力,后训练让模型适应任务并对齐人类需求,使用阶段通过提示、检索增强和智能体框架释放能力,评估体系则负责衡量模型的语言能力、推理能力、安全性和实际可靠性。
这一框架本身就传递出一个重要变化:大模型的发展已经不再是单纯的“规模问题”。模型能力来自数据、架构、训练方法、对齐机制、推理方式和评估标准之间的复杂配合。任何一个环节出现短板,都可能限制模型在真实世界中的表现。
数据是最先浮现的瓶颈之一
在预训练阶段,大语言模型依赖大规模文本学习语言知识、世界知识和基本推理模式。网页、书籍、代码、科学文本、数学材料、对话数据,以及近年来越来越常见的合成数据,都会进入模型训练流程。文章指出,当前代表性开源模型的训练数据规模已经达到十万亿级 token,商业闭源模型可能使用更大规模的数据。
问题在于,高质量数据并不是无限的。
随着模型不断扩大,公开可用、质量足够高、适合训练的数据资源正在变得更加紧张。低质量网页、重复文本、噪声内容、偏见信息、隐私数据和版权受限材料,都可能影响模型能力和后续应用安全。数据清洗、去重、过滤、隐私处理和数据配比,已经从技术细节变成决定模型表现的关键环节。
合成数据被视为一种可能的补充方案。通过已有模型生成数学推理、代码、问答或长链推理数据,可以扩展训练材料,也能增强模型在特定任务上的能力。但合成数据同样带来风险。如果模型不断学习由模型生成的内容,而这些内容缺乏新的信息和真实反馈,就可能导致能力停滞,甚至出现所谓的“模型坍塌”。因此,下一阶段的关键问题不是简单制造更多数据,而是如何获得新颖、可靠、可验证、可持续的数据来源。
第二个瓶颈来自评估
大模型是否真的更强,不能只看它在某几个榜单上的分数。随着模型能力提升,传统基准测试越来越容易被刷高分,有些测试也面临数据污染、题目泄露和区分度下降等问题。一个模型在标准测试中表现优秀,并不意味着它在复杂真实任务中同样可靠。
文章将评估视为大语言模型生命周期中的独立环节,覆盖语言理解、知识掌握、推理能力、对齐程度、安全性、智能体任务和专家级任务等多个层面。这也说明,大模型评估正在从“能不能答对题”,走向“能不能在真实环境中稳定、可靠、可解释地完成任务”。
特别是在复杂推理、长上下文处理、工具使用和智能体任务中,模型可能需要连续规划、调用外部工具、处理反馈并修正错误。这样的能力很难由单一选择题或静态问答测试完整衡量。未来评估体系需要更接近真实应用,也需要更严格地处理数据污染、公平性、安全性和可复现性问题。
第三个瓶颈是安全和对齐
预训练可以让模型获得广泛知识和生成能力,但并不自动保证模型输出符合人类期望。为了让模型更有帮助、更诚实、更少产生有害内容,后训练已经成为现代大模型开发中不可缺少的步骤。监督微调、基于人类反馈的强化学习、基于可验证答案的强化学习,以及针对长链推理和智能体行为的训练方法,正在不断发展。
这些技术让模型更像“可用的助手”,但也带来新的挑战。模型可能产生幻觉,可能在不确定时给出看似自信的回答,可能泄露隐私信息,也可能在特定提示下输出不安全内容。随着大模型被嵌入搜索、办公、科研、教育、医疗和软件开发等场景,对齐和安全问题不再只是研究话题,而是影响实际部署的前提条件。
文章还特别关注智能体能力的发展。大语言模型正在从回答问题的系统,逐渐进入能规划、使用工具、调用外部环境并执行多步任务的智能体框架。检索增强生成、长上下文管理、自我演化、多智能体协作和高效部署等技术,正在扩大模型的使用边界。但智能体能力越强,对错误控制、安全边界和评价标准的要求也越高。一个能够执行长流程任务的模型,如果缺乏可靠评估和安全约束,风险也会随之放大。
因此,大模型的未来并不是简单继续“堆大”。更大的参数、更长的上下文、更复杂的推理过程,仍然可能带来能力提升,但这些提升必须和数据质量、训练效率、对齐机制、使用方式和评估体系一起考虑。大语言模型正在从单一模型竞赛,进入全生命周期工程阶段。
这也改变了人们理解大模型进展的方式。过去,公众往往关注某个新模型是否刷新榜单、是否会写代码、是否能解数学题。现在,研究者更需要回答的是:模型训练数据是否可靠?评估结果是否真实反映能力?模型是否能承认不确定性?在复杂场景中能否避免错误累积?当它作为智能体行动时,是否有足够的安全边界?
这些问题不会阻止大模型继续发展。相反,它们意味着大模型研究正在进入更成熟的阶段。能力提升仍然重要,但可靠性、可控性和可评估性正在变得同样重要。
未来的大模型竞争,可能不只是模型规模的竞争,而是数据治理、训练方法、对齐安全、智能体能力和评估体系的综合竞争。大模型还会继续变强,但它能否真正可靠地服务科研、产业和社会,将取决于研究者能否跨过这些新的瓶颈。
原文链接:https://journal.hep.com.cn/fcs/EN/10.1007/s11704-026-60308-3
期刊简介
Frontiers of Computer Science (FCS)是由教育部主管、高等教育出版社和北京航空航天大学共同主办,南京大学支持,SpringerNature 公司海外发行的英文学术期刊。本刊于 2007 年创刊,月刊,全球发行。主要刊登计算机科学领域具有创新性的综述论文、研究论文等。本刊主编为周志华院士,执行主编为周昆教授。编委会及青年 AE 团队由国内外知名学者及优秀青年学者组成。本刊被 SCI、Ei、DBLP、INSPEC、SCOPUS 和中国科学引文数据库(CSCD)核心库等收录,为 CCF 推荐B类期刊;两次入选“中国科技期刊国际影响力提升计划”;入选“第4届中国国际化精品科技期刊”;两次入选“中国科技期刊卓越行动计划”(一期梯队、二期领军)。
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。