返回首页
您的位置:首页 > 新闻 > CCF新闻 > CNCC

大模型为何有效、何处失效?徐宗本、王立威、李建等共探数理基础 | CNCC2026

阅读量:0 2026-09-20 收藏本文

大模型能力为何涌现、如何泛化,又会在哪里失效?“大模型的数理基础”论坛聚焦对称性、学习理论、压缩机制、代数几何与风险信息边界,解析大模型的表示、训练、泛化与失效机制。



图片



论坛简介


大模型正不断刷新人工智能的能力边界,在语言理解、知识推理、科学计算等任务中展现出显著的规模效应与涌现能力。与此同时,表示、训练、优化和泛化等经典机器学习问题在大模型条件下呈现出新的机制与规律,亟需从数理层面重新理解其能力来源。


当前,大模型为何能够通过规模扩展获得新能力,思维链与上下文学习如何改变模型表示,模型参数与数据之间如何共同决定扩展规律,以及模型在何种条件下出现幻觉、失效与风险,仍缺乏统一而系统的理论解释。表达能力边界、泛化机制和风险信息充分性等问题也直接关系到模型的可靠应用。


“大模型的数理基础”论坛将围绕这些关键问题展开讨论,从对称性与保对称机器学习、大模型时代的学习理论、压缩与预测视角下的知识获取和扩展定律、代数几何视角下的表达能力,到AI失败预测中的信息边界等方向切入,系统探讨大模型的表示与逼近、训练与泛化、机制与边界,为建立可解释、可信赖的大模型理论体系提供新的研究视角。



日程安排



序号

报告题目

主讲嘉宾

单位

1

对称性,AI建模应该遵循的准则

徐宗本

西安交通大学

2

大模型时代机器学习理论

王立威

北京大学

3

通过压缩视角理解大语言模型行为:知识获取,扩展定律与上下文学习

李建

清华大学

4

从代数几何视角看大模型表达能力边界

刘勇

中国人民大学

5

风险指标之外:AI失败的信息边界

张俊杰

西安交通大学



论坛主席:



魏哲巍



中国人民大学教授

图片

魏哲巍,中国人民大学教授,研究方向为人工智能与大数据基础算法,致力于为核心问题设计简洁、高效且具备理论保证的算法与模型。2008年本科毕业于北京大学数学科学学院,2012年博士毕业于香港科技大学计算机系。主持国家自然科学基金重点项目、科技部新一代人工智能国家科技重大专项课题,现任IEEE TPAMI编委、FCS青年编委,并曾担任PODS、ICDT会议论文集主席。



论坛讲者:



徐宗本



中国科学院院士,西安交通大学教授

图片

个人简介:徐宗本,中国科学院院士,西安交通大学教授,主要从事应用数学、数据科学和人工智能基础理论研究。曾两次获国家自然科学二等奖,并获国家科技进步二等奖。曾任西安交通大学副校长,现任陕西国家应用数学中心主任、西安交通大学数学与数学技术研究院院长等。长期围绕大数据、机器学习与人工智能中的基础科学问题开展研究,并推动相关理论方法在实际场景中的应用。


报告题目:对称性,AI建模应该遵循的准则


报告摘要:本报告围绕“对称性是AI建模应遵循的准则”展开。针对AI4S等任务对物理机理与规律一致性的要求,报告介绍“保对称函数”“数据对称性”和保对称机器学习问题,阐释等变性、不变量传递及对称正则化方法,并讨论其泛化理论。进一步结合图像处理和算子学习,介绍群升维Patch Embedding、群卷积网络、等变ViT、对称Mamba及AI4S“对称化”方法,展示对称性约束对模型性能、泛化与计算效率的作用。

王立威



北京大学教授

图片

个人简介:王立威,北京大学教授,长期从事机器学习研究,在深度学习与大模型理论算法方面取得一系列成果。在机器学习国际权威期刊和会议发表论文200余篇,研究重点包括机器学习表示、优化与泛化理论,以及大模型条件下的新型学习机制与理论问题。近年来持续关注思维链、长度泛化以及模型参数与token统一表征等问题,致力于构建适应大模型时代的新机器学习理论。


报告题目:大模型时代机器学习理论


报告摘要:经典机器学习围绕表示、优化和泛化形成了成熟理论,但在大模型时代,训练数据单次或少次使用、思维链广泛应用等新特征正在改变这些问题的基本形态。本报告将讨论大模型条件下机器学习理论面临的新问题与相应方法,重点分析思维链对模型表示能力的作用与意义、长度泛化问题及其解决思路,并进一步探讨模型参数与token的统一刻画,以理解大模型时代表示、学习与泛化机制的新变化。

李建



清华大学长聘教授

图片

个人简介:李建,清华大学长聘教授,研究方向为理论计算机科学、人工智能基础理论和金融科技。在主流国际会议和期刊发表论文100余篇,曾主持或参与多项自然科学基金项目及企业合作项目。长期关注算法、学习理论与大模型基础机制等问题,近期从算法信息论与压缩视角研究大语言模型的知识获取、扩展定律、上下文学习和事实性知识幻觉等行为。


报告题目:通过压缩视角理解大语言模型行为:知识获取,扩展定律与上下文学习


报告摘要:大语言模型在多类任务中表现出强大能力,但其知识获取、扩展定律、上下文学习与幻觉等行为仍缺乏系统理论解释。本报告从算法信息论出发,以Kolmogorov结构函数和双部分编码理解LLM压缩与预测,并构建“句法-知识”分层数据生成模型。在贝叶斯框架下,分析模型随参数量和数据规模增长的知识获取过程,解释数据与模型扩展定律、训练与微调中的知识动态、上下文学习及事实性知识幻觉,并结合大模型实验验证相关理论预测。

刘勇



中国人民大学长聘副教授

图片

个人简介:刘勇,中国人民大学长聘副教授,长期从事机器学习基础理论研究,发表论文100余篇,其中以第一作者或通讯作者发表顶级期刊和会议论文近50篇,涵盖JMLR、IEEE TPAMI、Artificial Intelligence、ICML、NeurIPS等。主持或参与国家自然科学基金、科技部重点研发等项目,研究重点包括机器学习理论及大模型表达能力分析,近期关注代数几何和热带几何在大模型机制研究中的应用。


报告题目:从代数几何视角看大模型表达能力边界


报告摘要:当前对大模型表达能力的分析多从函数构建角度展开。本报告引入代数几何视角,重点依托热带几何理论,对大模型基础架构的表达机制进行分析。围绕混合专家(MoE)模型与Transformer架构,报告将系统讨论其表达能力及边界,尝试从几何结构角度解释不同架构的能力来源与限制,并为大模型底层机制研究提供新的理论视角和分析路径。

张俊杰



西安交通大学博士后

图片

个人简介:张俊杰,西安交通大学博士后,长期从事Physics of AI及复杂系统建模研究,致力于从物理第一性原理理解神经网络的内禀属性、优化机制与失效边界。在National Science Review、npj Artificial Intelligence、Physical Review等期刊发表论文25篇,主持国家自然科学基金等项目。近期聚焦AI风险接口的信息充分性审计与动态风险状态建模。


报告题目:风险指标之外:AI失败的信息边界


报告摘要:现代AI系统常使用confidence、margin、entropy、log-probability等指标预测失败并触发拒答、重试或人工介入,但指标失准有时并非“读取方式”不足,而是风险接口本身缺失关键信息。本报告提出动态风险状态框架,刻画系统接近失效、响应干预及风险人群重分布的过程,并将接口失败区分为“信息存在但读取不足”与“状态信息缺失”两类。结合视觉模型和大语言模型实验,讨论如何审计风险接口的信息充分性。



其他嘉宾:



孟德宇



西安交通大学教授

图片

个人简介:孟德宇,西安交通大学教授,长期致力于机器学习基础理论与算法研究。现任中国工业与应用数学学会副理事长、CSIAM青工委主任,并担任TPAMI等国内外期刊编委。研究工作聚焦机器学习理论、模型与算法,持续围绕人工智能基础问题开展研究。


欢迎参加CNCC2026

CNCC是一个宏观论述技术趋势的大会,具有规格高、规模大、内容丰富等特点,会议形式包括大会特邀报告、大会论坛、专题论坛、特色活动及展览。大会汇聚两院院士、国内外顶尖学者、知名企业家等亲临大会,展望前沿趋势,分享创新成果。ACM、IEEE CS、IPSJ、KIISE等国际计算机组织的代表也多次获邀现场参加这一盛会。CNCC2026将于10月21-24日在四川省成都市举办,大会主题是“数聚驱动,智算未来”,欢迎各界前来参会。

图片


本站为 ccf.org.cn 的非官方反代站