概述 杨立昆(Yann LeCun,1960年7月8日-),法裔美国计算机科学家,纽约大学教授、Meta(原Facebook)首席人工智能科学家。他是深度学习领域的开创者之一,因发明卷积神经网络(CNN)并将反向传播算法成功应用于手写识别而闻名。与杰弗里·辛顿、约书亚·本吉奥并称为“深度学习三巨头”,2018年共同获得图灵奖。杨立昆以其在计算机视觉、机器学习机器人学等领域的奠基性工作著称,同时也以在社交媒体上对人工智能伦理、开源理念及自由意志主义的直率观点而广受讨论。

1 早期生活与教育

1.1 出生与家庭背景

杨立昆于1960年7月8日出生于法国巴黎郊区凡尔赛附近的一个中产阶级家庭。父亲是一名航空工程师,母亲是一名语言治疗师。家庭氛围注重科学与人文的结合,但杨立昆早年并未表现出对计算机的特别兴趣——他少年时期更喜欢物理学数学。关于自己名字的由来,他后来回忆说,父母希望他有一个不常见的名字,因此选择了布列塔尼语地区的传统名字“Yann”(对应法语的“Jean”)。

1.2 学生时代:从巴黎到多伦多

1.2.1 巴黎高等电子与电气工程师学校(ESIEE)

1980年,杨立昆进入巴黎高等电子与电气工程师学校(ESIEE)学习电气工程。这所位于巴黎的工程师学院以培养实用型技术人才而闻名。在ESIEE期间,他接触到了早期的计算机科学课程,并逐渐被人工智能领域的初步探索所吸引。他于1983年获得工程师学位。

1.2.2 皮埃尔和玛丽·居里大学(UPMC)硕士

毕业后的1984年,杨立昆进入皮埃尔和玛丽·居里大学(UPMC,现为索邦大学)攻读计算机科学硕士学位。他的硕士研究专注于神经网络的理论基础,尽管当时神经网络研究正处于低谷期,但他对“学习算法”的潜力深信不疑。这段经历为他后来转向深度学习埋下了伏笔。

1.2.3 多伦多大学博士与辛顿的指导

1985年,杨立昆获得加拿大奖学金,前往多伦多大学攻读博士学位,导师正是后来与他并称“深度学习三巨头”之一的杰弗里·辛顿(Geoffrey Hinton)。在辛顿的指导下,他主要研究反向传播算法在视觉感知中的应用。1987年,他完成了题为《Learning Invariance in Perception from Examples》的博士论文,首次系统性地探讨了如何让神经网络学习不变性特征。这段经历不仅是学术上的转折点,也奠定了他与辛顿之间长达数十年的师徒友谊。

2 学术与职业生涯

2.1 贝尔实验室时期(1988-1996)

2.1.1 手写识别与支票处理系统(LeNet

1988年,杨立昆加入位于美国新泽西州的贝尔实验室(AT&T Bell Labs)。在那里,他带领团队开发了世界上第一个实用化的手写数字识别系统——LeNet。该系统被用于自动处理支票上的手写金额,成为了早期深度学习产品化的标志性案例。在1990年代初期,LeNet处理了美国约10%的支票,经济效益巨大。

2.1.2 卷积神经网络(CNN)的提出

1992年至1996年间,杨立昆系统性地提出了卷积神经网络(CNN)的基本架构,包括卷积层、池化层和全连接层的组合,并将反向传播算法成功应用于这一结构。他的突破性成果之一是将CNN用于手写识别,证明了神经网络在图像任务上优于当时主流的支持向量机(SVM)方法。这一时期的工作被总结为一篇经典论文《Gradient-Based Learning Applied to Document Recognition》(1998年发表)。

2.2 纽约大学任教(2003-至今)

2.2.1 库朗数学科学研究所教授

1996至2002年,杨立昆短暂加入日本NEC研究所后,于2003年返回学术界,接受纽约大学(NYU)的邀请,加入库朗数学科学研究所(Courant Institute of Mathematical Sciences)担任教授。他在NYU组建了一支活跃的机器视觉研究小组,并深度参与教学,推动神经网络课程在计算机科学系中的普及。

2.2.2 纽约大学数据科学中心联合创始人

2013年,杨立昆与同事共同创建了纽约大学数据科学中心(Center for Data Science),此举旨在将统计学、计算机科学和应用领域相结合。该中心后来成为北美数据科学教育的标杆模式之一,甚至引来了中国高校的来函咨询。

2.3 进入工业界:Facebook人工智能研究院(FAIR)

2.3.1 FAIR的创建与早期方向(2013-2015)

2013年,社交网络公司Facebook(今Meta)为了紧跟人工智能浪潮,在纽约和巴黎建立了Facebook人工智能研究院(FAIR)。杨立昆以学术休假的形式出任FAIR的首任主任,负责确立研究方向:从基础研究出发,而非短期产品回报。FAIR早期专注于深度学习理论、自然语言处理和计算机视觉,这与杨立昆的学术风格一脉相承。

2.3.2 担任首席人工智能科学家(2015-至今)

2015年,杨立昆正式从学术休假转为全职,出任Facebook(后更名为Meta)的首席人工智能科学家(Chief AI Scientist),负责统筹全球FAIR实验室的研发战略。他在这个岗位上减少了实验室的行政琐事,保留了相当比重的研究参与,并推动了一系列开源工具(如PyTorch框架)的采用。

2.3.3 与Meta(Facebook)的后续关系

2023年末,杨立昆宣布不再担任Meta首席人工智能科学家,转而担任“AI研究荣誉顾问”(AI Research Honorary Advisor),继续以兼职形式参与研究。外界猜测这与Meta内部战略调整有关,但他本人否认有理念冲突,并表示对FAIR团队“极其自豪”。

3 核心学术贡献

3.1 卷积神经网络(CNN)

3.1.1 基本架构:卷积层、池化层、全连接层

CNN的核心思想是使用局部连接的卷积核(卷积层)来提取空间特征,并通过池化层进行降维,最后通过全连接层完成分类或回归。这一架构模仿了生物视觉皮层的基本模式,大幅减少了参数数量,使得训练深度模型成为可能。杨立昆在1990年代通过数学推导证明了CNN的平移不变性特性。

3.1.2 反向传播算法在CNN中的实现

早在1989年,杨立昆就在一篇论文中展示了如何将反向传播算法应用于CNN的训练。他实现了基于误差梯度的权重更新流程,并对比了预训练与随机初始化的区别,为后来深度学习的兴起扫清了训练障碍。

3.1.3 LeNet-5:经典手写数字识别系统

LeNet-5是杨立昆团队于1994年设计的一个7层CNN模型,专门用于识别MNIST数据集中的0-9手写数字。该模型在当年取得了接近0.2%的错误率,被认为是现代CNN的鼻祖。至今,LeNet-5仍被广泛应用于神经网络教学的入门范例。

3.2 图像识别与分类

3.2.1 大规模图像数据集的应用

进入21世纪后,杨立昆率先倡导使用大规模标注数据集(如ImageNet)来训练深层CNN。他在2012年之后指导团队成员在ImageNet竞赛中应用AlexNet的变体,最终推动了图像分类任务准确率的跃升。

3.2.2 与支持向量机(SVM)的对比

在早期研究中,杨立昆花费了大量篇幅对比CNN与支持向量机(SVM)在图像任务上的表现。他通过实验证明,CNN在端到端的特征学习上优于手工设计的SVM核,并且在数据量充足时具有不可比拟的泛化能力。这一对比直接影响了计算机视觉领域从特征工程向特征学习的转型。

3.3 无监督学习与自监督学习

3.3.1 早期工作:自编码器与能量模型

杨立昆从1990年代开始关注无监督学习。他提出了“能量基础模型”(Energy-Based Models, EBMs),认为人类认知过程本质上是让系统降低能量状态。此外,他研究了自编码器(Autoencoder)作为无监督特征提取的经典方法,但受限于当时算力,这些成果并未立即得到广泛应用。

3.3.2 对比学习与SimCLR

2020年,杨立昆团队提出了SimCLR框架,这是一种基于对比学习的自监督视觉表征学习方法。通过最大化同一图像在不同数据增强下表示的一致性,SimCLR在无标签数据上实现了与有监督学习媲美的分类性能。他本人谦虚地称这是“踩在别人肩膀上”的工作,但外界视其为自监督学习的里程碑。

3.3.3 对“世界模型”概念的探索

杨立昆近年来将目光转向“世界模型”(World Models),认为人工智能应当学习物理世界的基本规律(如对象恒常性、因果关系),而非仅仅处理静态图像。他在综述中提出了“分层世界模型”概念,试图结合能量模型与强化学习算法,以构建能够主动预见行动的AI系统。

3.4 生成对抗网络(GANs)的间接影响

3.4.1 GANs与他的批评性观点

虽然杨立昆并未直接发明生成对抗网络(GANs),但他对GANs的训练机制表达了明显的不满。他认为GANs的对抗性训练过程极度不稳定,而且容易陷入模式崩溃。他与Ian Goodfellow等人曾公开辩论,主张构建更稳定的能量模型来替代GANs。不过他也承认GANs在图像生成上的惊人效果是“不可否认的”。

3.4.2 对抗训练与鲁棒性研究

杨立昆在对抗训练方面也做出了实质性贡献。他与团队开发了如何通过增强CNN对微小扰动的抵抗力来提升模型鲁棒性的方法,这些工作在某些安全敏感领域(如自动驾驶)得到了应用。

4 奖项与荣誉

4.1 图灵奖(2018年)

2018年,杨立昆与杰弗里·辛顿、约书亚·本吉奥共同获得图灵奖(ACM A.M. Turing Award),以表彰他们在深度学习领域的“概念和工程突破”。颁奖词中特别强调了杨立昆发明CNN并成功应用于手写识别的重大贡献。三人随后合著了《深度学习》一书的章节部分,共享120万美元奖金。

4.2 美国国家工程院院士(2021年)

2021年,杨立昆入选美国国家工程院(NAE)院士,以表彰他在“深度学习理论和应用方面的贡献,特别是在视觉系统领域的开创性工作”。

4.3 其他主要奖项

4.3.1 赫尔曼·安东·吉诺奖

2020年,他获得了赫尔曼·安东·吉诺奖(Hermann Anton·Guinot Prize),该奖是法国科学界对他在人工智能推广方面的表彰。

4.3.2 计算机视觉与模式识别(CVPR)终身成就奖

2023年,在计算机视觉顶会CVPR上,杨立昆获得了终身成就奖(CVPR Distinguished Service Award),以认可他30多年来对该领域的持续影响力。

4.4 荣誉博士学位与学会会士

杨立昆拥有包括巴黎第十一大学、爱丁堡大学、多伦多大学(2022年)在内的十余所高校的荣誉博士学位。他是美国国家科学院(NAS)院士、加拿大皇家学会会士、以及美国人工智能协会(AAAI)会士。

5 公众形象与争议

5.1 社交媒体活跃分子

5.1.1 在“X”(原推特)上的哲学式推文

杨立昆在推特(后改名X)上拥有超过50万粉丝。他经常发布带有哲学色彩的技术推文,例如“机器学习不应该是黑箱,而应该是透明盒子”以及“数据、计算能力、算法——三要素缺一不可”。他的账号名被一些人调侃为“哲学家Yann”。

5.1.2 与Elon Musk等科技人物的公开论战

杨立昆与特斯拉CEO埃隆·马斯克(Elon Musk)发生过多次公开争吵。争论焦点包括AI监管、自动驾驶技术路线(视觉方案vs激光雷达)等。杨立昆甚至干脆发推说:“Musk并不懂AI,他只会制造恐慌。”这些论战为他赢得了“脾气暴躁的AI教父”标签。

5.2 对人工智能伦理与安全的立场

5.2.1 “人工智能不存在真正危险”的观点

杨立昆是人工智能“安全犬”阵营的反对者。他多次声称“AI不会在短期内毁灭人类”,认为这种担忧分散了人们应对真实威胁(如算法偏见、错误信息、收入不平等)的注意力。他甚至开玩笑道:“AI失控论者也许该多读点科幻小说,而不是来搞学术。”

5.2.2 与“有效利他主义”运动的分歧

有效利他主义运动中的AI安全分支试图说服世界正视AI毁灭性风险。杨立昆毫不客气地批评这个运动“建立在杞人忧天的荒谬前提上”。他主张将精力用于监管故意滥用AI的坏人,而非机器智能本身。

5.3 “开源”与“闭源”之争

5.3.1 支持开源人工智能模型

杨立昆是开源AI的坚定拥护者。他在2015年就游说Facebook将FAIR的研究成果全部开源,包括代码、数据集和模型权重。他本人甚至比喻说:“闭源模型就像私有厕所,开源才是公共浴室——虽然有点乱,但对所有人都好。”

5.3.2 与OpenAI路线差异的调侃

面对OpenAI等公司转向闭源(如GPT-4不公开权重),杨立昆在采访中调侃道:“他们终于从‘拯救人类’的组织,变成了‘赚回投资人钱’的初创公司。”这一评论引发了OpenAI高管的社交媒体反击。

5.4 语言与幽默

5.4.1 法式口音与英语梗

杨立昆在英语演讲中保留着浓重的法式口音。这意外地成为他的个人标志。他常利用法语和英语的双关语进行学术梗表达,比如“Deep learning is not ‘deep sleeping’(深度学习不是深睡)”。

5.4.2 在演讲中自嘲“老派AI”

在2019年的NeurIPS大会上,他自嘲道:“你们这些年轻人喜欢Transformer,这很好,但我还是喜欢我的小鬼魂——卷积。”这种自嘲常常引发全场掌声,也展示了他在新生代研究者中的亲和力。

6 思想与哲学

6.1 对深度学习未来方向的看法

6.1.1 能量函数与目标驱动的行为

杨立昆坚信未来的AI系统应当基于能量函数(Energy Function)而非连续的概率生成。他认为人类的行为本质上是通过观察降低环境“能量”,因此构建可微的能量模型是实现通用智能的关键。他称这为“目标驱动的行为”(Objective-Driven Agent)。

6.1.2 对大型语言模型(LLMs)的保留态度

杨立昆对GPT系列模型等技术持保留态度。他认为当前的LLMs只是“超级高级的统计模拟器”,缺乏对真实世界的理解。他在访谈中直言:“给模型吃掉整个互联网,你得到的不是智慧,而是一个巨大的自动补全器。”他希望下一阶段的研究重回物理世界因果推理。

6.2 自由意志主义与科技治理

6.2.1 对监管的态度:最小化政府干预

杨立昆是一个公开的自由意志主义者(Libertarian)。他主张技术监管应该降到最低,认为过度的政府干预会扼杀创新。他甚至在2023年参与了一次关于“AI开源社区是否应被管制”的辩论,立场毫不含糊。

6.2.2 数字主权与数据隐私的博弈

尽管支持自由市场,但杨立昆承认数据隐私和数字主权是正当议题。他提议采用联邦学习等技术,在不暴露原始数据的情况下训练模型。他认为“绝对隐私”与“AI进步”并不矛盾,但需要精巧的技术来解决。

6.3 教育理念:反对“教条化”的机器学习

在纽约大学授课时,杨立昆以反“教条”闻名。他拒绝让学生死记硬背公式,而是鼓励学生通过编程实验去“感受算法的行为”。他曾在课堂上把支持向量机比作“又慢又古板的老国王”,引得哄堂大笑。这种教育风格使他成为学生口中的“最酷的AI教授”。

7 代表著作与出版

7.1 学术论文

7.1.1 《Gradient-Based Learning Applied to Document Recognition》(1998)

该论文发表于《Proceedings of the IEEE》,完整阐述了LeNet-5的设计原理与训练方法,至今已被引用超过6万次。它被公认为深度学习领域的“圣经级论文”之一。

7.1.2 《Dimensionality Reduction by Learning an Invariant Mapping》(2006)

这篇论文提出了一种名为“SI(Semi-Invariant)”的降维方法,通过约束学习不变映射,对于小样本图像识别具有开创性意义。后来其中的思想间接启发了度量学习(Metric Learning)领域。

7.2 书籍与章节

7.2.1 与他人合著的《Deep Learning》(《深度学习》中文版)

2016年,杨立昆与伊恩·古德费洛(Ian Goodfellow)、约书亚·本吉奥(Yoshua Bengio)合著了《深度学习》(中文译名《深度学习》),该书成为了全球深度学习入门与进阶的权威教材,被誉为“AI圣经”。

7.2.2 综述文章:卷积网络的过去、现在与未来

2020年,他单独撰写了一篇综述,总结CNN从1990年到2020年的三十年历程。他预测CNN在边缘计算、嵌入式AI设备上仍有广阔前景。

7.3 技术博客与公开演讲

杨立昆在Meta的官方技术博客上发布了大量通俗易懂的文章,例如《为什么AI不需要理解就能做好任务?》等。他的公开演讲(如在TEDx、NeurIPS、ICCV上的Keynote)都以“罗嗦但有趣”著称,通常带有大量冷笑话。

8 轶事与冷知识

8.1 为什么他叫“Yann”而非“Jean”

他的本名其实可以对应法语的“Jean”(约翰),但父母觉得“Jean”太普遍,于是选择布列塔尼地区的变体“Yann”。他本人曾在采访中说:“这给我省了很多麻烦——在法国找人只要呼‘Yann’,基本只有我会回头。”

8.2 与Geoffrey Hinton的师徒传承

杨立昆在多伦多大学博士时的导师是杰弗里·辛顿。辛顿后来在2012年因深度学习的成功名声大噪。这对师徒的互动非常有趣:辛顿私下称杨立昆为“我的最有逆反精神的学生”,而杨立昆则在一次演讲中呛声辛顿的“RLHF万能论”。

8.3 绰号“卷积之王”的由来

在中国AI社区,杨立昆被尊称为“卷积之王”。这个绰号的来源是他在CNN领域的绝对领导地位。他曾幽默回应:“‘之王’听起来像古罗马角斗场的奴隶——但既然大家都这么叫,我就默认了。”

8.4 在巴黎街头被误认为普通大叔的瞬间

杨立昆在巴黎度假时常身穿休闲T恤和牛仔裤,被路人误认作普通法国大叔。有一次,一位游客问他“面包店在哪里”,他直接指路完毕。游客事后才知道自己和图灵奖得主聊过天,在社交媒体上发布了这一瞬间。