深度学习AI创始人盘点:这几个人的故事比剧精彩
简单说:深度学习AI创始人通常指辛顿、杨立昆、本吉奥这三位,他们把神经网络从没人理的冷板凳学科推上主流。想理解今天的大模型,先听我讲讲他们的故事,比追剧还上头。
深度学习AI创始人都是谁?去年冬天我蹲在家里啃了一摞材料,从辛顿的访谈到本吉奥的自述,越看越觉得这仨人的人生堪比连续剧。2018年他们仨一起拿了图灵奖,2024年诺贝尔物理学奖又砸到辛顿头上。有人五十年坐冷板凳不换方向,有人中年从贝尔实验室出走,有人差点转行去搞音乐。说实话,这个名单没什么官方认证,但这三位是圈内公认绕不开的奠基人。今天我就把他们掰开讲,顺便把我读书时记的几条私货笔记塞给你。图灵奖的分量可以看 维基百科的图灵奖词条,那是计算机界的最高荣誉。
深度学习AI创始人为什么偏偏是这三个人
辛顿、杨立昆、本吉奥三个人有个共同点:八十年代神经网络被全学界看衰时,他们没撤。辛顿管理论,杨立昆管落地,本吉奥管把火种传下去,分工几乎天衣无缝。八十年代那会儿主流是符号主义,也就是教机器写规则,神经网络路线被嘲为"炼金术"。经费砍掉,论文被拒,学生招不来。挺惨的。三人各自在加拿大和美国的实验室里死磕,硬是把这条断头路熬成了主干道。2012年辛顿带队拿下 ImageNet 图像识别冠军,错误率比第二名低了十多个百分点,全场震惊,深度学习的火就从那一刻烧起来了。
我自己读他们早期论文时发现个细节。1986年那篇传播方向性的反向传播论文,辛顿只是二作,一作是鲁梅尔哈特。可后来所有教科书都把辛顿挂在嘴边。为什么?因为他不光发论文,还花了三十年不停地讲、不停地教、不停地拉人入伙。学术圈也讲复利的。这话不是我说的,是我读他的学生访谈拼出来的结论。
辛顿:拒绝谷歌终身岗的倔老头
杰弗里·辛顿是三人里年纪最大的,被称为深度学习教父,2012年的 AlexNet 和后来的知识蒸馏都有他一份。他1947年生在英国,家世吓人,玄祖父是逻辑学家乔治·布尔,布尔代数那个布尔。他本科学心理学,觉得没意思,又跑去读人工智能博士,中途退学当过木匠。真事。后来重返学术界,一路从美国漂到加拿大,在多伦多大学扎了根。
我最喜欢他2012年后的一个操作。当时谷歌开出天价收购他刚成立的小公司,他没直接答应,反手办了场拍卖会,让谷歌、微软、百度几家轮番抬价,最终4400万美元成交。老头分完钱给团队,自己挂着谷歌的职,十来年后2023年又辞职了。辞职理由是担心AI风险,他原话大意是"我想自由地谈论AI的危害,不希望被雇主立场捆住"。七十六岁辞职聊风险,这操作我给满分。想系统了解他的观点,可以看他接受 MIT Technology Review 的长篇专访,讲得比论文通俗。
笔记里我记过一句他的话,抄在便签上贴了半年:如果直觉和逻辑冲突,先信直觉。他的解释是,逻辑只能推已知的关系,直觉里藏着你自己都没意识到的经验。这种偏执放在他身上成立,放在我身上大概率是灾难。分人的。
杨立昆:卷积之父的硬核与嘴硬
杨立昆,法国人,卷积神经网络CNN的缔造者,如今执掌Meta首席AI科学家。他上世纪八十年代末在贝尔实验室做出手写字识别系统,那套 LeNet 后来被银行拿去识别支票,算是神经网络最早的大规模商用之一。注意,那个年代没人谈深度学习,他这活儿在学界属于边缘成果。他扛住了。
我个人觉得他是三人里最敢开炮的。大模型火起来后他多次公开说自回归模型缺世界观,"永远到不了人类水平",业内吵翻了天。有人骂他吃不到葡萄,有人敬他敢讲真话。他跟辛顿是几十年老友,俩人还互相调侃过对方的观点。读他2019年那本《科学之路》,我划了十几条线,最触动我的是他写博士期间的一段:导师不支持他的方向,他咬牙自己攒设备做实验,毕业时论文方向在法国几乎没人看得懂。孤独感隔着纸都能渗出来。
讲完两个大牛,插一段我的跑题观察。三人里最低调的是本吉奥,可我越读材料越觉得他像这支队伍的地下工作者。蒙特利尔实验室在他手里成了深度学习人才的黄埔军校,MILA 培养出的研究者散布全球各大AI实验室。墙内开花墙外香,他本人却长期不温不火。直到2018年图灵奖、2024年他再度进入公众视野聊AI安全,大家才回头数他播了多少种子。话说回来,杨立昆的知名度也经历过类似曲线,只是他嘴皮子利索,翻红得早。
本吉奥:差点去搞音乐的传火者
约书亚·本吉奥,蒙特利尔大学教授,注意力机制和序列建模的推手,2018年与两位老友同获图灵奖。他1964年生在巴黎,家里是从摩洛哥迁去的犹太移民,兄弟俩后来都做了AI教授。他年轻时认真考虑过当音乐家,吉他弹得像模像样,最后还是选了计算机。我读到这段时乐了,深度学习教父差点变摇滚老炮。
他真正的贡献在我看来是两块。一块是2014年前后推动的注意力机制研究,今天大语言模型的核心部件之一,源头就有他团队的论文。另一块是育人。蒙特利尔被他带成了AI重镇,当地政府甚至因为他的实验室调整过产业政策。不夸张地说,全球AI研究的半壁掌门人都跟他沾着师承关系。
三巨头横向一比,各有各的活法
三个人的路线差异大到离谱,我给你列张表感受下,注意评价列纯属我的主观判断。
| 人物 | 代表作 | 主战场 | 我的主观印象 |
|---|---|---|---|
| 辛顿 | 反向传播、AlexNet、知识蒸馏 | 多伦多大学 | 最像先知,晚年开始自我怀疑,反而可爱 |
| 杨立昆 | LeNet、卷积神经网络 | Meta(原Facebook) | 最硬核也最嘴硬,得罪人无数 |
| 本吉奥 | 注意力机制、MILA育才 | 蒙特利尔 | 存在感最低,桃李最盛,偏老师型 |
这张表我调过三版。第一版我给本吉奥的印象写的是低调,后来觉得不准确,他不是低调,是忙别的去了。这几年他几乎把精力全押在AI安全上,各种政策场合都能看到他。方向变了,人没变。
读创始人故事时我记下的五条笔记
传记访谈读多了容易只看热闹,我提炼了五条对我真有用的,直接抄走就能用。
第一,冷板凳期别指望正反馈,辛顿的神经网络低谷期长达三十年,靠的是方向信念而不是KPI。第二,跨界经历是资产不是负债,辛顿的心理学背景、本吉奥的音乐爱好,最后都成了思维燃料。第三,学会讲你的研究,杨立昆的LeNet能商用,一半功劳在他满世界演示。第四,朋友圈决定研究命运,三人互相审稿互相打气,圈子冷不等于抱团冷。第五,功成之后要有退出勇气,辛顿七十多岁从谷歌辞职聊风险,比守着光环难多了。
这五条我自己最做不到的是第五条。人性使然吧。
常见问题
深度学习AI创始人只有这三个人吗?
不是严格意义上的。三巨头之外,吴恩达推动了大规模GPU训练,Schmidhuber 提出了循环网络的重要结构,李飞飞的 ImageNet 数据集是引爆点之一。只是辛顿、杨立昆、本吉奥因图灵奖被捆在一起,成了最常被提起的组合。
学他们的故事对学深度学习有实际帮助吗?
有,但帮助不在技术本身。了解每项技术诞生的时代背景,你能更准确地判断哪些是硬突破、哪些是营销包装。比如看完卷积网络的诞生史,再看今天某些"全新架构"的宣传,你的免疫力会强不少。
新手入门该从哪位的书或课开始看?
入门优先杨立昆的《科学之路》和辛顿的公开访谈,语言相对友好。本吉奥参与合著的《深度学习》花书是硬核教材,适合已有数学基础后再啃。零基础直接读花书,大概率第三章就劝退。别问我怎么知道的。
写到这我合上笔记本,这三个人的故事最打动我的从来不是奖项,是他们在没人相信的年代里各干各的,互不打扰又互相托举。想更上一层的朋友可以顺路看看 深度学习是什么的白话入门、机器学习三起两落的发展史,进阶一点还有 深度学习必读的五篇经典论文,串起来读故事会更完整。觉得这几个老头的人生有意思,把这篇转给同样在学AI的朋友吧。