机器学习的背景和发展史:三起两落才走到今天
简单说:机器学习七十年里三次被捧上天、两次摔进寒冬,现在的辉煌是第三次高潮。每次转折都由一两件关键事件触发,资金比技术更早变脸。懂这段历史,你就能冷静判断每一波新热潮。
补ai机器学习背景这块,我是从一本旧书开始的。2024年秋天,我在旧书摊花三十块钱淘到一本1992年版的人工智能教材,书页黄脆,翻的时候都得轻点。回家看目录我愣住了:机器学习只是第三章里的一小节,总共八页;讲神经网络的那章,结尾一行小字印着"此方法前景尚不明确"。
我盯着那行字笑了很久。
今天撑起大模型的正是这套东西,三十多年前的教材拿一句话就打发了。想知道落差怎么来的,就得把七十年翻出来看。这篇我按时间线把三次高潮、两次寒冬捋清楚,每个转折点配上白话解读——故事是真的刺激,比电视剧好看。
ai机器学习背景速览:三起两落时间线
原子答案:第一波1950-1969,感知机点燃希望;第二波1980-1987,专家系统烧钱登顶;第三波2012至今,深度学习一路狂飙。中间隔着1969和1987两次寒冬,都是钱先跑、人后散。整段脉络先立个骨架,细节后面一个个讲。
| 时间 | 关键事件 | 白话解读 |
|---|---|---|
| 1956 | 达特茅斯会议,"人工智能"这个词诞生 | 一群年轻人喝了两个月夏天的工作坊,起了个日后值万亿的名字 |
| 1957 | 感知机问世,第一代可学习的机器 | 媒体吹成"能走能说话的机器十年内出现",牛皮吹太满了 |
| 1969 | 明斯基出书指出感知机死穴 | 连异或问题都解不了,资助方连夜撤钱,第一次寒冬开始 |
| 1980年代 | 专家系统火爆,企业真金白银采购 | 规则写出来的"智能"在特定场景确实赚钱,暂时忘了上次的伤 |
| 1987 | LISP机市场崩溃 | 专用硬件被通用PC打崩,约5亿美元的市场几年内近乎归零 |
| 1990年代 | 统计学习不声不响地上位 | 没有聚光灯,SVM、决策树在工业界闷头干活攒家底 |
| 2012 | AlexNet在ImageNet横扫对手 | 错误率比第二名低约11个百分点,深度学习第三次点炮 |
| 2016-2020 | AlphaGo、Transformer、GPT-3接连登场 | 机器学习从AI的偏房熬成正室,热度至今没停 |
这条时间线是我给团队内训时一版版改出来的,第三次讲才顺。历史细节的可信版本推荐对照着看,维基百科AI寒冬词条,两次寒冬的经费记录都在里面。
第一次寒冬:一本书杀死了神经网络
原子答案:1969年明斯基和帕珀特出版《感知机》,用数学证明单层感知机连异或这种简单逻辑都处理不了,政府资助应声冻结,神经网络研究趴窝十几年。
白话讲讲这个死穴。异或问题说白了就是"两个输入必须一真一假才输出真",小学生都能秒懂的规律,单层感知机死活学不会——它的结构天生画不出那条分界线。明斯基这一刀捅得极准,加上早年媒体吹过的牛一个都没兑现,美国和英国的资助机构先后翻脸。1973年英国那份著名的莱特希尔报告出来后,AI研究经费几乎全砍,走投无路的学者成批转行。
讽刺的是,多层网络其实能解异或,当年把层数加深、配上训练方法就能翻盘。可寒冬里没人愿意等。历史欠了这批人十几年,后来证明错的不是方向,是火候。
我给新人讲到这段,总有人问"当年那些人不委屈吗"。委屈。但资本从不道歉,这句话后面还会应验一次。
第二次高潮与寒冬:专家平台的十年豪门梦
原子答案:1980年代专家系统靠"把老专家的经验写成规则"在企业里真实赚到钱,各地政府砸重金跟进,1987年专用硬件市场崩盘加上平台维护成本失控,第二次寒冬比第一次更冷。
这波高潮有个标志事件:DEC公司的XCON系统帮客户自动配置计算机订单,据说每年省下数千万美元,各公司董事会坐不住了。日本更猛,"第五代计算机"国家项目投了天文数字的经费,目标十年造出会推理的机器。结果呢?规则库越写越大,一条新规则可能弄坏十条旧规则,维护费比老专家的工资还贵。八十年代末专用LISP硬件又被便宜PC全面取代,市场瞬间蒸发。日本那个项目1992年草草收场,目标的影子都没摸到。
我旧书摊淘的那本1992年教材,正好出版在梦碎那一年。
难怪神经网络那章写得那么心虚。整本书的重头全在知识表示、推理机这些专家系统遗产上——那是当时人们以为的未来。拿今天的眼光看会很恍惚,可身处浪潮里的人,谁知道自己站在高潮还是退潮?这段历史对我最大的教育就这一句:别把当下最响的方案当成终点。
暗中等牌的十五年:统计学习怎么偷偷上位
原子答案:1990到2010这十五年没有寒冬也没有狂欢,机器学习以统计学习的身份在工业界闷头扎根,支持向量机、决策树、贝叶斯方法撑起了搜索、推荐、反垃圾邮件,为第三次爆发攒够了数据和工程底子。
这段最容易被科普跳过,偏偏最值得琢磨。没有热搜的年月里,谷歌的网页排序、邮箱里的垃圾邮件过滤、亚马逊的推荐位,背后全是这批"不起眼"的统计模型在干活。1997年深蓝击败国际象棋世界冠军那次,全世界又看了AI一眼,但真正值钱的变化发生在没人报道的服务器机房里。
数据在悄悄堆积,算力在悄悄变便宜。
然后等牌的人等到了。2006年辛顿团队提出深度信念网络的训练技巧,沉寂的神经网络研究重新有了心跳。还想了解那批等牌的学者后来怎么封神,我之前整理过一份深度学习领域值得关注的13位学者,每个人的故事都配了白话版贡献解读。
2012年那一炮:深度学习掀翻牌桌
原子答案:2012年AlexNet用深层卷积网络把ImageNet图像分类错误率打到15.3%,比第二名低了约11个百分点,学界工业界集体转向,这波第三次高潮一直烧到现在的大模型时代。
当年比赛的细节我每次讲都起鸡皮疙瘩。第二名还在手工设计特征加传统模型的组合,冠军团队直接甩出八层神经网络加两块游戏显卡,错误率断崖式领先。评委都懵了。ImageNet本身是十年磨一剑的数据工程,ImageNet官方网站现在还能查到历年成绩,感兴趣的可以去看看2012年前后的断层。
后面的剧情你大概熟:2016年AlphaGo,2017年Transformer架构,2020年GPT-3带着1750亿参数登场。我2018年入行时做图像分类,那会儿调一个ResNet就敢叫深度学习工程师;现在面试聊的全是注意力机制和微调策略,八年换了人间。要说这段历史和前面两次的差别,我的判断是:前两次高潮靠承诺,这一次靠实打实的战绩,所以寒冬没那么容易重演——但过热的细分方向照样会挤泡沫,比如前两年的自动驾驶L4宣传,凉得也很干脆。
话说回来,研究这段历史对我这种普通学习者有什么用?太有用了。
第一,看懂周期就不会追热点追到高位接盘。元宇宙火那年多少课程博主押上全部身家,一年后集体转号,翻版的故事在AI圈已经演过两回。第二,能分清"新突破"和"旧想法翻新"——Transformer里的注意力机制,思想根源能追到上世纪九十年的记忆网络研究,太阳底下没多少新事。第三,跟人聊天有料。我拿那本旧教材做道具给组里讲过一次历史,效果比讲技术好得多,产品经理听完都来借书。
想接着补机器学习本身是什么,两篇打基础:不写公式的机器学习白话版,以及用一个比喻讲通机器学习。想看三次浪潮怎么点燃AI大热潮的完整复盘,我另外写过一篇机器学习引爆AI热潮的始末,和这篇互为上下文。
常见问题
机器学习经历过几次寒冬?
两次。第一次1970年代前后,感知机被打脸叠加经费大砍;第二次1980年代末,专家系统泡沫破裂。两次都是资金先撤、舆论跟进、人才流失,跌到谷底后靠新方法翻身。
现在这波深度学习热潮会再次进入寒冬吗?
整体重演两次寒冬那种全面崩盘的概率不高,因为大厂的收入已经和模型能力绑死。但局部挤泡沫一直在发生,估值虚高的赛道、兑现不了承诺的方向会先凉。历史给的教训是:别在山顶加仓。
了解发展史对学技术有什么实际帮助?
三个用处:判断新概念是新瓶旧酒还是真突破;理解教材为什么这么编排、某些方法为什么被冷落;面试聊原理时能讲出来龙去脉,比背八股文的候选人立体得多。
七十年三起两落,这就是ai机器学习背景的全部主线。下次再有人跟你说某个新技术要颠覆一切,你把1973年和1987年的故事讲给他听,他大概能冷静一半——这段历史最值钱的,就是让人学会冷静。
觉得这条时间线有用,转给正在学AI的朋友,内训讲历史的时候直接拿去用,不用谢。