AI智能怎么学习新知识?和大脑学习很像又不像

AI智能怎么学习新知识?和大脑学习很像又不像
AI智能怎么学习新知识示意图:数据刷题、参数旋钮与微调岗前培训

简单说:AI智能学习新知识靠的是拿海量数据反复刷题,刷题时不背答案,只一点点拧动内部那几十亿个参数。微调就像岗前培训,基础本事已经在身,再补一小撮例子就能上岗。想真搞明白,把"刷题"和"岗前培训"这两个比喻吃透就够了。

AI智能怎么学习新东西?这个问题我给朋友讲过三回,第三回才讲通,用的全是比喻。她听完甩来一句"哦,不就是疯狂刷题嘛",我心想成了。说实话,多数讲AI训练的文章,开头两段就是损失函数、梯度下降,普通人看到第三行就划走了。真没必要。这事的骨架朴素得想笑:给例子,猜答案,错了就调,调完再猜。就这。所有听着唬人的名词,都是这句话的放大版。

AI智能怎么学习?把它想成一个疯狂刷题的学生

原子答案:AI智能学习新知识的核心动作是刷题——拿一亿道带答案的题反复做,每做错一次就把内部参数拧正一点点,直到命中率够高。它不背题目,练的是一种说不出口的手感。你高中刷数学卷子刷到后期,扫一眼题干就知道往哪个方向列式,对吧?AI干的就是这件事,只是量级夸张了几个数量级。它每做一题就输出一个猜测,跟标准答案一比,差多少就往回拧一点。这个"往回拧",行话叫反向传播。名字挺吓人。动作跟你对完答案改错题本没区别。更书面的说法可以翻维基百科的机器学习词条,但骨架就是我说的这一句。想看更细的拆解,我之前写过一篇机器学习入门的白话版,把这一步掰得更碎。

数据是教材,参数是脑子里亿万个旋钮

原子答案:数据是AI的教材,教材烂,刷再多也白搭;参数是它脑子里的小旋钮,训练就是把这些旋钮一个一个拧到位。GPT-3这种级别,旋钮有1750亿个。这个数字不是夸张,维基百科收录的GPT-3资料写得明明白白。作为对照,2009年发表在《比较神经学杂志》的一项研究数过,人脑约有860亿个神经元。规模差不多。学法完全是两套:人的神经元靠生物电慢慢长连接,AI的参数靠算力硬拧,一秒钟能试上万次。速度快得吓人。

但教材这关卡住了很多人。我见过一个团队拿三千条混着表情包的群聊记录,想训个客服机器人。挺离谱的。出来的模型一开口就是"绝绝子",客户当场投诉。数据脏,模型就脏,行话叫"垃圾进垃圾出",神仙也救不回来。

说个完整的"讲课"经历。去年12月,朋友约我在公司楼下的咖啡馆,问我AI会不会越用越聪明。我当场扯了三张餐巾纸。第一张画了个刷题的学生,第二张画了一摞一亿道题的卷子,第三张画了一排歪歪扭扭的旋钮。她盯着看了一分钟,问:"所以它旋钮拧完就定型了?"对。就这么残酷。日常使用里它不再学习,你跟它聊一万句,参数一个都不会动。她说那不就是出厂就焊死的佛像。比喻损了点,方向没错。

我又补一句:想让它接着学,得有人把它拖回工厂重训,或者做一次微调。话音刚落,她立刻追问微调是啥。人啊,好奇心比猫还重。话说回来,那家店的拿铁是真的淡,两杯48块,我到现在都记得。

微调是什么?岗前培训而已

原子答案:微调是在一个已经身怀基础本事的大模型上,拿几百到几万条针对性例子再轻刷一遍,让口吻和侧重对准你的活儿。它不从零学起,成本也低一个量级。打个比方:大模型是个刚毕业的通才生,什么都懂一点。你招他进来,总不会让他重读四年大学吧?岗前培训三天,教他公司黑话、周报格式、客户忌讳,就能上手干活。微调就是这三天。我后来教一个开源小模型写我们编辑部的周报标题,只喂了200条例子。轮数个位数。出来的东西就有那味儿了。这种开小灶的路子,跟AI学习到底在学什么里讲的通用底子,正好是两层东西。

顺带澄清一个高频误会:AI和机器学习的关系,很多人以为是两码事,其实是套娃。想理清的看这篇AI和机器学习的层次拆解,一张图的事。

和大脑比,AI智能怎么学习差在哪一步?

原子答案:像的地方是"练多了出手感";不像的地方是它学完即冻结、没有睡觉整理记忆这一环、也难举一反三。我个人觉得,差距最大的是"一次就学会"这件事。你被开水烫一次,这辈子都记得躲。AI学"烫"这个概念,得看几千条带标注的例子。你睡一觉,大脑自动把白天的经历归档。AI训练结束那一刻就定格了。要下判断的话:论学习的本事,我押大脑赢;论刷题的耐力,人被碾成渣。别和稀泥说什么各有千秋。真挑一个更像"学习"的东西,大脑是在学习,AI更像刻印章——刻的时候千锤百炼,刻完就那样了。

维度人脑学习AI训练我的碎碎念
学会一个新东西要几次1到3次,被烫一次就长记性几百到几千条示例起步这局人赢,没悬念
学完之后还能变吗随时能改,睡觉都在整理当场冻结,参数一个不动最反直觉的一条
刷题耐力两小时就想摸手机连跑几天不带喘人别比这个,比不过
碰上没见过的新题型能举一反三容易一本正经地胡编幻觉就是这么来的

我试了下自己微调,翻车记录公开

原子答案:今年3月我自己动手微调过一次,翻车的根因不是参数,而是数据脏——脏数据洗掉之后,同样的设置一遍跑通。结论:微调七分靠数据,三分靠调参。具体经过是这样:我租了一张24G显存的显卡,每小时6块钱左右,挑了个70亿参数的开源小模型,想让它学会我们编辑部的周报标题腔调。备了300条例子,跑了大概4小时。第一版出来,满屏"引领行业新篇章"式的营销腔。老实讲,我盯着屏幕愣了半天。排查两个钟头才发现,那300条里混着前年市场部的旧文案,数了数有80多条。全删掉,重新筛,再跑。损失值从1.9一路掉到1.2,出来的标题总算像人写的了。这轮折腾教给我的东西,比看十篇教程都多。

不夸张地说,数据清洗这种脏活才是微调的大头。参数怎么设,网上抄配置就行。喂什么进它的嘴,才是你的真功夫。

常见问题

和AI聊天聊得越多,它学得越多吗?

不是。日常对话里它的参数一动不动,聊一万句也不会变聪明。想让它学你的东西,得拿数据去微调或者重新训练,那是另一码事。

自己微调一个小模型要花多少钱?

玩票级别几百块搞定:租一张24G显存的卡每小时6块上下,小模型跑几个小时就完事。想看前沿模型长什么样,OpenAI官方页面有公开说明;想自己训一个同级别的,业内公开估算成本动辄上亿美元,个人别碰。业余和职业的差距,就是这么多零。

完全不懂编程,能搞懂AI是怎么学习的吗?

能。刷题、旋钮、岗前培训这三个比喻已经盖住八成原理,剩下两成是工程师的活。想再往下走一步,去看深度学习的白话解释,门槛比你想象的低。

AI学习和人脑学习最大的区别是什么?

一句话:人能从一次经历里提炼道理,AI只能从一万个例子里统计规律。前者叫悟,后者叫算。

写到这,"AI智能怎么学习"这题算交卷了:刷题、拧旋钮、岗前培训,三个比喻打包带走,饭桌上够你讲十分钟。觉得有用的话,转给那个老问"AI是不是快成精了"的朋友,顺便省得我再讲第四回。