深度学习到底是什么?它和机器学习有什么区别?

深度学习到底是什么?它和机器学习有什么区别?
你有没有想过,为什么现在解锁手机只要看一眼、翻译外语拍张照就能出结果、下棋甚至能赢过世界冠军?
这些事情听起来像科幻,但背后靠的是同一个技术——深度学习。
今天我们就来把这个概念彻底搞清楚。
先搞懂它们的层级关系
很多人分不清人工智能、机器学习、深度学习这三个词的关系。
说白了,它们是包含关系。
人工智能是最大的圈,机器学习是它的一个重要分支,深度学习又是机器学习的一个分支。
你可以这样记:
人工智能就像"动物",机器学习是"哺乳动物",深度学习是"人类"。
都是动物,但人类有独特的思维方式。
深度学习之所以特别,不是因为名字更好听,而是因为它改变了处理信息的根本方式。
这就好比从手算到计算机,方法完全不一样了。

深度学习是怎么工作的?
用一个特别形象的比喻——水管网络。
想象一个巨大的水管系统,数据从左边进去,经过一层又一层的管道和阀门,最后从右边的不同出口流出来。
每个阀门都可以调节开合程度。
数据流过每一层都会发生变化,就像水流经过阀门被调节一样。
训练的过程,就是调整这些阀门。
调完之后,让正确答案对应的出口流出最多的"水"。
训练好的模型,阀门就被"焊死"了,直接用来识别新的数据。
你给它一张猫的图片,它就知道从"猫"的出口出水。
这个比喻来自李开复的书,但我觉得它真的把深度学习讲活了。

深度学习和机器学习的核心区别
这里有个关键概念:特征提取。
传统机器学习需要人工提取特征。
什么意思?
就是人先告诉机器什么东西重要,比如"猫有尖耳朵、有胡须、四条腿"。
然后机器按照这个规则去判断。
但深度学习不一样。
它不需要你告诉它什么是尖耳朵、什么是胡须。
它自己看大量的猫图片,自己总结出什么是猫。
教小孩认猫也是这个道理。
你不会念百科全书,你会让他看一堆猫。
看多了,他自己就知道猫长什么样了。
深度学习就是这么学的。
这就是两者最大的区别:人工设计特征 vs 自动学习特征。

深度学习为什么这么强?
两个原因:数据和算力。
深度学习像一个天赋极高的孩子。
天赋再高,没有足够的教材和教练也白搭。
它需要海量数据来喂养,数据越多表现越好。
它还需要强大的算力来支撑,主流用的是GPU和TPU。
2010年之后,正是因为大数据和GPU的突破,深度学习才迎来爆发。
那曲线能差多少?
传统机器学习给你一堆数据,它学到一定程度就卡住了,再多数据也没用——像ImageNet比赛里,当数据量超过100万张时,SVM这类传统算法的准确率就停在70%左右上不去了。
深度学习不一样,数据越多它越强,没有上限。
GPT-3用了45TB的文本数据来训练,参数规模达到1750亿,效果直接碾压了只有15亿参数的小模型。
但代价是什么?
成本很高。
不是随便一台电脑就能跑得动的。
训练一个大模型,可能要烧掉几十万甚至上百万的电费。
阿里做过测算,训练一次GPT-3级别的模型,电费大概要花掉300万美元。

四种经典深度学习算法
深度学习不是一种算法,而是一大家子。
最常见的有四种。
第一种是CNN,中文叫卷积神经网络。
它是专门处理图像的,像人类的视觉系统,能保留图片的空间特征。
人脸识别、自动驾驶看懂路面,用的都是它。
第二种是RNN和它的升级版LSTM、GRU。
它们专门处理序列数据,有"记忆"功能。
什么算序列?
语音、文本、股票走势。
你说的话是一串字组成的,股票是一串价格组成的,RNN就是来处理这种有顺序的数据。
第三种是GANs,生成对抗网络。
它的特点是能生成东西,而且生成的特别逼真。
换脸、换装、AI画图,用的都是GANs。
第四种是深度强化学习。
这个最特别,它不需要数据喂养,通过不断尝试来学习。
AlphaGo下棋就是这么学的。
它不需要人类教它棋谱,它自己跟自己下,下几百万盘,自然就学会了。
你可以把它们想象成四个不同工种的专家:CNN是画家,RNN是作家,GANs是魔术师,强化学习是探险家。
各有各的专长。

深度学习已经无处不在
你现在用的手机,每解锁一次、每问一次Siri、每刷一次抖音推荐,都是深度学习在背后工作。
人脸识别解锁,是CNN在认脸。
智能语音助手,是RNN在听懂你说话。
机器翻译,是各种网络在理解语言。
抖音的推荐系统,是深度学习在猜你喜欢什么。
自动驾驶更复杂,需要CNN看路面、RNN处理语音指令、强化学习做决策。
这些都不是未来,而是现在。
很多领域的深度学习系统,准确率已经超过人类了——比如医学影像里看X光片,AI已经能达到94%以上的准确率,比很多放射科医生还稳。
但这不意味着它完美。
深度学习不是万能的
它有几个明显的短板。
第一,太依赖数据和算力。
没有大数据,深度学习表现很差。
没有GPU,训练一次要等几个月。
第二,是个黑箱。
效果好,但你不知道为什么会好。
这在医学诊断、法律判决这种需要解释的场景里,问题很大。
第三,可能学会偏见。
因为它是从人类数据里学的,可能会把人类的歧视和偏见也学进去。
比如简历筛选系统,可能学会不录取女性。
第四,移动端应用受限。
手机芯片算力有限,跑大模型还是很吃力。
所以深度学习像一个能力超强但性格难以捉摸的天才。
你能看到它的成果,但不太理解它是怎么想的。
理解它的优缺点,才能更好地用它,而不是被它忽悠。
那深度学习到底是怎么"看"东西的?那些层层的管道和阀门,到底是怎么工作的?
下篇文章我们就来扒开这个黑箱,看看神经网络到底是怎么工作的。
