机器学习和深度学习有什么区别?
发表于|更新于|学习
机器学习和深度学习是AI领域两个紧密相关但又有本质区别的概念。简单来说,深度学习是机器学习的一个子集,就像”轿车是汽车的一种”——所有的深度学习都属于机器学习,但并非所有机器学习都是深度学习。二者的核心区别在于:传统机器学习需要人工设计特征(比如手动定义”尺寸>10cm且颜色为红色”这样的规则),而深度学习通过多层神经网络自动从原始数据中提取特征和模式。深度学习尤其擅长处理图像、音频、文本等非结构化数据,但需要更多的数据和算力支持。本视频用通俗的语言和实例,帮你理清这两个AI基础概念的关系和区别。
相关推荐
2024-11-29
三分钟告诉你什么是梯度下降算法?
梯度下降(Gradient Descent)是机器学习和深度学习中最核心的优化算法,也是让AI模型”学会”东西的根本方法。可以用一个经典的比喻来理解:想象你站在一座山的某个位置,想要下山到最低点(也就是找到损失函数的最小值)。由于大雾看不清整个地形,你只能通过感受脚下坡度来判断方向——朝最陡的下坡方向迈一步,然后重新感受坡度再迈一步,不断重复直到到达谷底。梯度下降就是这样一个迭代优化过程:计算损失函数的梯度(即最陡上升方向),然后朝相反方向更新模型参数,逐步减小预测误差。本视频用三分钟帮你彻底搞懂这一核心概念。
2024-11-29
LoRA微调究竟是什么鬼?
LoRA(Low-Rank Adaptation,低秩适配)是目前最流行的大模型微调技术之一,它解决了传统微调大模型成本过高的问题。传统的全参数微调需要更新模型的所有参数(动辄数十亿),计算资源和存储需求巨大。而LoRA的核心创新在于:冻结原始模型参数不变,在模型旁路添加少量可训练的低秩矩阵,只需更新这些少量参数就能达到接近全参数微调的效果。这意味着你可以在消费级显卡上对70B级别的大模型进行微调,将其适配到特定领域或任务。LoRA已被广泛应用于Stable Diffusion(用于训练特定风格)和LLM领域,是目前最高效的模型定制技术。
2024-11-29
试下用最简单的例子解析前向传播和反向传播
前向传播(Forward Propagation)和反向传播(Backpropagation)是神经网络训练的两个核心过程。前向传播简单来说就是数据从输入层经过隐藏层最终到达输出层的计算过程——就像工厂流水线,原材料从入口进入,经过各道工序加工,最终产出成品。计算出结果后,将模型预测值与真实值进行比较得到误差,然后反向传播从输出层出发,逆向逐层计算每个参数对总误差的”贡献度”,并据此调整参数以减小误差。本视频用一个超级简单的实例,手把手带你理解这两个过程的具体计算步骤,让你真正明白神经网络是如何”学习”的。
2024-11-29
定制大语言模型LLM用RAG还是微调?
这是每个AI应用开发者都会面临的核心问题:想要让大语言模型适应特定领域,应该选择RAG(检索增强生成)还是微调(Fine-tuning)?本视频从技术原理、实现成本、应用场景和维护复杂度等多个维度进行对比分析。RAG适合需要动态知识更新和检索外部信息的场景,微调适合需要模型学习特定输出风格和格式的场景。视频通过实际案例帮助你做出最合适的技术选型。
2024-11-29
神经网络常说的蒸馏模型是什么鬼?
知识蒸馏(Knowledge Distillation)是一种将大型复杂模型(教师模型)的知识”压缩”到小型模型(学生模型)中的技术。就像一位经验丰富的教授(教师模型)将毕生所学提炼成精华教给学生(学生模型)一样,知识蒸馏的核心思想不是直接让小模型学习原始训练数据,而是让它学习大模型的”行为模式”和”决策边界”。通过这种方式,学生模型虽然体积更小、推理速度更快、部署成本更低,却能保留大模型绝大部分的性能,通常能达到教师模型95%以上的效果。这使得知识蒸馏成为模型部署和边缘设备上运行AI的关键技术。
2024-11-29
n-grams:大语言模型的起源
N-grams(N元语法模型)是大语言模型发展的”始祖”技术,理解它是理解现代LLM演进的重要基础。N-grams是一种基于统计的语言模型,它通过计算文本中连续的N个词出现的概率来预测下一个词。例如,2-gram(二元模型)会统计”我→爱”这个组合出现的频率。虽然N-grams模型简单、资源消耗大,但它奠定了现代语言模型的核心思想——根据上文预测下文。从N-grams到基于Transformer的GPT模型,本视频带你追溯语言模型的发展历程。
公告





