大话神经网络之模型的泛化能力和过度拟合
发表于|更新于|学习
泛化能力(Generalization)和过拟合(Overfitting)是神经网络训练中最重要的两个概念。泛化能力指模型在未见过的数据上表现良好的能力——就像学生能灵活运用学过的知识解决新问题。过拟合则是模型过度”死记硬背”训练数据,在新数据上表现不佳——就像学生只会做原题,题目一变就不会了。本视频用通俗的语言和生动的例子,解释这两个概念的原理、原因和解决方法,帮你理解如何训练出真正”学会”了的AI模型。
相关推荐
2024-11-29
通俗理解大语言模型word embeddings
Word Embeddings(词嵌入)是大语言模型理解语言的第一步,也是最重要的一步。简单来说,词嵌入就是将人类语言中的单词转换成计算机能够处理的 numerical vectors(数值向量)。通过这种转换,语义相似的词在向量空间中的距离更近——比如”国王”和”女王”的向量距离会比”国王”和”苹果”更近。更神奇的是,词嵌入还能捕捉到类比关系,例如”国王-男人+女人≈女王”。本视频用生动直观的方式,带你理解词嵌入的核心原理、训练方式(如Word2Vec、GloVe),以及它是如何让大模型真正”理解”语言含义的。
2024-11-29
n-grams:大语言模型的起源
N-grams(N元语法模型)是大语言模型发展的”始祖”技术,理解它是理解现代LLM演进的重要基础。N-grams是一种基于统计的语言模型,它通过计算文本中连续的N个词出现的概率来预测下一个词。例如,2-gram(二元模型)会统计”我→爱”这个组合出现的频率。虽然N-grams模型简单、资源消耗大,但它奠定了现代语言模型的核心思想——根据上文预测下文。从N-grams到基于Transformer的GPT模型,本视频带你追溯语言模型的发展历程。
2024-11-29
LLM中的量化模型是什么鬼?
量化(Quantization)是让大语言模型”变小变快”的核心技术。简单来说,量化就是将模型参数从高精度(如32位浮点数)降低到低精度(如8位或4位整数)的过程。这可以大幅减小模型体积(减少4-8倍),降低显存占用,加快推理速度,同时对模型性能的影响相对较小。例如,一个70B参数的模型经过4-bit量化后,原本需要140GB显存,现在只需要不到40GB,消费级显卡也能运行。本视频通俗讲解量化的原理和实际应用。
2024-11-29
ChatGPT常见的One-shot,few-shot是什么鬼
One-shot(单样本学习)和Few-shot(少样本学习)是让大语言模型快速适应新任务的关键技术。简单来说,就是在不进行微调(Fine-tuning)的情况下,通过在提示词中提供少量示例来引导模型理解任务。One-shot是给1个示例,Few-shot是给2-5个示例。例如你想让模型用特定格式输出,只需在提示词中给2-3个正确格式的例子,模型就会自动模仿这种格式。本视频通俗讲解这些概念的原理、使用场景和最佳实践。
2024-11-29
同一问题为什么LLM每次输出答案都不一样?
很多人在使用ChatGPT等大模型时都会发现:同样的一个问题,每次问得到的答案都不一样。这背后的原因与大模型的生成机制有关。LLM本质上是一个概率模型,它在生成每个词时都会计算下一个最可能出现的词的概率分布,然后通过采样(sampling)来选择具体的输出。控制参数如temperature(温度)决定了采样的随机性——temperature越高,输出越多样化但可能不够准确;temperature越低,输出越确定但可能显得刻板。此外,模型本身没有”记忆”每次的输出,加上训练数据中的知识并非以确定性的方式存储,导致即使输入完全相同,输出也可能不同。了解这一原理有助于你更好地调教和使用AI工具。
2024-11-29
LoRA微调究竟是什么鬼?
LoRA(Low-Rank Adaptation,低秩适配)是目前最流行的大模型微调技术之一,它解决了传统微调大模型成本过高的问题。传统的全参数微调需要更新模型的所有参数(动辄数十亿),计算资源和存储需求巨大。而LoRA的核心创新在于:冻结原始模型参数不变,在模型旁路添加少量可训练的低秩矩阵,只需更新这些少量参数就能达到接近全参数微调的效果。这意味着你可以在消费级显卡上对70B级别的大模型进行微调,将其适配到特定领域或任务。LoRA已被广泛应用于Stable Diffusion(用于训练特定风格)和LLM领域,是目前最高效的模型定制技术。
公告





