大模型入门不踩坑!一文吃透 AI 黑话,这篇收藏级指南够用了

发布时间:2026/7/24 4:49:04
大模型入门不踩坑!一文吃透 AI 黑话,这篇收藏级指南够用了 本文是一份大模型基础知识指南用通俗语言解释AI黑话。涵盖大模型概念、Token处理、Transformer架构、自注意力机制、RAG技术、模型架构、三大训练阶段预训练、监督微调、强化学习及部署优化。通过类比和直观解释帮助读者建立大模型知识框架理解从输入到输出的完整工作流程和核心技术让小白和程序员都能轻松掌握大模型基础知识。一、大模型的基本概念1、 什么是大语言模型LLM大语言模型Large Language Model, LLM是自然语言处理NLP领域的一个新兴的流行领域通过巨大的参数量能够理解和生成人类语言就像是一个人工打造的超级大脑。我们日常使用的 ChatGPT、Gemini、豆包等本质上都是大语言模型。大语言模型之所以被称为大是因为它们通常包含数十亿甚至数千亿个参数需要海量的数据和计算资源来训练。这些模型能够处理和生成人类语言理解上下文并在各种任务中表现出惊人的能力。2、 token大模型的基本单位当我们与大模型对话时我们输入的内容被称为“prompt”提示词。大模型不会直接处理整句话而是会通过分词器Tokenizer将文本切分成一个个的“token”。token 可能是一个单词、一个字符或者一个词的一部分。大模型的任务就是计算在已有 token 序列之后应该续写哪些 token。tokenizing 的意义 Tokenizing 是将人类语言翻译成机器能够高效处理的结构化数据的关键一步。它的核心是在语言的语义完整性和计算机的高效处理能力之间找到了一个近乎完美的平衡点。为了理解它的巧妙之处我们可以先看看两种简单的替代方案有什么问题按词语分词看似自然但会导致词表规模爆炸如run,running,ran都要单独记并且模型遇到词表中没有的词如新词、拼写错误就会束手无策称为 OOV, Out-of-Vocabulary 问题。按字符分词能解决 OOV 问题但序列会变得过长一个单词变成很多个字符不仅计算开销巨大也让模型很难从单个字母中学习到高层次的语义信息。而主流的子词分词方法如 BPE通过将文本切分成有意义的子词单元Token同时解决了上述问题。 它不是简单地将文本拆分成单个字符也不是机械地拆分成词语而是通过将文本分解为具有独立语义的最小单位即 Token将人类语言转化为机器能够理解和学习的结构化数据。例如taller可能会被拆分成taller这样的形式本身就能体现出形容词本身和比较级的语义特征。这既保证了模型能够有效地捕捉和学习词语、短语的意义和上下文关系又避免了因序列过长而导致的巨大计算开销从而让模型能够高效、准确地理解和生成语言。总结来说Tokenizing 是一种优雅的工程妥协。它将连续的文本转化为了离散、高效且富有语义信息的 token 序列为大模型理解和生成复杂的人类语言奠定了坚实的基础。BPEByte Pair Encoding使用最广泛的一种分词方法是 BPE (Byte Pair Encoding)。GPT 系列、DeepSeek、Gemini 等主流模型采用的都是 BPE 或其变体。BPE 最早源于一种数据压缩算法其核心思想是通过不断合并最高频的相邻符号对来迭代地构建词表 (vocabulary)。BPE 算法的工作原理从字符级别开始每个字符都是一个 token统计所有相邻 token 对的出现频率将出现频率最高的 token 对合并为新 token重复步骤 2-3直到达到预设的词表大小。下面有一个简单的例子这个过程会一直持续下去像low、new这样常见的组合会逐渐被合并成单个 token。最终词表里既有像l,o这样的单个字符也有像er这样的子词还有像 low 这样的完整单词。这种构成方式让分词器既能高效处理常见词又能灵活地拆分和理解未知的新词。从这个过程我们也可以看出分词器的训练可以不需要任何参数只需要指定最大词表大小或是最多迭代次数直接利用语料库去生成即可。二、大模型的运作流程1、 大模型的续写机制自回归生成“自回归” 这个词听起来很专业但其实很简单自己回归自己即把上一步的输出作为下一步的输入。在分词阶段结束后我们有了一个包含几万到几十万个 token 的词表Vocabulary每个 token 都有一个唯一的数字 ID。例如“I love NLP” 会被转化为[101, 2293, 18847]这样的数值序列输入给模型。从根本上说大模型就是一个终极的“下一个词”预测器。它生成内容的本质就是在给定一段已有文本的基础上一步一步地预测出最有可能紧随其后的下一个 token 是什么。具体流程如下我们可以把它想象成一个严谨的四步循环接收输入 (Prompt Tokenize) 用户输入一段文字如“中国的首都是”。分词器迅速将其切分为 token 序列并转换为对应的数字 ID 序列。预测概率分布 (Prediction) 模型接收这个数字序列然后动用其全部“算力”来回答一个问题在整个词汇表中哪一个 token 最有可能出现在中国的首都是后面模型不会只给出一个答案而是会输出一个覆盖了词表中所有 token 的概率分布一个概率列表总和为 1。 例如{北京: 0.95, 上海: 0.02, 一个: 0.001, ...}。采样与拼接 (Sample Append) 模型根据上一步生成的概率分布采样 (Sample) 出一个 token。通常它会选择概率最高的那个比如“北京”但也可以引入一些随机性。然后模型将选出的这个 token 的 ID 拼接到现有序列的末尾。旧序列:[ID(中国), ID(的), ID(首都), ID(是)]新序列:[ID(中国), ID(的), ID(首都), ID(是), ID(北京)]循环迭代 (Loop) 将这个新的、更长的序列作为下一轮的输入完全重复第 2 步和第 3 步让模型预测再下一个 token比如“。”。这个“预测-拼接-再预测”的循环会不断进行一个 token 一个 token 地向外“吐”出内容直到满足某个停止条件比如生成了特殊的[EOS]结束标记或达到了设定的最大长度最终构建出完整的回答。这个过程就像一个超级智能的词语接龙游戏。但与人类玩接龙只看前一个词不同大模型在决定下一个词时会回顾并分析前面已经说过的所有内容。这种“下一步的决策依赖于过去所有步的完整历史”的模式正是“自回归”这个词的精髓所在。思考既然模型推理时参数已经是固定的为什么同样的问题抛给同一个 LLM每次输出的结果不尽相同呢简单来说因为它在最后“选词”的环节引入了可控的随机性。如果模型总是死板地选择概率最高的词贪心策略那每次的回答确实会一模一样但会显得非常机械和重复。为了让回答更自然、更有创造力现在的模型普遍采用一种 “采样Sampling” 的策略。你可以把它想象成模型在做“多选题”它不是直接选得分最高的那个而是根据得分从排名靠前的几个选项中随机挑一个。这就好比你问“今天天气不错我们去___”模型算出来“公园”得分 90“逛街”得分 85“野餐”得分 80。它不会永远只说“公园”而是这次可能选了“公园”下次可能就选了“逛街”。而 LLM 是 autoregressive自回归模型生成文本时从第一个词开始每个后续词的预测都依赖于之前生成的所有词。即使初始采样的微小差异如第一个词不同也会通过 “蝴蝶效应” 导致后续生成路径完全不同最终输出差异显著。控制采样策略的一个重要参数就是“温度Temperature”温度控制概率分布的 “平滑度”。低温 (T1)概率分布更“尖锐”强者愈强。模型会更倾向于选择它认为最可能的词回答更具确定性、更保守。高温 (T1)让概率分布更“平滑”会放大低概率词的可能性缩小了高概率与低概率词之间的差距。这给了那些“意料之外”的词更多被选中的机会让回答更多样、更具创造性但风险是可能偏离主题。2、 Transformer 架构与自注意力机制让模型学会“抓重点”Transformer 是目前几乎所有主流大模型包括 GPT 系列、Gemini 等都在使用的核心架构。我们可以将它理解为大模型的“核心处理器设计图”它决定了模型处理信息的基本方式而其设计的革命性之处就在于其核心组件——自注意力机制 (Self-Attention)。Transformer 出现之前RNN 的“线性拥堵”要理解 Transformer 为何是革命性的我们需要先知道它解决了什么问题。在它出现之前处理文本序列的主流模型是 RNN循环神经网络。RNN 的工作方式就像一个逐字阅读的人从句子的第一个词读到最后一个词。它会努力记住前面读过的内容然后将“记忆”传递给下一个时间点。这种“一个接一个”的串行处理方式导致它无法充分利用现代 GPU 强大的并行计算能力处理长文本时效率低下。同时存在长距离遗忘的问题当句子很长时就像一个人记性不好读到句尾时可能已经忘了句首的关键信息。Transformer 的革命一眼看全并行处理Transformer 彻底抛弃了 RNN 的线性序列处理方式。它不再是逐字阅读而是像拥有“鹰眼”一样一口气读取整个句子然后立刻并行处理所有词元。一口气看完全部词元模型如何理清它们之间的复杂关系呢例如一句话里有多个“它”每个“它”分别指代什么这就是自注意力机制 (Self-Attention) 发挥作用的地方。自注意力机制一场内部的“关联度投票”如果说 Transformer 是一个高效的团队那么自注意力机制就是这个团队的高效沟通法则。它让句子中的每一个词元都能“看”向句子中的所有其他词元并计算出“我应该最关注谁”。人类阅读时的注意力当我们阅读“The robot ate the apple because it was delicious.”这句话时我们自然而然地知道“it”指的是“apple”。大模型的自注意力机制大模型通过自注意力机制能够计算出“it”和“apple”之间的关联度很高从而理解“it”指代的是“apple”而不是其他人或物。我们可以用一个生动的例子来理解这个过程句子 “The robot ate the apple because it was delicious.”当模型处理到 it 这个词时它需要搞清楚 it 到底指代的是robot还是apple。自注意力机制会这样做分身角色 (Q, K, V)为了理解上下文句子中的每个词元都需要从其他词元那里“检索”相关信息来丰富自己。为此模型为每个词元都生成了三个专属向量让它们扮演三个不同的角色Query (查询 Q)可以理解为 “我想找谁”。代表it这个词它主动发出的寻找关联的“提问信号”。Key (键 K)可以理解为 “我是谁我有什么特点”。代表robot、apple等所有词元它们各自展示出的“身份标签”。Value (值 V)可以理解为 “我携带的实际信息”。代表每个词元实际蕴含的意义。计算关联度Attention Scoreit 的 Query 向量会和句中所有词元包括它自己的 Key 向量进行一次“匹配度”计算通常是点积运算。Q_it·K_robot→ 得到一个分数比如 0.1Q_it·K_apple→ 得到一个更高的分数比如 0.8Q_it·K_delicious→ 得到一个较高的分数比如 0.6这个分数就代表了 “为了理解it我应该在多大程度上关注你这个词”。分数越高关联越强。加权求和重塑自我最后模型将所有词元的 Value 向量根据上一步算出的关联度分数进行加权求和。apple和delicious的分数高所以它们的 Value 信息会被更多地融入robot的分数低它的信息则被少量融入。这样it这个词元原始的、孤立的含义就被重塑成了一个全新的、吸收了上下文信息的、含义更丰富的向量。这个新向量里已经深深地烙印了apple和delicious的信息模型因此“理解”了it指的是apple。最关键的是这个过程对所有词元是同时并行发生的。robot也在同步计算它和谁的关联度apple也是。这就像在一瞬间完成了一场全员参与、信息充分交互的“内部关系投票”极大地提升了模型对语言上下文的理解深度和效率。3、 检索增强生成RAG检索增强生成Retrieval-Augmented Generation, RAG就像是给大模型配备了一个外部记忆库让它能够查阅最新或专业的资料来回答问题。我们知道大模型的一个核心局限是它的知识是“静态”的截止于其训练数据的最后日期并且它不了解任何私有或实时信息。因此当你问它“今天的天气如何”或“我们公司上个季度的财报总结是什么”时它要么无法回答要么就会开始“一本正经地胡说八道”即幻觉 Hallucination。检索增强生成 (RAG) 正是解决这一问题的优雅而强大的方案。它就像是把大模型的“闭卷考试”模式变成了“开卷考试”模式。你不必强迫模型记住所有知识而是在它回答问题前先帮它找到相关的参考资料让它依据这些资料来作答。我们日常使用的 AI 对话产品中的“联网搜索”功能或者外挂企业内部知识库进行问答背后都是 RAG 在发挥作用。RAG 的核心工作流三步走想象一下你向一个搭载了 RAG 的 AI 助手提问“我们物料管理系统的 A 模块源码主要实现了什么功能”第一步检索 (Retrieve) - 去图书馆找书AI 助手不会立刻让大模型回答。相反它会将你的问题“我们物料管理系统的 A 模块源码”作为查询指令发送给检索模块。检索模块就像一个图书管理员它会在你提供的“图书馆”如公司的源码库、API 文档、向量数据库里快速搜索找到与你问题最相关的几段文字或代码片段。检索方式这可以是传统的关键词搜索但更先进的是向量检索。后者能理解语义相似度即使你的提问和原文措辞不同也能精准地找到相关内容。第二步增强 (Augment) - 划重点并递上小纸条检索模块找到了相关的资料比如几段关键的源码和注释。系统会将这些检索到的“参考资料”和你的“原始问题”智能地组合在一起形成一个内容更丰富、上下文更明确的新 Prompt。这就像是把划好重点的参考书内容和你原来的问题一起贴在一张小纸条上。这个新 Prompt 的格式通常可以是这样的“请根据以下背景信息回答问题。背景信息‘[这里是检索到的A模块源码片段1]’‘[这里是相关的架构文档描述2]’。我的问题是我们物料管理系统的 A 模块源码主要实现了什么功能”第三步生成 (Generate) - 看小纸条回答问题这个包含了丰富上下文的“增强版 Prompt”被发送给生成模块也就是那个标准的大语言模型。对于 LLM 来说现在的任务变得极其简单。它不再需要“回忆”或“猜测”只需要像一个阅读理解高手一样总结和提炼小纸条上已有的信息就能给出一个准确、有理有据的回答。因此它能够做到回答有依据对于资料中没有提及的内容它会自然地回答“根据现有资料无法得知”而不是凭空捏造。通过这个“先查资料再作答”的简单流程RAG 极大地提升了 LLM 在处理专业领域、 私有数据和实时信息时的准确性和可靠性是当前将大模型落地应用的最核心技术之一。三、大模型的规模与架构1、 参数量与 Scaling Law如果说大模型是一个极其复杂的“人工大脑”那么参数就是构成这个大脑的“神经元连接的强度”。参数在技术上参数是模型中的权重weights和偏置biases它们本质上是一系列需要通过训练来学习和优化的数值。你可以把它们想象成大脑中亿万个可以调节的“旋钮”。训练的过程就是不断地、精细地调整这些旋鈕使得模型在接收到特定输入时能产生最接近正确的输出。因此参数量比如 1750 亿个就是这些“旋钮”的总数量它直接决定了模型的复杂度和潜在的容量上限。Scaling Law许多研究表明模型参数越多规模越大算力越高表现就越好。这一现象被称为扩展定律 (Scaling Law)也就是常说的“大力出奇迹”。Scaling Law 揭示了模型性能与三个核心因素的规模严格相关模型尺寸参数量训练数据集的规模投入的计算量 (Compute)这三者就像一个木桶的三块板需要均衡地扩大才能最有效地提升模型性能。给一个“天才大脑”巨大参数量却只让他读一本书少量数据是巨大的浪费。反之亦然。Scaling Law 指导着机构如何最经济地利用资源来训练出更强大的模型。从“B”到“T”模型的规模竞赛大模型的名称后通常会标注其参数量“B”代表 Billion十亿现在甚至出现了“T”代表 Trillion万亿。GPT-3 (2020): 175B当年的里程碑证明了 Scaling Law 的可行性。GPT-4 (2023): 官方未公布但业界普遍估计其总参数量超过 1.8T即 1800B同样被认为是 MoE 架构。“大力”的极限边际收益递减不过正如 Scaling Law 的深入研究所揭示的单纯增加参数量带来的性能提升其边际收益正在逐渐递减。将模型从 100B 增加到 1000B 带来的提升远比从 10B 增加到 100B 要小。这是因为训练成本算力、电力、时间会呈指数级增长而性能提升却趋于平缓。这促使整个行业开始从“追求更大 (Bigger)”转向“追求更聪明 (Smarter)”。例如通过改进模型架构如 MoE、提升数据质量、优化训练算法等方式来更高效地提升模型能力。2、 稠密模型 vs 稀疏模型根据计算方式的不同大模型可以分为稠密模型和稀疏模型。稠密模型每次计算都会调动所有参数就像是全情投入计算量大但理论上能力更强。想象一个学生面对每一道题都动用自己所有的知识和思考能力无论题目难易。稀疏模型只激活与当前问题相关的部分参数更加冷静能降低计算量提升速度。就像一个聪明的学生面对简单的加减法不会去思考微积分只调用相关知识。3、 混合专家模型MoE混合专家模型Mixture of Experts, MoE就像是一个由多位专家组成的团队每位专家负责不同领域的问题由一个协调者决定针对具体问题应该请哪位专家来回答。目前稀疏模型中最流行的一种实践是混合专家模型MoE。Grok、DeepSeek 等都是 MoE 模型。MoE 模型通过门控网络可以理解为协调者或分发员给每个问题分配合适的专家参数子集赋予它们不同的权重再生成结果。这种方法可以在保持模型能力的同时大幅降低计算成本。例如当你问一个编程问题时MoE 模型会主要激活与编程相关的专家参数而当你问一个历史问题时则会激活与历史相关的专家参数。这就像一个公司有市场、技术、财务等不同部门的专家根据问题性质决定由哪个部门来处理。这里可能有一个容易误解的地方MoE 模型中的多个“专家”擅长哪个方面并不是预先设定的。这些专家的“专业领域”完全是在海量数据训练中自发涌现和动态形成的。它们的分工远比我们想象的要更抽象、更底层。可能 1 号专家最终擅长处理英文中的语法结构。可能 5 号专家对JSON 格式的文本特别敏感。而 8 号专家可能专门处理与科学推理相关的逻辑模式。我们无法给这些专家贴上易于理解的标签但正是这种基于数据模式的、机器自发形成的分工使得 MoE 架构在处理复杂和多样化的信息时能够达到惊人的效率和性能。四、大模型的训练流程1、 预训练阶段大模型的训练通常分为三个主要阶段预训练、后训练微调和 后训练强化学习。这三个阶段可以类比为人类的成长过程婴幼儿期大量吸收基础知识、学生时代学习专业技能和社会化过程学习社会规范和价值观。预训练Pre-training的目的预训练是大模型制造的第一步目的是让模型掌握人类世界的各种知识和语言规律就像婴幼儿时期通过大量阅读和观察来学习世界的基本规则。预训练使用的是海量互联网数据包括各种文章、书籍、代码、百科全书等内容。这一阶段是大模型训练中最耗时、耗算力的部分往往需要几个月甚至几年的时间以及大量的高性能计算设备。预训练完成后我们会得到一个基座模型Base Model你可以将它理解为一个互联网模拟器或学会了人类世界知识的通用大脑。这个基座模型掌握了大量的知识但还不知道如何与人类有效交流也不知道什么是好的回答。自监督学习与反向传播在预训练阶段模型需要阅读海量的原始文本数据。但这些数据只有文字并没有现成的“问题”和“答案”供模型学习。那么模型是如何从中汲取知识的呢答案就是自监督学习Self-supervised Learning它是一种让模型自己给自己“出题”并“对答案”的聪明方法。整个学习过程由两个核心环节构成首先通过自监督学习创造出学习任务然后通过反向传播机制来完成学习和优化。第一步自监督学习 —— 无中生有地创造“考题”自监督学习的核心思想是从数据本身中自动生成标签或目标而无需人工标注。这就像让一个孩子通过玩填字游戏来学习语言而不是直接给他一本字典背诵。最主流的一种自监督任务叫做“遮蔽语言建模”Masked Language Modeling。具体过程如下获取原文从海量数据中随机抽取一句话。例如“我家门口有两棵树一棵是枣树另一棵也是枣树。”制造问题Masking随机遮盖掉句子中的一个或多个 token形成一道“完形填空题”。例如“我家门口有___棵树一棵是枣树另一棵也是___。”确定答案被遮盖住的原始单词“两”和“枣树”就成了这道题唯一的“正确答案”。通过这个简单的方法我们就能从无穷无尽的文本中自动地、源源不断地为模型创造出亿万道“考题”。第二步学习循环 —— 通过“猜测、对比、反思”来优化有了考题之后模型就可以开始它的学习循环了。这个循环的核心机制是反向传播Backpropagation它驱动着模型不断地自我纠错和进步。这个循环包含四个关键步骤前向传播做出猜测模型读取这道“填空题”并根据已经学到的知识尽力去预测空白处最有可能的词。比如模型经过计算可能猜测空白处是“村上春树”的概率是 10%而猜测是“枣树”的概率是 8%。计算损失衡量差距模型将自己的猜测结果与“正确答案”也就是原文中的“枣树”进行对比。这个“差距”在数学上被称为损失Loss。猜测得越离谱损失值就越大。模型发现自己对“枣树”的预测概率不够高因此产生了一个不小的损失值。反向传播反思归因这是最关键的一步。模型会根据这个损失值从后向前、层层递进地反向追溯计算出网络中每一个参数对这次“猜错”负有多大的责任。这个过程就像一个团队项目失败后开复盘会精确地找出是哪个环节、哪个人的哪个决定导致了最终的失误。在数学上它就是找到了让损失下降最快的方向梯度。更新参数调整认知模型将所有参数朝着“能让损失变小”的方向进行微小的调整。与“枣树”预测相关的参数权重会被调高一点而与“村上春树”相关的则可能被调低。通过亿万次重复“出题 → 猜测 → 对比 → 反思调整” 这个循环模型的参数被不断优化。它逐渐学会了语法、语境、事实知识甚至一定的推理能力最终它的“思考方式”会越来越接近正确答案从而变得越来越“聪明”。2、 后训练阶段后训练 是指在模型完成了大规模、无监督的“预训练”之后进行的所有训练和优化过程的总称。预训练阶段的模型通过海量文本数据学习了语言的规律、事实知识和一定的推理能力但它更像一个知识渊博但行为不可控的“原始大脑”。从我们最常用的 LLM 对话模型的角度来看后训练阶段的核心目标是让模型的能力与人类的意图、价值观和偏好对齐一方面能够回答你的问题而不是帮你续写问题成为一个合格的对话模型另一方面是尽量保证他的回答 有用、无害且可靠。后训练是目标实现这一目标的关键步骤包括监督微调和强化学习。监督微调SFT——模仿监督微调Supervised Fine-Tuning, SFT就像是针对特定职业的专业培训让基座模型从博学多才的学者变成专业的对话助手或其他特定角色。预训练完成后的基座模型通常不能直接使用还需要进行后训练其中最常用的方法是监督微调SFT。监督微调需要提供带标注的数据集让模型模仿这些数据的风格来生成内容。例如要将基座模型变成对话助手就需要提供大量高质量的问答对话数据。与预训练相比微调所需的数据集规模和训练时长都要小得多。例如开源对话数据集 Open Assistant 只包含约 16 万条对话信息其中中文对话不到 5000 条但已足够将基座模型转变为一个合格的对话助手。监督微调中的数据集需要一般真人编写保证质量这些人被称为数据标注员。数据标注员的工作是创建或筛选高质量的对话样本确保这些样本符合预期的行为标准例如礼貌、有帮助、安全等。不同用途的大模型需要不同类型的微调数据。例如医学专家模型需要医学对话数据法律专家模型需要法律对话数据等等。这就像不同专业的学生需要学习不同的专业课程一样。强化学习RL——领悟强化学习Reinforcement Learning, RL就像是大模型的社会化训练教它学会什么样的行为是受欢迎的什么样的行为是不受欢迎的。完成监督微调后我们已经有了一个基本可用的大模型。但如果到此为止大模型也只是一个没有灵魂只会四处搬运鹦鹉学舌的复读机。要给大模型注入灵魂使其输出更符合人类偏好甚至展现出超越人类的智力就需要进行强化学习(RL)。这就像是一个人在学校学习了各种知识和技能后还需要在社会中学习如何与人相处如何表达自己的想法如何做出受欢迎的行为。RLHF基于人类反馈的强化学习基于人类反馈的强化学习RLHF就像是通过点赞和踩来教导大模型让它学会什么样的回答是人类喜欢的。强化学习的一种常用方法是基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)。其基本流程是让数据标注员给AI生成的多个答案排序将好的排在前面差的排在后面根据这些排序训练一个奖励模型(Reward Model, RM)使用奖励模型对大模型生成的内容进行评分大模型根据奖励模型的反馈不断调整自己的参数。通过这种方式大模型能够逐渐学会生成更符合人类偏好的回答。这就像是社交媒体上的内容创作者通过观察哪些内容获得更多点赞和分享来调整自己的创作方向。GRPO群体相对策略优化DeepSeek 等模型采用了一种叫群体相对策略优化Group Relative Policy OptimizationGRPO 的强化学习方法。其基本思路是GRPO 的工作原理给定一个问题让 AI 生成多个不同的解决方案筛选出正确的解决方案丢弃错误的让 AI 模仿正确的解决方案继续生成反复训练提高 AI 输出正确答案的能力。生活中的类比这就像是一个学生在解题时尝试多种不同的方法然后老师指出哪些方法是正确的哪些是错误的。学生通过模仿正确的方法逐渐掌握解题技巧甚至可能发现一些老师都没想到的解法。这种方法特别适合有明确正确答案的问题如数学题、编程问题等。通过这种方式AI有时能够涌现出一些在人工数据集之外、连人类自己都未曾设想过的解决方案达成超越人类的效果。举一个后训练的例子DeepSeek-R1 的强大推理能力展示详尽的思维链Chain of ThoughtCoT就是通过在监督微调阶段特意准备了 60 万条推理数据然后通过 GRPO 流程引导大模型自己筛选有效思路而实现的。五、大模型的部署与优化1、 蒸馏模型蒸馏模型就像是大师的学生通过学习大师大模型的行为和输出来模仿大师的能力但自身规模更小更容易部署。由于完整版大模型对硬件要求极高普通个人电脑难以运行因此出现了蒸馏模型的概念。蒸馏模型可以理解为高仿版大模型。例如一些开发者会使用参数较小的模型如阿里的千问 32B去学习满血版大模型如 DeepSeek 的 671B的输出然后据此调整参数做出一个高仿版本。这就像是一个年轻的音乐家通过反复聆听和模仿大师的演奏逐渐掌握大师的技巧和风格虽然可能无法完全达到大师的水平但已经能够呈现出相似的表现。2、 量化模型量化模型就像是对高清图片进行压缩虽然会损失一些细节但大大减小了文件体积使其能够在普通设备上显示。除了蒸馏模型外还有量化模型即原版大模型的压缩版。量化是将大模型中精度极高的参数通常是 FP16 或 FP32 浮点数转化为精度较低的参数如 INT8 或 INT4 整数从而降低模型的体积和性能要求。许多个人电脑上部署的大模型都是这些压缩或高仿版的模型。如果把原始大模型比作一张 4K 超高清图片那么量化模型就像是将其压缩为 1080P 或 720P 的版本虽然损失了一些细节但大大减小了文件体积使其能够在普通设备上显示。六、总结本文介绍了大模型相关的基本概念、运作流程和训练流程。从 token、transformer 架构、自注意力机制到预训练、监督微调和强化学习我们尝试用通俗易懂的语言和比喻解释了这些 AI 术语和概念。希望这份速通指南能够帮助大家查漏补缺理解那些充斥在 AI 新闻和技术文章中的「黑话」让你在面对铺天盖地的 AI 信息时不再感到困惑能够更加从容地理解和参与这场 AI 革命。术语表为方便查阅以下是本文提到的主要 AI 术语及其简要解释术语解释类比大语言模型LLM能够理解和生成人类语言的 AI 系统人工打造的超级大脑提示词Prompt用户输入给大模型的内容给 AI 的问题或指令Token大模型理解内容的最小单元语言的乐高积木Transformer目前主流大模型采用的架构大模型的大脑结构自注意力机制Transformer 的核心机制能捕捉上下文关联阅读时的超级记忆力检索增强生成RAG通过检索外部知识来增强生成内容的技术给 AI 配备的外部记忆库Scaling Law模型参数越多表现越好的规律“大力出奇迹”稠密模型每次计算都调动所有参数的模型面对所有问题都全力以赴稀疏模型只激活部分参数的模型根据问题难度按需调动混合专家模型MoE种流行的稀疏模型架构由专家团队组成的智囊团预训练让模型学习基础知识和语言规律的阶段婴幼儿期的大量阅读和学习基座模型预训练后得到的通用模型博学多才但不专业的学者监督微调SFT通过标注数据调整模型行为的过程针对特定职业的专业培训强化学习RL让模型学习更符合人类偏好的技术大模型的社会化训练奖励模型评估 AI 输出质量的模型AI 世界的评委拒绝采样优化RLPO一种强化学习方法尝试多种方法并保留正确的思维链CoTAI 展示推理过程的能力解题步骤的展示蒸馏模型模仿大模型行为的小模型“大师的学生”量化模型通过降低参数精度压缩的模型压缩后的高清图片如何学习AI大模型作为一名热心肠的互联网老兵我决定把宝贵的AI知识分享给大家。 至于能学习到多少就看你的学习毅力和能力了 。我已将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。四、AI大模型商业化落地方案作为普通人入局大模型时代需要持续学习和实践不断提高自己的技能和认知水平同时也需要有责任感和伦理意识为人工智能的健康发展贡献力量。