FEATURED · 精选文章

【收藏必备】从零开始学大模型:LLM核心概念与实现详解

发布时间 / 2026/9/10 19:24:31
来源 / 创域科博编辑部
栏目 / 资讯中心
【收藏必备】从零开始学大模型:LLM核心概念与实现详解 基础概念/名词LLM是啥他是一种基于大规模参数和大规模语料训练得到的语言建模系统它通过对 token 序列进行条件概率建模来理解、续写或生成文本 通常采用Transformer架构LLM训练全景图预训练阶段是 LLM 训练的第一阶段目标是让模型学习语言的基本规律和世界知识。这个阶段使用海量的文本数据(通常是数 TB 级别)通过自监督学习的方式训练模型。最常见的预训练任务是因果语言建模(Causal Language Modeling)也称为下一个词预测(Next Token Prediction) 预训练阶段的特点是数据量巨大、计算成本高、学到的是通用的语言理解和生成能力、采用无监督学习后训练阶段则是要解决预训练模型的不足。预训练后的模型虽然具备了强大的语言能力但它只是一个预测下一个词的模型并不知道如何遵循人类的指令、生成有帮助无害诚实的回答、拒绝不当的请求以及以对话的方式与人交互。后训练阶段就是要解决这些问题让模型对齐人类的偏好和价值观大概的生成流程用户输入构成 prompt并与历史对话共同形成 context。文本经过 tokenization 转为 token 序列再通过 embedding 与位置信息编码成向量表示送入多层 Transformer。模型通过 masked self-attention、MLP、残差连接和层归一化逐层计算 hidden states最终输出词表上的 logits经 softmax 得到下一 token 的概率分布再通过 decoding 策略选出实际 token。该 token 被追加回上下文模型以自回归方式重复这一过程直到输出 EOS 或达到长度限制Prompt送给模型的输入文本 Contex当前可参考的全部前文 Tokenization把文本切成 token Token模型处理的最小离散文本单位 Vocabulary所有可识别 token 的集合每个token对应哪个ID Embedding把 token 变成向量 Positional Encoding告诉模型顺序位置信息 Transformer核心计算架构 Self-Attention决定该关注上下文哪里 Logits对下一个 token 的原始打分 Softmax把打分变成概率 Decoding从概率里选出实际输出文本生成从前面的学习我们可以知道现代大语言模型的基础是 2017 年由 Google 提出的 Transformer 架构。这一架构从根本上改变了自然语言处理的方式使得模型能够高效地处理长序列文本。Transformer 的核心创新是自注意力机制Self-Attention它允许模型在处理每个词元时同时“关注”序列中的所有其他词元从而捕捉长距离的语义依赖关系有些地方我认为不是很恰当比如说加规范化我觉得翻译成残差归一化好一点现在的大语言模型大多采用自回归Autoregressive方式生成文本即 逐个预测下一个 Token每次预测都基于之前所有的 Token 简言之模型将生成整个序列的概率分解为每个 Token 出现的概率条件是之前所有 Token 都已知。这意味着模型需要“记住”之前的所有内容才能正确预测下一个 Token序列越长需要维护的“记忆”就越多这种记忆就体现在上下文窗口中transformer首先就是 inputs这里的输入信息是通过Vocabulary把token转成ID然后通过 Input Embedding 模块把他映射成一个高维向量然后加上 Positional Encoding 给他位置编码的信息然后传入多头注意力层进行处理对结果 残差归一化然后 前馈网络 再次 残差归一化位子编码嵌入层词向量就是把一个单词映射成很多个维度这些维度就是这个单词在计算机中的“词义”位置编码就是这个单词在这个句子中的位置然后位置编码把位置信息也映射为向量这两个相加的结果就包含了两个信息一个就是多维度的“词义”另外一个就是这个单词在这个句子中的位置多头注意力每个词的最终向量词义位置被同时送到“多头注意力”模块在内部每个词会生成三个向量Query查询我想找什么 Key键我代表什么别人会不会找我 Value值如果别人找到我我能提供什么信息这三个向量都是从原始输入向量通过线性变换得来的简单说就是乘个矩阵计算注意力分数每个词的 Query 会跟所有词的 Key 做点积类似“匹配度”得到一个分数矩阵比如“我”对“喜欢”的关注度是 0.8“我”对“猫”的关注度是 0.3然后用 softmax 归一化变成概率分布加权求和 Value根据上面的分数对所有词的 Value 做加权平均比如“我”这个词最终输出 0.8 × “喜欢”的Value 0.3 × “猫”的Value 0.1 × “我”的Value…多头并行上面的过程不是只做一次而是并行做8次、12次甚至更多次这就是“多头”每个头可能关注不同的关系最后把所有头的结果拼起来或加权平均得到最终输出当然这里“乘个矩阵” 中这个矩阵可以算是随机的当然他肯定有一系列算法让这个“随机”高质量然后就还是那一套正反传递残差梯度回归让这个矩阵变成我们需要的样子前馈网络所以逐位前馈可以理解为对单个单词进行放缩就是对单个次的词向量升维用更多的激活函数非线性变换让他的特征提取增强然后再全连接回到初始维度可以理解为是一个对于单词特征的“数据增强”然后就是output的部分他这里是用了一个掩蔽多头注意力Masked Multi-Head Attention他有一个掩码矩阵causal mask,它的作用只有一个让当前位置只能看自己和前面的 token不能看后面的 token标准 attention 先算这个分数矩阵Q 是 query K 是 key S 是每个位置对其他位置的原始注意力打分然后会把 mask 加进去这里的 Mask 往往不是上面那个 矩阵直接用而是可见位置加 0不可见位置加 −∞ 或非常大的负数比如长度 4 时可以写成这样做softmax的时候他的权重就成0了这里 Q 来自 decoder 当前隐藏状态而 K、V 来自 encoder 输出attention 的逻辑是Q 表示当前查询需求K 表示被查询对象的索引标签V 表示被查询对象携带的内容也就是说 decoder 问问题encoder 提供答案线索Linear——全连接层把“语义表示空间”映射到“词表候选空间” 然后再一个softmax搞成概率分布Prompt是什么在真实系统里模型看到的往往不止用户那一条输入而是类似这样一整段东西系统规则 历史对话 你当前这一句 可能还有工具返回结果 输出格式要求这些拼在一起才是模型真正接收到的完整 prompt。也就是说Prompt 当前生成时送进模型的完整上下文表达Contest是什么模型当前生成时可见、可用的上下文信息 很多时候prompt 会成为 context 的一部分他更相当于是模型的当前信息环境token是什么Token是大语言模型处理文本的基本单位。模型不直接处理字符或单词而是将文本先转换为 Token 序列再进行处理┌────────────────────────────────────────────────┐ │ 1. 原始文本 │ Hello, Im Qwen3.5! │ ↓ │ 2. 预分词Pre-tokenization │ 按规则初步切分[Hello, ,, I, m, ...] │ ↓ │ 3. 应用分词算法如 BPE │ 合并高频片段Hello → [Hello], Im → [I, m] │ ↓ │ 4. 查词汇表 → Token IDs │ [15496, 11, 314, 716, 2872, 13, 128002] │ ↓ │ 5. 输入模型Embedding Transformer └────────────────────────────────────────────────┘预分词就是按照常见规则来分开应用分词算法就是 统计训练语料中相邻符号对的频率 把最高频的符号对合并成一个新token加入词表可以理解为根据统计相关性找附近词某些词的组合比如each和other分词后就把each other作为一个新token加入词表Embedding 是什么虽然通过Vocabulary把token转成ID了但是还是不能直接输入到模型他会把 每个 token ID 会被映射成一个高维向量比如几千维的一串浮点数 这个才是模型内部可以计算的东西微调权重是什么大模型本质上是一个巨大的数学函数里面有海量参数。这些参数就叫weights权重微调就是在一个已经训练好的基础模型上再拿特定数据继续训练一段让它更适应某个任务或风格蒸馏是什么蒸馏就是让一个小模型学一个大模型的本事。更准确一点说叫知识蒸馏也就是说是用强模型生成大量高质量回答再拿这些回答去训练小模型小模型学会更像强模型那样回答问题量化是什么量化就是把模型里的数字用更省空间的方式来存和算。大模型的权重本来通常是高精度数字比如FP3232 位浮点数 FP16 / BF1616 位浮点数而“量化”会把它们改成更低精度的表示比如INT8 INT4甚至更低这样做的目的很直接省显存、省内存、跑得更快、部署更容易剪枝是什么把模型里不太重要的部分删掉比如说是权重剪枝神经元 / 通道剪枝注意力头剪枝RAG是什么全称是Retrieval-Augmented Generation中文常叫检索增强生成拆开看Retrieval 检索Augmented 增强Generation 生成意思就是先从外部资料里找相关内容再把这些内容喂给大模型让它基于这些资料生成答案大体的流程程主要分为两大核心环节。在数据准备阶段系统通过数据提取、文本分割和向量化将外部知识构建成一个可检索的数据库。随后在应用阶段系统会响应用户的提问从数据库中检索相关信息将其注入Prompt并最终驱动大语言模型生成答案MCP是什么众所周知到了现在的多agent时代我们的模型需要大量调用各种工具不而管是数据库、浏览器、Google Drive、Figma还是API只要都按 MCP 这套标准暴露出来agent 就能用比较统一的方式去连、去读、去调用官方也是这么定义的MCP 是一个开放协议/开放规范用来把大模型客户端连接到外部工具和资源 实际上就是一个接口涌现是什么指的是模型在规模参数量、训练数据量、计算量扩大到一定阈值后突然出现一些在较小模型中几乎不存在或性能接近随机水平的新能力。这些能力无法通过简单线性外推小模型的表现来预测呈现出“量变引发质变”的特点。Workflow是什么workflow即为工作流 是一种传统的自动化范式其核心是对一系列任务或步骤进行预先定义的、结构化的编排。它本质上是一个精确的、静态的流程图规定了在何种条件下、以何种顺序执行哪些操作agent是什么基于大型语言模型的智能体是一个具备自主性的、以目标为导向的系统。它不仅仅是执行预设指令而是能够在一定程度上理解环境、进行推理、制定计划并动态地采取行动以达成最终目标。LLM 在其中扮演着“大脑”的角色最后唠两句为什么AI大模型成为越来越多程序员转行就业、升职加薪的首选很简单这些岗位缺人且高薪智联招聘的最新数据给出了最直观的印证2025年2月AI领域求职人数同比增幅突破200% 远超其他行业平均水平整个人工智能行业的求职增速达到33.4%位居各行业榜首其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张也让人才供需矛盾愈发突出。麦肯锡报告明确预测到2030年中国AI专业人才需求将达600万人人才缺口可能高达400万人这一缺口不仅存在于核心技术领域更蔓延至产业应用的各个环节。那0基础普通人如何学习大模型 深耕科技一线十二载亲历技术浪潮变迁。我见证那些率先拥抱AI的同行如何建立起效率与薪资的代际优势。如今我将积累的大模型面试真题、独家资料、技术报告与实战路线系统整理分享于此为你扫清学习困惑共赴AI时代新程。我整理出这套 AI 大模型突围资料包【允许白嫖】✅从入门到精通的全套视频教程✅AI大模型学习路线图0基础到项目实战仅需90天✅大模型书籍与技术文档PDF✅各大厂大模型面试题目详解✅640套AI大模型报告合集✅大模型入门实战训练这份完整版的大模型 AI 学习和面试资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】①从入门到精通的全套视频教程包含提示词工程、RAG、Agent等技术点② AI大模型学习路线图0基础到项目实战仅需90天全过程AI大模型学习路线③学习电子书籍和技术文档市面上的大模型书籍确实太多了这些是我精选出来的④各大厂大模型面试题目详解⑤640套AI大模型报告合集⑥大模型入门实战训练如果说你是以下人群中的其中一类都可以来智泊AI学习人工智能找到高薪工作一次小小的“投资”换来的是终身受益应届毕业生‌无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型‌非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界‌。业务赋能 ‌突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型‌。获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】本文转载如有侵权请联系删除。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻