当前位置: 首页 > news >正文

01-大模型核心概念

18个AI核心术语扫盲(一):从LLM到Transformer,地基篇

约 3,200 字 | 预计阅读 12 分钟 | 系列第 1/5 篇


做了5年后端的小陈,上周面试一家AI公司。面试官问:「Context Window 是什么?」他愣了一下:「跟浏览器窗口有关系吗?」

面试官笑了笑,在笔记上写了点什么。小陈知道,这个岗位没了。

这不是个例。过去一年我参与了40多场AI岗位面试——90%的候选人能调API,但不到30%能说清 LLM、Token、Embedding 这三个词之间的关系。概念不清的代价不是面试失败,而是你永远在调参,却不知道自己在调什么。

读这篇文章你会得到:

  • LLM 不是「会聊天的AI」——它是一个概率预测系统。理解这一点,一切都不一样了
  • Token ≠ 单词,Embedding ≠ 坐标,Context Window ≠ 窗口——但它们确实是理解 AI 的三把钥匙
  • 掌握这18个核心概念,你就拿到了阅读任何 AI 论文和架构图的入场券

目录

  1. AI → ML → DL → LLM:一张图看清四层关系
  2. Transformer 与 Attention:大模型的「发动机」
  3. Token、Embedding、Vector:语言如何变成数学
  4. Context Window 与 Prompt:模型的「视野」与「问题」
  5. Temperature、Top-p、Top-k:控制模型「创造力」的三个旋钮
  6. Hallucination:大模型的「说谎」问题
  7. 术语速查表
  8. FAQ
  9. 结语

1. AI → ML → DL → LLM:一张图看清四层关系 {#1}

AI(Artificial Intelligence,人工智能)是最大的圆圈。1956年达特茅斯会议上,John McCarthy 提出这个概念,指的是一切「让机器表现出智能行为」的技术。下棋程序是 AI,自动驾驶是 AI,你手机上的美颜滤镜也是 AI。

ML(Machine Learning,机器学习)是 AI 的子集。它的核心思想一句话:不给机器写规则,让机器从数据中学规则。传统编程是「输入 + 规则 → 输出」,机器学习是「输入 + 输出 → 规则」。这场翻转发生在1980年代,但真正爆发是2010年以后——因为数据够了,算力够了。

DL(Deep Learning,深度学习)是 ML 的子集。它用多层神经网络(所以叫「深度」)来学习数据的层次化表征。2012年,AlexNet 在 ImageNet 图像识别大赛上把错误率从 26% 砸到 15%——从那天起,深度学习不再是学术界的小众玩具。

LLM(Large Language Model,大语言模型)是 DL 的一个分支,但它大到了改变游戏规则的地步。2017年 Transformer 架构出现,2018年 GPT-1 和 BERT 证明了「先海量预训练、再针对任务微调」这条路可行。然后 OpenAI 一路把参数从 1.17 亿(GPT-1)堆到了万亿级别(GPT-4)。

LLM 不是更聪明的聊天机器人——它是人类第一次造出了能对语言本身建模的系统。区别在于:前者背答案,后者理解问题。

关键区分:NLP(Natural Language Processing,自然语言处理)是领域(让计算机处理自然语言),LLM 是实现这个领域的一种具体方法。在 Transformer 之前,NLP 用的是 RNN、LSTM 这些「串行」架构——每个词必须等前一个词处理完才能轮到它,又慢又容易忘。LLM 用 Transformer 替换了这套架构,做到了并行处理 + 长距离依赖。

术语英文全称中文一句话定义
AIArtificial Intelligence人工智能让机器表现智能的统称
MLMachine Learning机器学习从数据中学习规律,而非写死规则
DLDeep Learning深度学习用深层神经网络学习层次化特征
NLPNatural Language Processing自然语言处理让计算机理解、生成人类语言
LLMLarge Language Model大语言模型海量参数 + 海量文本训练的超大语言模型

2. Transformer 与 Attention:大模型的「发动机」 {#2}

Transformer这个名字你每天见,但它到底是什么?

2017年,Google 的8位研究员发表了论文《Attention Is All You Need》。这篇论文提出了一种全新的神经网络架构,完全抛弃了 RNN/LSTM,只用一种叫「注意力」的机制处理序列数据。这篇论文现在的被引次数超过10万次——它改变了世界。

为什么出现?RNN 有两个致命缺陷:第一,每个词必须等前一个词处理完——无法并行,训练极慢;第二,序列越长,前面的信息衰减越严重(即「长距离依赖」问题)。Transformer 同时解决了这两个问题。

Attention(注意力机制)解决的核心问题是:当模型读一句话时,它应该「关注」哪些词?

比如 「The cat sat on the mat because it was tired」——这里的 「it」 指什么?人类一看就知道是 「cat」。但 RNN 按顺序读到 「it」 时,「cat」 已经过去5个词了——信息已大量丢失。Attention 让模型处理每个词时,可以同时「看」句子里的所有其他词,并给每个词分配「注意力权重」。「cat」 的权重最高,所以 「it」 的语义与 「cat」 绑定。

Self-Attention(自注意力)更进一步:每个词和句子里的所有词(包括自己)做一次注意力计算。结果是——同一个单词 「bank」,在 「river bank」 和 「bank account」 里会得到完全不同的向量表示。

Multi-Head Attention(多头注意力):不是做一次注意力,而是同时做很多次(8次、16次甚至更多),每次关注不同模式——一个头关注语法结构,一个头关注语义关系,一个头关注位置信息。最后把结果拼起来。

面试官老张面了40多人,发现一个规律:能说清「为什么 Multi-Head Attention 是多个头而不是一个大头」的候选人,薪资都在50万以上。因为这说明他真正理解了一个关键原理——单一视角永远不够。AI 和人类一样,需要从多个角度同时看问题。

Parameters(参数)是模型在训练中学到的「知识」——每个参数是一个可调整的数字权重。GPT-3 有 1750 亿个参数;GPT-4 传闻达到 1.76 万亿。参数越多,模型能捕捉的模式越复杂——但也更贵、更慢。

Parameters vs Tokens:参数是模型的「脑容量」(训练时学习),Token 是模型的「阅读量」(使用时处理)。一个固定不变,一个每句话都在变。


3. Token、Embedding、Vector:语言如何变成数学 {#3}

这是 AI 扫盲中最关键的一节。如果你只能记住三个概念,记这三个。

Token(词元)是模型「读」文本的基本单位。你输入「我喜欢 AI」——模型看到的不是这四个汉字,而是一串数字,比如[1234, 5678, 9012]。把文本切成 Token 的过程叫Tokenization(分词)

为什么出现?计算机只认识数字。Tokenization 是「语言 → 数字」的第一道翻译。

Token ≠ 单词。一个英文长单词可能被切成多个 Token:「unbelievable」→un+believe+able→ 3个 Token。中文里,一个汉字通常是 1-2 个 Token。你调用 GPT-4 API 时,计费单位是 Token 不是字数——同样的意思,中英文消耗的 Token 量能差一倍。

Embedding(嵌入)是把 Token 变成高维空间中的一个「位置」。每个 Token 被映射成一个 Vector(向量)——比如一个 768 维的数字列表:[0.23, -0.45, 0.89, ..., -0.12]

为什么出现?Token ID(1234, 5678)只是标签,不包含语义信息。「猫」和「狗」的 Token ID 可能差很远,但它们的语义很接近。Embedding 解决了这个问题——让 Token 的「距离」等于语义的「距离」。

Embedding vs Vector:Embedding 是一种特殊的 Vector——它是通过训练「学」出来的语义向量,不是人工构造的。所有 Embedding 都是 Vector,但不是所有 Vector 都是 Embedding。

经典例子:King − Man + Woman ≈ Queen。这不是比喻,是真的可以算出来——把「King」的向量减去「Man」的向量、加上「Woman」的向量,得到的向量与「Queen」的向量距离极近。Embedding 让「语义」变成了可以加减乘除的东西。

Embedding 是 AI 世界最优雅的发明——它让「意思」变成了可以计算的东西。从此,语言变成数学,语义变成几何。


4. Context Window 与 Prompt:模型的「视野」与「问题」 {#4}

Context Window(上下文窗口)是模型一次能「看到」的最大文本量。GPT-4 Turbo 是 128K Token——约等于一本 200 页的书。Claude 3 能到 200K。Gemini 1.5 Pro 标称 100万 Token。

为什么出现?早期的 LSTM 模型只能记住几十个词。Transformer 理论上可以处理无限长——但因为 Attention 的计算量随长度平方级增长,实际上不可行。Context Window 是「理论能力 × 计算成本」的折中。

回到小陈的面试翻车现场——Context Window 和浏览器窗口毫无关系。它更像是模型的「工作记忆」:一次对话中,模型能记住的最多信息。超过上限,最前面的内容就会被遗忘。

Context Window vs Attention 的关系:Context Window 是「范围」——我能看多远;Attention 是「在这个范围内我关注什么」——我能看清什么。两者共同决定了模型的理解能力。

为什么它越大越好?你可以把整份文档、整个代码库、整本书扔进去。Context Window 每扩大 10 倍,能解决的任务类型就多一个数量级。

Prompt(提示词)是你发给模型的那段话。但有个反直觉的事实:Prompt 不是「指令」,它是「上下文前缀」。LLM 的本质是「给定前缀,预测下一个 Token」——它不是在执行你的命令,而是在「续写」你的话。理解了这一点,你就能理解为什么措辞方式能剧烈影响输出质量。

Pre-training(预训练)是 LLM 学习的第一阶段。模型被喂入海量文本(几万亿 Token),任务很简单——「猜下一个词是什么?」。通过无数次做这个练习,模型学会了语法、事实知识和推理模式。这个阶段最贵:GPT-4 级别的预训练要花几千万到上亿美元。


5. Temperature、Top-p、Top-k:控制模型「创造力」的三个旋钮 {#5}

这三个参数决定了输出是「保守务实」还是「天马行空」。

Temperature(温度)控制概率分布的「平滑程度」。T=0 时,模型每次都选概率最高的词——确定但无聊。T=1 时,按原始概率采样。T>1 时,低概率词被放大——模型开始胡说,但也可能产生惊喜。

为什么叫「温度」?来自物理学的玻尔兹曼分布——温度越高,粒子越活跃,越不可预测。这里的概率分布也一样。

Top-k 采样:只从概率最高的 k 个候选词中选。k=50 时,模型只看前 50 个候选词,过滤掉明显的垃圾。

Top-p(Nucleus Sampling,核采样):只从「累积概率达到 p」的最小候选集里选。p=0.9 时,模型从「概率加起来刚好超过 90% 的那几个词」里选。

Top-k vs Top-p 的关键区别:Top-k 的候选数是固定的——不论上下文确定还是模糊,都是 k 个。Top-p 更聪明——在确定性高的上下文中自动缩小候选范围;在需要创造力时自动放大。实际使用中,通常是Temperature + Top-p组合:Temperature 控制「混乱程度」,Top-p 控制「候选范围」。

参数作用调高意味着调低意味着
Temperature控制随机性更创造性 / 更不可控更确定 / 更机械
Top-p控制候选范围更多样的词可选只选最安全的词
Top-k固定候选数量(不常用)(不常用)

6. Hallucination:大模型的「说谎」问题 {#6}

Hallucination(幻觉)是 LLM 最大的未解决问题——模型生成的内容看着合理,但实际上是编造的。

为什么出现?回到第一性原理——LLM 不是数据库,它是一个概率预测系统。它每生成一个 Token,只是在说「根据我见过的所有文本,下一个最可能的词是什么」。它没有「真相」的概念,只有「最可能被说的内容」。

Hallucination 和 Creativity 是同一枚硬币的两面。Temperature 越高,模型越有「创造性」——也越可能产生幻觉。压低 Temperature 可以减少幻觉,但输出会变得机械无聊。

一位律师用 ChatGPT 准备了一份法律文件,引用了 6 个判例——听起来专业、权威。法官看了一眼,发现 6 个判例全是编造的。律师被罚款 5000 美元。这个故事说明:LLM 的输出永远需要人类验证。把模型当搜索引擎用,是目前最危险的 AI 使用方式。

目前行业在用什么策略对抗幻觉?

  • RAG(下篇详讲):先检索真实文档,再让模型基于文档回答
  • Grounding:强制模型引用来源
  • Chain-of-Verification:让模型生成后自己再检查一遍

但真相是:截至 2025 年,没有任何方法能完全消除幻觉。这不是 bug,这是 LLM 工作方式的固有属性。清醒的认知是——把 LLM 当「草稿生成器」而非「事实数据库」。


7. 术语速查表 {#7}

缩写英文全称中文本质一句话
AIArtificial Intelligence人工智能机器表现智能的总称
MLMachine Learning机器学习从数据中学,而非写死规则
DLDeep Learning深度学习用深层神经网络学层次化特征
NLPNatural Language Processing自然语言处理让计算机理解人类语言
LLMLarge Language Model大语言模型海量参数的概率型语言预测系统
Transformer(架构名)基于 Attention 的并行序列处理架构
Attention注意力机制动态关注序列中相关位置的机制
Token词元模型处理文本的最小单位
Embedding嵌入Token 在高维空间的语义向量表示
Context Window上下文窗口模型单次能「看到」的最大 Token 数
Parameters参数模型训练中学会的可调权重
Prompt提示词发给模型作为生成前缀的输入文本
Hallucination幻觉模型生成看似合理但虚构的内容
Temperature温度控制输出概率分布平滑程度的参数
Top-p核采样按累积概率动态截断候选词
Pre-training预训练在海量语料上学习通用语言能力
Foundation Model基础模型大规模预训练后可供下游任务微调的通用模型

8. FAQ {#8}

LLM 和 ChatGPT 是什么关系?

ChatGPT 是产品,LLM 是技术。ChatGPT 底层用了 GPT-4/GPT-4o 这些 LLM,但 LLM 不止是 ChatGPT——Claude 是 LLM,Gemini 是 LLM,开源的 Llama 也是 LLM。把 LLM 想象成「发动机」,ChatGPT 是「装了这台发动机的一辆车」。

Token 和单词/汉字有什么区别?

一个单词可能被切成多个 Token。「unbelievable」→ 3 个 Token,「ChatGPT」→ 2 个 Token。中文里一个汉字通常是 1-2 个 Token。API 计费按 Token 算,不是按字数——同样语义,中文和英文的 Token 消耗可能差一倍。

Embedding 和 Vector 是一回事吗?

Embedding 是特殊的 Vector。所有 Embedding 都是高维向量,但不是所有向量都是 Embedding。Embedding 的核心特点是——它是模型从海量文本中「学」出来的语义表征,而不是人工设计的。

Context Window 是不是越大越好?

理论上是的,但有两个代价:① 响应更慢、费用更高;② 模型对长文本中间部分的注意力会衰减(「Lost in the Middle」问题)。128K 对大多数场景够用了——除非你经常需要处理整本书或整个代码库。

Hallucination 能彻底解决吗?

目前不能。RAG、Grounding 等方法可以大幅减少幻觉,但做不到 100% 消除。根本原因在于——LLM 的本质是「预测最可能的文本」,不是「查证真实的事实」。把 LLM 当草稿生成器是正确用法;当搜索引擎是危险用法。

参数越多,模型就越聪明吗?

不一定。Chinchilla 定律指出:在固定算力预算下,模型大小和训练数据量有一个最优比例。很多大模型其实是「欠训练」的——参数很多,数据没喂够。行业趋势正在从「堆参数」转向「小模型 × 高质量数据 × 更长训练」。


9. 结语 {#9}

三个月后,小陈重新出现在了我的面试间。这一次,他不仅知道 Context Window 是什么,还能讲清楚它和 Attention 机制的关系、为什么长文本中间注意力会衰减、以及不同模型处理超长文本的策略差异。

他拿到了 Offer。年薪涨了 60%。

概念不是用来背的——它是用来让你看清底层逻辑的。当你能把 LLM 还原成一个概率预测系统、把 Embedding 还原成空间中的向量运算、把 Hallucination 还原成「概率高 ≠ 真实」时,你就不是在「使用 AI」了——你是在「理解 AI」。

而这就是这两种人之间最本质的区别。


📬 下一篇预告:《AI 术语扫盲(二):Prompt Engineering、RAG、Few-shot、CoT——用好 LLM 的 6 个核心概念》

你在面试或工作中,被问到的最让你懵的 AI 概念是什么?评论区见。

http://www.jsqmd.com/news/1317356/

相关文章:

  • ChatGPT充值后Codex写的代码能运行却不稳定?用测试矩阵补齐边界场景
  • 2026盘点:商河县俱鑫嘉橱柜加工厂欧式衣柜凭什么好评如潮? - 装修教育财税推荐2026
  • 2026 年至今,龙游热门的新中式家装设计工厂选哪家,别再只贴雕花!这样的家装,让老房秒变高级雅宅,90后屋主都夸它藏住了古韵与新意 - 企业推荐官【认证】
  • STM32小白视角笔记(标准库)(乱序版)
  • 花了小半个月吃遍周边,2026年找到食材盲点不踩雷的火锅
  • 2026年近期沈阳信誉好的极简门厂家——亿佳门业以意式精工与全链自产赢得市场信赖 - 装修教育财税推荐2026
  • 暗黑破坏神2存档修改器Diablo Edit2:5分钟掌握角色编辑的终极利器
  • 智能车电磁导航传感器设计:从LC谐振电路到位置解算实战
  • 2026 年现阶段,北海比较好的卤煮漂烫线供应厂家哪家专业,你还在卤煮加工时耗时长、品相差?这台设备竟能帮你解决所有痛点 - 企业推荐管【认证】
  • MPC Video Renderer终极指南:RTX HDR加持的专业级视频渲染器
  • 2026.8.2总结(目标)
  • 解决Codex启动错误:端口访问权限问题(OS Error 10013)
  • 2026年港澳通行证照片怎么拍?手机App、小程序与在线工具实操全攻略 - 提词匠
  • 2026天津工伤维权路径全拆解:从认定、鉴定到赔偿到位的律师选择参考 - 本地品牌推荐
  • Pinpoint全链路监控:从分布式追踪原理到生产环境部署实战
  • 动漫资源管理与播放优化全攻略
  • AI技术写作实战指南:从代码生成到文档撰写的效率提升
  • 【机器学习】DBSCAN聚类算法——原理、参数调优与实战
  • 2026 年现阶段,皮山靠谱的风管机安装施工公司联系方式,花3000装它,却让全屋电费涨了两倍?多数人踩的坑你得避开-博力久能暖通 - 实业推荐官【官方】
  • 别再暴力切分了!大模型 RAG 中跨页大表格的智能语义切分方案
  • MateClaw 2.0 正式发布:从“一个能干活的人”到“一支能协作的队伍”
  • 电赛电源驱动电路设计:从晶体管到H桥的实战指南
  • 工业制动电阻选型全攻略:从原理到实战,避免过压烧毁
  • 2026 年 7 月新发布:南沙群岛知名的观赏波兰鸡厂商找哪家,你见过把“天鹅颈”安在鸡身上的小家伙吗?看它时千万别眨眼 - 行业严选官
  • 道德经道影书斋注释版 044
  • 从马里奥银币项目学习2D平台游戏开发:核心机制与Godot实践
  • 2026赤峰经济纠纷处理实务:民间借贷与合同欠款的证据要点与维权路径 - 本地品牌推荐
  • 多平台投稿发布系统
  • MyBatis-Plus saveBatch异步事务问题分析与解决方案
  • SpringBoot+Vue物流系统开发实战与优化经验