大模型名词精讲 01:LLM
朋友聚会,大家聊得热火朝天 ——"现在大模型太牛了,我用它写 PPT 五分钟搞定!"" 你说的是哪个 LLM?GPT 还是 Claude?""害,那都是 Decoder-only 架构的,现在 MoE 才是主流……" 你在旁边微笑点头,心里却在想:LLM 是啥?Decoder 是啥?MoE 又是啥玩意儿?
别慌,你不是一个人。大模型这两年发展太快,各种名词像雨后春笋一样往外冒,别说新手了,很多从业者都不一定能说清楚每个词到底啥意思。所以我开了这个「大模型名词精讲」系列,每次只讲透一个名词,用最通俗的话,让你看完就能跟人 "对答如流"。
今天第一篇,咱们就从最基础、最常听到的LLM说起。看完这篇,你将收获:一句话跟人解释清楚什么是 LLM,知道 LLM 的 "大" 到底大在哪,理解 LLM 工作的核心原理(不需要数学基础),以及避开关于 LLM 的 3 个常见误区。
一、一句话理解 LLM
LLM,全称Large Language Model,中文叫大语言模型。说人话就是:一个读了海量文字、学会了人类语言规律的 "超级学霸",你给它一段文字,它能接着往下写。
ChatGPT、Claude、DeepSeek、通义千问…… 你听过的这些 "AI 聊天机器人",本质上都是 LLM。
打个比方:有个人,从小就开始读书,从小学课本到小说、从百科全书到代码文档、从新闻评论到知乎回答…… 把互联网上几乎所有的文字都读了一遍。读了这么多书之后,他练就了一项超能力:你给他说半句话,他能非常自然地接下半句。你说 "今天天气真",他接 "好";你说 "写一首关于春天的诗",他接 "好的,这是一首关于春天的诗……";你说 "用 Python 写个快速排序",他接 "好的,以下是 Python 实现的快速排序代码……"。这个人,就是 LLM。
二、LLM 的 "大",到底大在哪?
你可能会问:不就是个 "接话" 的模型吗?为什么叫 "大" 模型?以前的 AI 不也能聊天吗?问得好。LLM 的 "大",主要体现在三个方面。
1. 参数大 —— 模型的 "脑容量"
参数(Parameter),你可以理解为模型的 "脑细胞"。参数越多,模型能记住的东西越多,能学的规律越复杂。早期的 AI 模型只有几百万、几千万参数,现在的 LLM 动辄几十亿、几百亿、甚至上万亿参数。
举几个 2026 年的例子感受一下:Llama 3 8B 有 80 亿参数,属于入门级,手机都能跑;GPT-4o 有几千亿参数,属于旗舰级,需要集群才能跑;DeepSeek V3.2 有 6710 亿参数(MoE 架构),是国产第一梯队;传闻中的 GPT-5 Ultra 有 10 万亿参数,大概是人类大脑神经元的十分之一。
不过要注意,参数不是越多越好。参数越多,需要的训练数据和算力也越多,成本呈指数级上涨。现在大家都在研究 "用更少参数达到更好效果"。
2. 数据大 —— 模型的 "阅读量"
光有 "脑细胞" 还不够,还得有东西学。LLM 的训练数据量有多夸张?GPT-3 约 5000 亿个 Token(大概几千亿字),Llama 3.1 405B 约 15 万亿个 Token,Llama 4 Scout 约 40 万亿个 Token。什么概念?一个人一辈子读的书,大概也就几亿字。LLM 的阅读量是人类的几万倍。这也是为什么 LLM 看起来 "什么都知道"—— 它读的书实在太多了。
3. 算力大 —— 训练的 "电费"
训练一个大模型需要多少算力?这么说吧,训练一个 70B 参数的模型,需要几千张 GPU 跑几个月;训练 GPT-5 级别的模型,需要几十万张 GPU;成本从几亿到几十亿美元不等。这也是为什么大模型不是谁都能做的 —— 烧钱。
三、LLM 到底是怎么工作的?核心原理揭秘
说了这么多,你可能还是好奇:LLM 到底是怎么 "思考" 的?它为什么能说人话?答案说出来你可能不信 ——LLM 做的事情,本质上就是 "猜下一个词"。对,就这么简单。
举个例子,你输入 "今天天气真",LLM 会计算出接下来每个词的概率:好 65%、热 20%、不错 10%、糟糕 5%…… 然后它选概率最高的那个词(或者按概率随机选一个),比如 "好",输出给你。现在句子变成了 "今天天气真好",接下来 LLM 把 "今天天气真好" 作为输入,继续猜下一个词:啊 30%、,25%、适合 20%…… 就这样,一个词一个词地猜,一个词一个词地往外蹦,最后就成了一段通顺的话。
是不是感觉有点 "失望"?就这么简单的原理,怎么能写出文章、写出代码、甚至解数学题?这就是 LLM 最神奇的地方 —— 当 "猜下一个词" 的能力足够强时,它就会 "涌现" 出各种各样的能力。就像人类的大脑,本质上也就是神经元之间传递电信号,但组合起来就有了思想、情感、创造力。LLM 也是一样:当参数足够多、数据足够大、训练足够充分时,"猜下一个词" 这件事本身,就孕育出了理解、推理、创作的能力。
这就是我们后面会讲到的涌现能力(Emergent Abilities),先挖个坑,后面专门讲。
四、LLM 能做什么?
理论上,只要是和文字相关的任务,LLM 基本都能做。比如写东西 —— 文章、邮件、文案、诗歌、小说;写代码 —— 各种编程语言,从入门到精通;翻译 —— 几十种语言互译;问答 —— 上知天文下知地理(但不一定都对);总结 —— 长文变短、提炼要点;推理 —— 解数学题、分析逻辑、做决策……
但要注意,LLM 不是万能的。它也有很多做不到的事,比如不能实时联网(除非接了工具),不能保证说的都对(会 "幻觉",后面会讲),不能真正 "理解" 世界(它只是在统计规律)。
五、关于 LLM 的 3 个常见误区
最后,帮大家澄清几个经常被搞混的概念。
误区 1:LLM 有思想、有意识。错。LLM 没有思想,没有意识,也没有情感。它只是一个复杂的数学模型,在做概率计算。它说 "我很高兴",不是因为它真的高兴,而是根据训练数据,在这个语境下 "我很高兴" 这句话出现的概率最高。
误区 2:LLM 什么都知道。错。LLM 的知识有截止日期。比如 GPT-4o 的训练数据截止到 2024 年 7 月,那之后发生的事它就不知道了(除非接了联网工具)。而且,就算是截止日期之前的事,它也不一定都知道,也可能记错。
误区 3:参数越大,模型越好。不一定。参数大只是模型能力强的必要条件,不是充分条件。数据质量差,参数再大也没用;训练方法不对,参数再大也白搭;很多时候,一个 70B 的好模型,比一个 200B 的差模型还好用。适合自己的,才是最好的。
总结
好了,第一篇就到这里。简单回顾一下:LLM 就是个 "读了很多书、擅长接话" 的超级学霸,核心能力是 "预测下一个词";LLM 的 "大" 体现在三个方面 —— 参数大、数据大、算力大;LLM 不是万能的,它没有意识,知识有截止日期,也会犯错。
怎么样?是不是对 LLM 有了一个清晰的认识?下次再有人跟你聊 LLM,你也能侃侃而谈了。
下一篇,我们来讲讲 LLM 最基础的输入单位 ——Token。为什么大模型不是一个字一个字读的?Token 是怎么切的?为什么它直接影响你的钱包?咱们下篇见!
