大模型是怎么工作的?一个普通人能懂的科普
2026-07-05
大模型是怎么工作的?一个普通人能懂的科普
说实话,我第一次接触大模型的时候,脑子里全是问号。什么Transformer、参数规模、注意力机制……听着就像天书。直到后来我把这些概念翻译成生活中的例子,才终于搞明白了它们到底在做什么。今天我就用最接地气的方式,聊聊大模型的工作逻辑。
它本质上是个“超级填空游戏”
想象一下,你小时候玩过的那种“填空造句”游戏。比如给你一句话:“今天天气__,我决定去____。”你会根据自己的经验填上“很好”和“公园”。大模型干的活,本质上跟这个一模一样——它只是把填空的规模放大了几万亿倍。
具体来说,大模型在训练阶段看过了海量的文本——可能是整个互联网上的书籍、文章、论坛帖子、代码仓库。它从这些数据里总结出规律:在“今天天气”后面,人类通常接“很好”“晴朗”“不错”;在“我决定去”后面,人类通常接“公园”“上班”“吃饭”。当它见过几万亿次这样的模式后,它就能以极高的准确率预测下一个词该是什么。
关键点在于:模型不是真的理解“晴天”和“公园”是什么意思,它只是知道这两个词经常一起出现。就像你虽然不懂某个外语单词,但根据上下文也能猜出它大概代表什么情绪。
参数:模型里的“小旋钮”
你可能会问,模型怎么记住这些规律?靠的是“参数”。你可以把参数想象成收音机上的旋钮。一个老式收音机有音量旋钮、调频旋钮,每个旋钮的不同位置会产生不同的声音效果。大模型里动辄上千亿个参数,就是上千亿个“小旋钮”。
训练的过程,就是不断地调整这些旋钮的位置。刚开始时,模型输出的文字完全随机,像猴子乱敲键盘。但每次它猜错了(比如把“今天天气很好”写成了“今天天气香蕉”),训练算法就会微调一下相关的旋钮,让下次犯同样错误的概率降低一点点。
具体数字:GPT-3有1750亿个参数,GPT-4据推测超过1万亿个参数。训练这种规模的模型,需要消耗数千张GPU显卡跑上几十天,电费账单就能吓死人。有机构估算,训练一个GPT-4级别的模型,光是电费就要几千万美元。
注意力机制:模型在“看”什么
光有海量参数还不够,模型还得知道在写一句话时,该关注输入里的哪些词。这就是“注意力机制”在发挥作用。
我举个例子。假设你在写一句中文:“他昨天没来开会,因为______。”当你填这个空的时候,你的注意力会集中在“没来开会”这个原因上,而不是“昨天”这个时间。模型也是这样——它会计算当前要预测的词,和前面每个词之间的“关联度”。关联度高的词,权重就大;关联度低的词,权重就小。
注意力机制的核心公式(我简化到极致):每个词都会向其他词“提问”:“我跟你关系怎么样?”然后根据回答来调整自己的表达。这个过程在整个模型里同时发生,几十层网络叠加,最终模型就能捕捉到“因为”和“没来开会”之间的因果关系,而不是被“昨天”这种无关信息带偏。
从“傻”到“聪明”的三个阶段
我习惯把大模型的能力发展分成三个阶段来看:
| 阶段 | 训练方式 | 数据量级 | 模型表现 |
|---|---|---|---|
| 预训练 | 无监督学习,纯粹预测下一个词 | 数万亿token | 能写通顺句子,但经常胡说八道 |
| 指令微调 | 用人工标注的问答对进行训练 | 数万到数百万条 | 能理解用户指令,回答更有条理 |
| 人类反馈强化学习 | 根据用户反馈调整模型行为 | 持续收集 | 更符合人类偏好,更安全有用 |
预训练阶段模型就像一个读了万卷书但从未与人交流的怪人。它知道“李白是唐代诗人”,但如果你问它“李白今天穿什么颜色的鞋”,它可能会一本正经地编造答案——因为它只学过文字规律,没有常识判断。
指令微调阶段,研究人员会给模型看大量“问题-正确答案”的例子。比如:“请用一句话解释光合作用”对应“植物利用阳光将二氧化碳和水转化为氧气和葡萄糖的过程”。模型通过这些标注数据学会按指令办事。
人类反馈强化学习阶段最有趣。模型生成多个回答后,让人类评判哪个更好。比如针对“怎么减肥”这个问题,一个回答是“每天跑5公里”,另一个是“建议咨询医生制定合理计划”。人类会倾向于后者,模型就会调整参数,让自己更倾向于给出安全、有用的建议。
为什么它还是会出错?
聊到这里,你可能会觉得大模型很神奇。但别忘了,它本质上还是一个概率模型。它不知道对错,只知道“更可能”和“不太可能”。这就导致了一些经典翻车场景:
- 幻觉问题:因为模型没见过“2024年奥运会在哪里举行”这个确切信息(实际上2024年奥运会在巴黎),它只能根据“奥运会”“2024年”这些关键词去猜,猜错了就产生幻觉。
- 上下文限制:目前大多数模型能处理的上下文长度在4K到128K token之间(一个token大约是一个汉字或半个英文单词)。超过这个长度,模型就会“忘记”前面说了什么,就像你读一本太厚的书读到后面忘了开头。
- 数学硬伤:大模型本质上是个语言模型,不是计算器。你让它算“1234×5678”,它可能会因为训练数据里没见过这个精确组合而出错。所以现在很多AI产品都会外挂一个计算器工具来解决这个问题。
普通人能怎么理解它?
我最后用一个比喻来收尾。大模型就像一个极其博学但完全没有常识的实习生。他读过全世界的书,但从来没有真正生活过。当你问他问题,他会在脑海里翻遍所有读过的内容,找出最像答案的那段文字,然后复制粘贴给你。大多数时候他给得很准,但偶尔也会把小说里的情节当成事实说出来。
理解这一点很重要——不要指望AI绝对正确,但要学会利用它的强项。比如让它帮你查资料、写草稿、翻译、总结长文,这些它做得又快又好。但涉及事实核对、逻辑推理、道德判断时,你还是得靠自己。
下次你用ChatGPT或者文心一言的时候,可以试着分析一下:它是在根据概率预测下一个词,还是真的在“思考”?答案通常是前者。但神奇的是,这种纯粹的统计学习,竟然能产生看起来像“思考”的效果。这本身就是一个值得惊叹的事情。