AI教程网

每天一篇AI教程

大模型是怎么工作的?一个普通人能懂的科普

2026-07-05

大模型是怎么工作的?一个普通人能懂的科普

说实话,我第一次接触大模型的时候,脑子里全是问号。什么Transformer、参数规模、注意力机制……听着就像天书。直到后来我把这些概念翻译成生活中的例子,才终于搞明白了它们到底在做什么。今天我就用最接地气的方式,聊聊大模型的工作逻辑。

它本质上是个“超级填空游戏”

它本质上是个“超级填空游戏”

想象一下,你小时候玩过的那种“填空造句”游戏。比如给你一句话:“今天天气__,我决定去____。”你会根据自己的经验填上“很好”和“公园”。大模型干的活,本质上跟这个一模一样——它只是把填空的规模放大了几万亿倍。

具体来说,大模型在训练阶段看过了海量的文本——可能是整个互联网上的书籍、文章、论坛帖子、代码仓库。它从这些数据里总结出规律:在“今天天气”后面,人类通常接“很好”“晴朗”“不错”;在“我决定去”后面,人类通常接“公园”“上班”“吃饭”。当它见过几万亿次这样的模式后,它就能以极高的准确率预测下一个词该是什么。

关键点在于:模型不是真的理解“晴天”和“公园”是什么意思,它只是知道这两个词经常一起出现。就像你虽然不懂某个外语单词,但根据上下文也能猜出它大概代表什么情绪。

参数:模型里的“小旋钮”

你可能会问,模型怎么记住这些规律?靠的是“参数”。你可以把参数想象成收音机上的旋钮。一个老式收音机有音量旋钮、调频旋钮,每个旋钮的不同位置会产生不同的声音效果。大模型里动辄上千亿个参数,就是上千亿个“小旋钮”。

训练的过程,就是不断地调整这些旋钮的位置。刚开始时,模型输出的文字完全随机,像猴子乱敲键盘。但每次它猜错了(比如把“今天天气很好”写成了“今天天气香蕉”),训练算法就会微调一下相关的旋钮,让下次犯同样错误的概率降低一点点。

具体数字:GPT-3有1750亿个参数,GPT-4据推测超过1万亿个参数。训练这种规模的模型,需要消耗数千张GPU显卡跑上几十天,电费账单就能吓死人。有机构估算,训练一个GPT-4级别的模型,光是电费就要几千万美元。

注意力机制:模型在“看”什么

光有海量参数还不够,模型还得知道在写一句话时,该关注输入里的哪些词。这就是“注意力机制”在发挥作用。

我举个例子。假设你在写一句中文:“他昨天没来开会,因为______。”当你填这个空的时候,你的注意力会集中在“没来开会”这个原因上,而不是“昨天”这个时间。模型也是这样——它会计算当前要预测的词,和前面每个词之间的“关联度”。关联度高的词,权重就大;关联度低的词,权重就小。

注意力机制的核心公式(我简化到极致):每个词都会向其他词“提问”:“我跟你关系怎么样?”然后根据回答来调整自己的表达。这个过程在整个模型里同时发生,几十层网络叠加,最终模型就能捕捉到“因为”和“没来开会”之间的因果关系,而不是被“昨天”这种无关信息带偏。

从“傻”到“聪明”的三个阶段

从“傻”到“聪明”的三个阶段

我习惯把大模型的能力发展分成三个阶段来看:

阶段 训练方式 数据量级 模型表现
预训练 无监督学习,纯粹预测下一个词 数万亿token 能写通顺句子,但经常胡说八道
指令微调 用人工标注的问答对进行训练 数万到数百万条 能理解用户指令,回答更有条理
人类反馈强化学习 根据用户反馈调整模型行为 持续收集 更符合人类偏好,更安全有用

预训练阶段模型就像一个读了万卷书但从未与人交流的怪人。它知道“李白是唐代诗人”,但如果你问它“李白今天穿什么颜色的鞋”,它可能会一本正经地编造答案——因为它只学过文字规律,没有常识判断。

指令微调阶段,研究人员会给模型看大量“问题-正确答案”的例子。比如:“请用一句话解释光合作用”对应“植物利用阳光将二氧化碳和水转化为氧气和葡萄糖的过程”。模型通过这些标注数据学会按指令办事。

人类反馈强化学习阶段最有趣。模型生成多个回答后,让人类评判哪个更好。比如针对“怎么减肥”这个问题,一个回答是“每天跑5公里”,另一个是“建议咨询医生制定合理计划”。人类会倾向于后者,模型就会调整参数,让自己更倾向于给出安全、有用的建议。

为什么它还是会出错?

聊到这里,你可能会觉得大模型很神奇。但别忘了,它本质上还是一个概率模型。它不知道对错,只知道“更可能”和“不太可能”。这就导致了一些经典翻车场景:

普通人能怎么理解它?

我最后用一个比喻来收尾。大模型就像一个极其博学但完全没有常识的实习生。他读过全世界的书,但从来没有真正生活过。当你问他问题,他会在脑海里翻遍所有读过的内容,找出最像答案的那段文字,然后复制粘贴给你。大多数时候他给得很准,但偶尔也会把小说里的情节当成事实说出来。

理解这一点很重要——不要指望AI绝对正确,但要学会利用它的强项。比如让它帮你查资料、写草稿、翻译、总结长文,这些它做得又快又好。但涉及事实核对、逻辑推理、道德判断时,你还是得靠自己。

下次你用ChatGPT或者文心一言的时候,可以试着分析一下:它是在根据概率预测下一个词,还是真的在“思考”?答案通常是前者。但神奇的是,这种纯粹的统计学习,竟然能产生看起来像“思考”的效果。这本身就是一个值得惊叹的事情。