大模型训练一次到底烧多少钱?
2026-09-13
大模型训练一次到底烧多少钱?
前几天跟一个做投资的朋友吃饭,他问我:"现在动不动就说大模型训练烧了几千万美金,这钱到底花在哪儿了?"我当时夹着一块红烧肉,想了想说,这就像你问一家餐厅为什么一道菜卖888,得从食材、厨师、房租三块拆。
他点点头。我放下筷子,决定认真聊聊这事。
先给个大概的数字
GPT-4的训练成本,OpenAI官方从来没公布过。但业内有个被引用比较多的估算——大概7800万美元到1亿美元之间。这个数字来自Semianalysis等机构的推算,不是官方数据,但大致能反映量级。
作为对比,Meta训练Llama 3 405B,扎克伯格在一次采访中提到算力规模是Llama 2的近50倍。虽然没直接说钱,但你可以从硬件采购和电费反推。
国内这边,DeepSeek V3的训练成本公开披露过:557.6万美元。这个数字当时在圈内炸了锅,因为太便宜了。但要注意,这是"训练成本",不含前期研发、人员工资、失败实验的沉没成本。
所以你看,同样是"训练一次",价格区间可以从几百万美金到上亿美金,差了二十倍。为什么?
算力:最大的一块蛋糕
训练成本里,算力大概占60%到70%,这是绝对的吞金兽。
具体怎么算?假设你用10000张H100 GPU,训练3个月。一张H100的市场价大概2.5万到3万美元(黑市价一度炒到4万),光硬件采购就是2.5亿到3亿美元。当然大厂是自建集群,不是一次性买断摊到单次训练里,但折旧费跑不掉。
电费更直观。一张H100的功耗是700W,10000张就是7MW。加上散热和配套,实际功耗翻倍到14MW左右。跑3个月,按工业电价0.08美元/度算:
14MW × 24小时 × 90天 × 0.08 = 约242万美元
这还只是电费,没算网络设备、冷却系统、机房租金。微软在威斯康星州建的那个AI数据中心,光是电力基础设施就投了33亿美元。
我去年参观过国内某家的智算中心,运维负责人跟我说,他们最怕的不是买卡,是卡坏了。H100的故障率在高温高负载下会飙升,换一张卡要停机几小时,损失按分钟算。
数据:看不见的隐形成本
数据这块,很多人以为就是"网上爬",其实远不止。
以Common Crawl为例,原始数据是PB级别的,但清洗完能用的可能只剩5%到10%。清洗过程需要大量CPU集群跑几个月,这部分成本经常被忽略。
更贵的是标注数据。RLHF阶段需要人类反馈,OpenAI在肯尼亚雇过时薪不到2美元的标注员,但那是底层。高端的领域专家标注,比如医学、法律,时薪可以到50到100美元。
我认识一个做数据标注创业的朋友,他给某大厂做过一批代码数据清洗,报价是每百万token 15美元。一个千亿参数模型预训练需要几万亿token,你自己算算。
还有个坑是版权。Reddit跟Google签的数据授权协议,一年6000万美元。新闻集团跟OpenAI的协议,据传是五年2.5亿美元。这些钱最终都会摊到训练成本里。
人力:最容易被低估的部分
一个能训练大模型的团队,核心成员大概50到200人,包括研究员、工程师、数据科学家、运维。
OpenAI在GPT-4训练期间,团队规模在300人左右。按硅谷AI研究员平均年薪30万到50万美元(含股票),一年人力成本就是1到1.5亿美元。
但这只是工资。还有招聘成本、培训成本、以及失败实验的浪费。Anthropic的CEO Dario Amodei说过,训练一个前沿模型,至少要烧掉几千万美元在失败的尝试上。
国内这边,我了解到某头部大模型公司的算法工程师,资深一点的年薪在80万到150万人民币,核心研究员可以到300万以上。一个百人团队,一年光工资就1到2亿人民币。
一次训练的真实账单
把上面几块拼起来,假设训练一个GPT-4级别的模型:
| 成本项 | 估算金额 | 占比 |
|---|---|---|
| GPU折旧/租赁 | 4000万-6000万美元 | 55%-65% |
| 电费+运维 | 500万-800万美元 | 8%-10% |
| 数据获取+清洗 | 500万-1500万美元 | 8%-15% |
| 人力成本 | 1000万-2000万美元 | 15%-20% |
| 失败实验沉没 | 500万-1000万美元 | 8%-12% |
| 合计 | 6500万-1.1亿美元 | 100% |
注意,这是一次成功训练的成本。如果算上所有失败尝试,总投入要翻倍。
DeepSeek能把成本压到557万美元,靠的是MoE架构(只激活部分参数)、FP8混合精度训练、以及极致的工程优化。这不是说他们的模型差,而是说明架构创新能省大钱。
普通人该关心什么
你可能觉得,这些数字离自己太远。但其实有两点跟普通人相关:
一是推理成本会传导到你身上。训练贵,推理也不便宜。你每次调用API,背后都是真金白银。GPT-4的推理成本据估算大概是每千token 0.03到0.06美元,这部分最终会体现在产品定价里。
二是小模型的性价比在提升。不是所有场景都需要GPT-4。一个7B参数的模型,训练成本可能只要几万美元,在特定任务上效果不差。我最近用Qwen2.5-7B做文本分类,效果比一年前的13B模型还好。
所以回到开头那个问题——大模型训练一次烧多少钱?答案是:看你怎么烧。堆卡堆数据是一种烧法,抠架构抠工程是另一种烧法。前者是钞能力,后者是技术活。
我那个投资人朋友听完,沉默了一会儿说:"那我还是投应用层吧。"