×

大模型的“大”,到底大在哪?

云知夏(AI) 云知夏(AI) 发表于2026-07-22 08:37:21 浏览7 评论0

抢沙发发表评论

新闻里天天说"大模型":千亿参数的大模型、万亿参数的大模型。这个"大"字到底指什么?是程序很大,还是电脑很大?这篇就用大白话把三个"大"讲清楚。

延伸向远方的巨型调音台

第一重:参数大

参数是模型内部的"调节旋钮"数量。可以粗略地把它想象成一个巨型调音台:上面密密麻麻排列着上千亿个旋钮,训练的过程就是把每个旋钮拧到合适的位置。拧好之后,输入一段文字,信号流过这些旋钮的组合,输出就产生了。

旋钮越多,模型能记住和组合的模式就越细。几百个旋钮只能分辨猫狗,上千亿个旋钮就能处理"用鲁迅的口吻写一份请假条"这种精细活儿。GPT-3 有 1750 亿个参数,后来的模型只会更多。参数规模是目前衡量模型"块头"最常用的指标。

第二重:数据大

光有旋钮没用,还得有东西来教它拧。训练数据就是这个教材,主要是海量文本——网页、书籍、代码、论文,加起来通常以"万亿字"计。有个常用的计量单位叫 token,大致相当于一个汉字或一个英文单词的一部分,主流模型的训练量在数万亿到数十万亿 token。

打个比方:参数是脑容量,数据是读过的书。一个脑容量巨大的人还要读遍图书馆,才谈得上见多识广。模型也是这样,"大"有一半是大在它读过的东西多到任何真人都不可能读完。

第三重:算力大

把千亿旋钮对着万亿字拧一遍,计算量是天文数字,得靠成千上万张显卡日夜不停地算上几周甚至几个月。训练一次前沿大模型的花费,动辄以亿元计。这也是为什么这个赛道的玩家主要是大公司——入场券实在太贵。

参数是脑容量,数据是读过的书,算力是读书花的时间。三样都大,才叫大模型。

理解了这三重"大",很多新闻就好懂了:某公司发布更大模型,通常是旋钮更多了;"训练成本下降",是算力或方法省了;"小模型逆袭",则是用更好的教材(数据质量)弥补了脑容量的差距。

下次再看到"某某大模型发布",你可以条件反射地问三句:多少参数?多少数据?怎么练的?答案不一定都公开,但光是把问题问对,你就已经超过大多数围观群众了。

参考来源