AI大模型的参数到底是啥?即专业又通俗的大模型之旅
凭什么一堆冰冷的数字,就能做成AI大模型,生成文字、图像,甚至视频?

现在的大模型参数动辄几千上万亿。DeepSeek最大的模型671B,就是6710亿个参数。GPT模型的参数,更是达到了万亿级别。而阿里的通义千问开源模型,从最小的0.6B到最大的235B,提供了多个不同的版本。为什么这些不同的模型,都只强调参数呢?为什么一堆数字,就能生成文字、图像甚至是视频呢。
专业的解释是这样的:
“大模型通过在高维向量空间中学习数据的概率分布,将符号映射为连续向量,再通过非线性变换计算出下一个符号的条件概率。”
是不是感觉头大,听不懂了?别划走,这次让你看个够!
现在网上介绍大模型的视频也很多了,但是要么太专业,普通人看不懂。要么又太通俗,看着好玩但没什么收获。这次我们就把两种风格结合起来,用一种即专业又通俗的方式,让你轻轻松松掌握AI大模型的老底!
(第一部分:一个AI模型,99%都是参数)
其实一个AI大模型,99%都是参数

我们不玩虚的,直接“拆开”一个开源大模型。Huggingface上打开一个开源的Llama模型源文件,就长这样。

你会发现大模型就是一堆文件。除了几个很小的配置文件外,最占地方的,就是几个巨大的、以 .safetensors 结尾的文件。
这些文件是什么?是复杂的代码吗?
都不是。如果我们“破解”它,你会发现里面就是一长串密密麻麻的数字列表。
再多看几个其他的开源大模型,其实也都长得差不多。最大的就是这些巨大的safetensors文件。
这解释了一个有趣的现象:现在市面上这么多大模型,其实它们的底层结构基本都是相似的,基本都是transformers架构。就像汽车都有四个轮子一个方向盘。真正的差距,体现在这些参数文件的不同——也就是那几千亿个数字的具体值。
所以,我们现在聊大模型,更多的是在关注参数,而很少再提函数或架构。因为参数,才是决定一个模型“灵魂”的关键。
(第二部分:到底什么是AI大模型?)
到底什么是AI大模型呢?

这就要请出我们的终极武器:初中数学的直线方程 y = ax + b。
一旦我们确定了 a=2, b=1,这个函数的“魔法”就确定了:y = 2x + 1。它拥有了预测能力:你给我任何一个 x,我都能预测出对应的 y。
一个AI大模型,做的就是完全一样的事情,只是它所代表的那个函数,无比复杂!
- AI大模型处理的数据,也就是x和y,不是一个单独的数字,而是由很多个数字一起表示的数组,或者成为向量。这些向量,可以是文字、声音、图像、视频等任何能够用数字表示的人类知识 。
- AI的函数,通常都是一个基于Transformer架构的神经网络,你可以理解成一个有很多个类似的a和b这样的参数的超级函数。它极其复杂,但结构是固定的。
- AI的模型参数,对于这个超级函数,确定了那亿万个
a和b的参数组合,就相当于确定了一个AI大模型。
所以,AI的本质就是一个无比强大的、普适的“预测函数”。我们之所以只谈参数,是因为那个复杂的“函数结构”已经是公开的秘密。AI大模型核心的transformers架构,从论文到工具库,你都可以从网上很轻松的获得。而真正决定模型能力的,是那些参数的具体数值。
(第三部分:这个神奇的参数从何而来?)
这么多神奇的参数怎么得来的?

这个超级函数里的亿万个参数,要怎么确定这些呢?你搞个Excel表格,里面随随便便写上亿万个数字,他也可以表示一个大模型。不过,很显然,累死你也不可能随意编出一个靠谱的大模型。那些强大的大模型是怎么做的呢?
我们再次回到 y = ax + b。想确定 a 和 b,我们需要已知的“输入输出对”作为训练数据。比如:
- 输入
x=1,期望输出y=3。 - 输入
x=2,期望输出y=5。 算法通过计算,就能倒推出最佳参数是a=2, b=1。这个过程,就叫“训练”。
AI大模型的训练,原理一模一样。只是规模是天文数字!一方面,模型里要计算的参数是天文数字级别的,另一方面,给定的学习数据也是五花八门的。
- 给它数万亿个文字问答对,比如输入“法国首都是?”,输出“巴黎”,它就能训练出一个大语言模型。比如DeepSeek。
- 给它数亿张“文字描述-图片”对,比如输入是文字狗,输出是一张狗狗的图片,它就能训练出一个文生图模型。比如即梦AI。
训练的本质,就是在一个固定的、极其复杂的函数结构上,用海量的数据和算力,去求解那亿万个最佳的参数值。一旦这些参数被确定,这个模型的能力也就被焊死了。
(第四部分:终极问题——脑容量与智慧)
有了这些基础后,我们就可以正面回答那两个终极问题了。
第一,参数为什么要这么多?少一点不行吗?

这里,函数和参数的关系,就像大脑的结构和大脑的容量。
一个生物想要变得聪明,首先需要一个足够复杂的大脑结构作为基础。说人话就是,它需要足够大的脑容量——有一个足够大的脑子。
老鼠的脑容量很小,它的生理结构就决定了它智慧的上限。所以你永远不可能通过训练,让一只老鼠变得像海豚那样聪明,能够理解人类的指令甚至是情感。
AI也是一样。y = ax + b 这种简单的函数,就是“老鼠的大脑”,它只能学习和表达非常简单的规律。为了让AI能理解人类语言的语法、世界的物理规律、艺术风格的细微差别,我们就必须先给它一个“人类级别的大脑”——也就是像Transformer这样复杂的神经网络架构,并且,用海量的参数,为这个“大脑”提供足够大的“容量”。
参数多,意味着它有更多的“神经元”去存储和处理信息,这是它能够涌现出智慧的物理基础。
这时,自然而然就有下面的问题:
第二,参数是不是越多越好吗?换句话说,脑容量越大,就越聪明吗?

答案是:当然不是。
我们继续用生物类比。所有人类的大脑容量都远超老鼠,这是我们成为智慧生物的基础。但是,同样是人,有爱因斯坦这样的天才,也有智力发育障碍的患者。拥有巨大的脑容量,只是聪明的必要条件,而不是充分条件。
AI也是如此。一个拥有万亿参数的模型,相当于拥有了一个巨大的“大脑”,潜力巨大。但它最终是否“聪明”,还取决于:
- 训练数据的质量好不好:你给它“喂”的是百科全书还是网络垃圾,决定了它的知识水平和价值观。
- 训练方法的是不是科学:就像教育方法一样,好的训练能让它更高效地学习和推理。
- 和应用场景的是不是匹配:你想在手机上装一个AI大模型,光存下DeepSeek那样四百多个G的参数,就足够很多手机望而生畏了。
- 专业领域是不是足够扎实:你让马斯克去当律师,打官司,累死他也不一定比得过专业律师。让一个什么都懂的大模型去做法律咨询,他可能也不如一个参数量小得多,但深入学习了所有法律知识的垂直大模型来得快和准。
所以,参数大,提供了“成为天才”的可能性,但也会带来更高的训练成本和使用成本。在很多实际应用中,一个在特定领域被“精装修”过的小模型,往往比一个大而全的“毛坯房”更有用。
(结尾与总结)

我们来总结一下:
- AI模型 = 一个先进的“大脑结构”,也就是神经网络 + 巨大的“脑容量”,也就是海量参数。
- 训练 = 通过学习和教育,塑造这个大脑里的连接,确定参数。
- 参数并非越多越好。脑容量是基础,但智慧更取决于训练的质量和应用的领域。
这其实也给了我们巨大的启发。在这个时代,你不需要成为一个什么都懂的“通才”。在一个你热爱的领域里,把自己打磨成一个无可替代的“专才”,你就是那个最有价值的“模型”。
记住这句送给所有人的话:
世界不需要人人都是百科全书,但永远需要独一无二的工匠精神。
怎么样,从一个初中数学公式出发,是不是感觉AI的底层逻辑一下就清晰了?
觉得搞懂了的朋友,评论区留下你的问题和理解,最后别忘了点一个大大的赞!谢谢啦 我们下期再见!