人工智能大模型正以“万亿参数”的规模进入大众视野。但“3万亿参数”究竟意味着什么?一个简单的乘加公式,又如何演化出能写诗、编程、聊天的智能?本文从最基础的原理出发,为你一步步拆解。

第一部分:神经网络,简单说明

神经网络是什么?

简单说,神经网络就是一个模仿人脑决策方式的数学系统。它由无数个“神经元”组成,每个神经元都在做一个极其简单的任务:

看几个输入 → 各自乘以重要性(权重)→ 求和 → 加一个天生偏好(偏置)→ 看是否超过门槛 → 输出结果

用“野餐决策”来理解:

概念通俗解释野餐例子
输入你考虑的因素天气、朋友是否去、心情
权重你对每个因素的重视程度“天气”权重0.9,“朋友”权重0.3——说明你更看重天气
偏置你天生的倾向偏置+0.5代表你本来就爱出门;偏置-2.0代表你是“宅属性”
激活函数决策门槛总分超过60分就决定“去”,否则“不去”

每个神经元,本质上就是一个“打分决策器”。 它不聪明,只会做乘加运算和过门槛判断。

那为什么叫“神经网络”?因为成千上万个这样的“打分决策器”串联和并联在一起——前一个神经元的输出,成为后一个神经元的输入。就像工厂流水线:第一个工人只看原材料颜色,第二个看形状,第三个看重量……层层传递,最终组装出成品。

什么是“训练”?

一开始,所有的权重和偏置都是随机数字,毫无意义。“训练”就是给模型海量例子(比如“天气晴+朋友去→结果去”这样的几百万条数据),通过数学方法反复微调这3万亿个数字,直到模型的计算结果无限逼近正确答案。

“3万亿参数”翻译成普通人话就是:

这个AI大脑里有3万亿个可以调节的“旋钮”。每个权重是一个独立的旋钮,每个偏置也是一个独立的旋钮。它们虽然存储上各自独立,但在训练过程中是一张相互牵连的巨网——调整任何一个旋钮,都会通过层层传递影响整个网络的状态。训练的过程,就是让这3万亿个旋钮协同配合,找到一套最佳组合方式,使模型在千万种场景下都能做出正确判断。旋钮越多,模型的“容量”就越大,能学习的信息就越精细、越复杂。

第二部分:层层抽象——从“原始数据”到“人类概念”

单个神经元只是一个简单的打分器,但一个拥有几千层、3万亿个参数的大模型,相当于一座庞大的“决策城市”。

“层数越多,模型就能把原始数据一步步抽象成人类能理解的概念”——我们用“抖音推荐”来演示这个过程:

层级在做什么输入什么输出什么
第1层(底层)看原始数据观看秒数、点赞、划走速度、视频标签打包后的原始数字
第5层(中层)组合出行为模式看了15秒+点赞 / 看了3秒+划走“喜欢程度60分”
第20层(高层)识别你的口味偏好几百个视频的喜欢/讨厌记录“搞笑爱好者”、“吃货”
第100层(顶层)做最终推送决策你的标签 + 当前时间、地点推搞笑段子 / 探店视频 / 助眠视频

关键认知:每一层都在做同一个简单的乘加运算,但每一层处理的“输入”已经不是原始数据,而是上一层已经加工好的抽象概念

  • 第1层处理的是“秒数、点赞”——原始信号
  • 第20层处理的是“喜欢程度、讨厌程度”——行为模式
  • 第100层处理的是“搞笑爱好者、吃货”——人设标签

层数越多,模型就能把“0和1”一步步抽象成“人话”,最终做出像人一样的判断。

第三部分:跟大模型对话——从“文字”到“回答”的完整旅程

现在我们把“层层抽象”套用到你每天使用的AI对话上。假设你向大模型提问:

“我昨天熬夜了,今天喝什么提神?”

这句话从输入到输出,经历了怎样的层层抽象?

层级这一层在做什么具体处理内容
第1层把文字拆成最小单元(Token)“我”、“昨天”、“熬”、“夜”、“了”、“今天”、“喝”、“什么”、“提神”
第3层识别每个词的基本含义“熬夜”→睡眠不足;“提神”→需要刺激;“喝”→饮品相关
第8层理解句子结构和语法关系主语是“我”,时间是“昨天”和“今天”,动作是“喝”
第15层理解整句话的浅层意图用户在问“喝什么能提神”
第30层结合常识进行推理熬夜疲劳→需要咖啡因或糖分→但需考虑健康因素
第60层结合历史对话(如有)如果你之前提过“胃不好”,这一层会记住并影响后续判断
第100层组织语言,生成自然回答“建议喝一杯美式咖啡提神,但如果胃不舒服,可以换成红茶或蜂蜜水。”

两个关键补充概念:

1. 激活函数(固定规则,不算参数)

每个神经元算出“总分”后,需要一个“阀门”来决定怎么处理这个分数。这个阀门叫激活函数,规则是:分数大于0就保留原值输出,小于等于0就输出0。

  • 它不是参数:不参与“3万亿”的计数,所有神经元共用同一个固定的激活函数公式
  • 它的作用:让网络具备处理复杂非线性问题的能力

2. MoE混合专家架构(含激活参数,算参数)

3万亿参数如果每次全部计算,成本极高。MoE的核心思路是:只调用最懂当前问题的那部分“专家”来回答,而不是把所有专家都拉出来。

用“医院挂号”来理解:

对比传统稠密模型MoE混合专家模型
工作方式全院所有科室一起会诊导诊员判断病情,只叫相关科室
每次推理成本极高大幅降低(只激活部分专家)
类比全院会诊导诊分诊

实际中,一个总参数3万亿的MoE模型,每次处理问题时可能只激活3000亿个参数,其余2.7万亿处于“休眠”状态。

关于“激活参数”的正确理解:

在MoE架构中,“激活参数”指的是当前任务中被路由网络选中并唤醒的那部分“专家”内部的参数。它不是一个独立的参数类型,而是一个描述状态的说法——本质上是“正在被使用的权重和偏置”。同一个专家,这次被激活时它的参数就是“激活参数”,下次没被激活时就是“沉睡参数”。

概念具体指什么算不算“3万亿总参数”?
权重/偏置每个神经元输入的重要性 + 先天倾向算(绝大部分)
激活函数固定不变的“阀门规则”不算
路由网络参数“导诊员”自己的判断参数算(占比很小)
激活参数当前任务中被唤醒的那部分“专家”内部的权重和偏置算(是权重/偏置的一部分,按需激活)

第四部分:为什么不是“越大越好”?——代价与平衡

3万亿参数赋予的能力:

  • 更大的“容量”去记忆复杂模式;
  • 更精细的知识编码和上下文推理;
  • 当层数和参数足够多时,会“涌现”出训练时未专门教过的能力(如三步逻辑推理、创意生成)。

伴随的巨大代价:

  • 训练成本:需数万张顶级GPU连续运行数月,电费达数亿美元。
  • 存储占用:仅模型文件就需约12TB显存(FP32训练态,推理量化后通常大幅降低)。
  • 推理成本:每次回答都要计算全部参数,运营成本远高于小模型。

关键认知:

  • 参数规模不是唯一指标,训练数据的质量同样关键。
  • MoE架构可以在保证效果的同时大幅降低推理成本。

第五部分:当前大模型参数规模版图

全球头部大模型已进入万亿级别,国产开源模型表现亮眼。

全球前沿模型(估算值):

梯队模型估算参数规模
第一梯队 (3万亿+)GPT-5、Claude Opus 4.7、Grok-4等3.2万亿 ~ 10万亿
第二梯队 (1-3万亿)GPT-4.1、Claude Sonnet 4.6、Gemini 2.5 Pro1.2万亿 ~ 2.2万亿

国产大模型突破:

模型参数规模亮点
Kimi K32.8万亿全球参数最大的开源模型
MiniMax M3 Pro约2.7万亿进入2-3万亿俱乐部
阿里千问 Qwen3.8-Max2.4万亿代码工程、深度推理表现出色
DeepSeek V4 Pro1.6万亿后训练技术优秀,性能强劲

总结

维度核心结论
神经网络是什么无数个“打分决策器”串联并联,每个只做乘加运算和过门槛判断
微观原理每个神经元 = 输入×权重 + 偏置 → 过激活函数门槛 → 输出
激活函数固定不变的“阀门规则”,不是参数,不参与3万亿计数
激活参数MoE中当前被唤醒的专家内部的权重和偏置,本质是“正在被使用的参数”,计入3万亿总参数,按需激活
训练是什么把3万亿个随机“旋钮”协同拧成能正确预测的精准数值
“旋钮”怎么理解每个权重和偏置在存储上独立,但训练中相互牵连,必须协同配合
MoE架构“导诊分诊”机制,总参数3万亿但每次只激活约3000亿,大幅降低成本
层数的意义底层处理“文字碎片”,顶层理解“完整意图”,层层抽象出人类概念
对话举例“熬夜喝什么”→从拆字→词义→句法→意图→推理→上下文→生成回答
现实平衡参数大小≠智商高低,还需优质数据、架构设计(如MoE)共同作用
当前格局头部模型竞争进入数万亿参数级别,国产开源模型正快速追赶

最后一句话:神经元的乘加运算就像砖块,几千层的堆叠和3万亿个相互牵连的旋钮就是设计图纸与建材总量,最终“涌现”出的智能,就是那座能抗风雨、容纳万人的摩天大楼。读懂这些数字背后的逻辑,比单纯比较大小更有价值。

AI