人工智能大模型正以“万亿参数”的规模进入大众视野。但“3万亿参数”究竟意味着什么?一个简单的乘加公式,又如何演化出能写诗、编程、聊天的智能?本文从最基础的原理出发,为你一步步拆解。
第一部分:神经网络,简单说明
神经网络是什么?
简单说,神经网络就是一个模仿人脑决策方式的数学系统。它由无数个“神经元”组成,每个神经元都在做一个极其简单的任务:
看几个输入 → 各自乘以重要性(权重)→ 求和 → 加一个天生偏好(偏置)→ 看是否超过门槛 → 输出结果
用“野餐决策”来理解:
| 概念 | 通俗解释 | 野餐例子 |
|---|---|---|
| 输入 | 你考虑的因素 | 天气、朋友是否去、心情 |
| 权重 | 你对每个因素的重视程度 | “天气”权重0.9,“朋友”权重0.3——说明你更看重天气 |
| 偏置 | 你天生的倾向 | 偏置+0.5代表你本来就爱出门;偏置-2.0代表你是“宅属性” |
| 激活函数 | 决策门槛 | 总分超过60分就决定“去”,否则“不去” |
每个神经元,本质上就是一个“打分决策器”。 它不聪明,只会做乘加运算和过门槛判断。
那为什么叫“神经网络”?因为成千上万个这样的“打分决策器”串联和并联在一起——前一个神经元的输出,成为后一个神经元的输入。就像工厂流水线:第一个工人只看原材料颜色,第二个看形状,第三个看重量……层层传递,最终组装出成品。
什么是“训练”?
一开始,所有的权重和偏置都是随机数字,毫无意义。“训练”就是给模型海量例子(比如“天气晴+朋友去→结果去”这样的几百万条数据),通过数学方法反复微调这3万亿个数字,直到模型的计算结果无限逼近正确答案。
“3万亿参数”翻译成普通人话就是:
这个AI大脑里有3万亿个可以调节的“旋钮”。每个权重是一个独立的旋钮,每个偏置也是一个独立的旋钮。它们虽然存储上各自独立,但在训练过程中是一张相互牵连的巨网——调整任何一个旋钮,都会通过层层传递影响整个网络的状态。训练的过程,就是让这3万亿个旋钮协同配合,找到一套最佳组合方式,使模型在千万种场景下都能做出正确判断。旋钮越多,模型的“容量”就越大,能学习的信息就越精细、越复杂。
第二部分:层层抽象——从“原始数据”到“人类概念”
单个神经元只是一个简单的打分器,但一个拥有几千层、3万亿个参数的大模型,相当于一座庞大的“决策城市”。
“层数越多,模型就能把原始数据一步步抽象成人类能理解的概念”——我们用“抖音推荐”来演示这个过程:
| 层级 | 在做什么 | 输入什么 | 输出什么 |
|---|---|---|---|
| 第1层(底层) | 看原始数据 | 观看秒数、点赞、划走速度、视频标签 | 打包后的原始数字 |
| 第5层(中层) | 组合出行为模式 | 看了15秒+点赞 / 看了3秒+划走 | “喜欢程度60分” |
| 第20层(高层) | 识别你的口味偏好 | 几百个视频的喜欢/讨厌记录 | “搞笑爱好者”、“吃货” |
| 第100层(顶层) | 做最终推送决策 | 你的标签 + 当前时间、地点 | 推搞笑段子 / 探店视频 / 助眠视频 |
关键认知:每一层都在做同一个简单的乘加运算,但每一层处理的“输入”已经不是原始数据,而是上一层已经加工好的抽象概念。
- 第1层处理的是“秒数、点赞”——原始信号
- 第20层处理的是“喜欢程度、讨厌程度”——行为模式
- 第100层处理的是“搞笑爱好者、吃货”——人设标签
层数越多,模型就能把“0和1”一步步抽象成“人话”,最终做出像人一样的判断。
第三部分:跟大模型对话——从“文字”到“回答”的完整旅程
现在我们把“层层抽象”套用到你每天使用的AI对话上。假设你向大模型提问:
“我昨天熬夜了,今天喝什么提神?”
这句话从输入到输出,经历了怎样的层层抽象?
| 层级 | 这一层在做什么 | 具体处理内容 |
|---|---|---|
| 第1层 | 把文字拆成最小单元(Token) | “我”、“昨天”、“熬”、“夜”、“了”、“今天”、“喝”、“什么”、“提神” |
| 第3层 | 识别每个词的基本含义 | “熬夜”→睡眠不足;“提神”→需要刺激;“喝”→饮品相关 |
| 第8层 | 理解句子结构和语法关系 | 主语是“我”,时间是“昨天”和“今天”,动作是“喝” |
| 第15层 | 理解整句话的浅层意图 | 用户在问“喝什么能提神” |
| 第30层 | 结合常识进行推理 | 熬夜疲劳→需要咖啡因或糖分→但需考虑健康因素 |
| 第60层 | 结合历史对话(如有) | 如果你之前提过“胃不好”,这一层会记住并影响后续判断 |
| 第100层 | 组织语言,生成自然回答 | “建议喝一杯美式咖啡提神,但如果胃不舒服,可以换成红茶或蜂蜜水。” |
两个关键补充概念:
1. 激活函数(固定规则,不算参数)
每个神经元算出“总分”后,需要一个“阀门”来决定怎么处理这个分数。这个阀门叫激活函数,规则是:分数大于0就保留原值输出,小于等于0就输出0。
- 它不是参数:不参与“3万亿”的计数,所有神经元共用同一个固定的激活函数公式
- 它的作用:让网络具备处理复杂非线性问题的能力
2. MoE混合专家架构(含激活参数,算参数)
3万亿参数如果每次全部计算,成本极高。MoE的核心思路是:只调用最懂当前问题的那部分“专家”来回答,而不是把所有专家都拉出来。
用“医院挂号”来理解:
| 对比 | 传统稠密模型 | MoE混合专家模型 |
|---|---|---|
| 工作方式 | 全院所有科室一起会诊 | 导诊员判断病情,只叫相关科室 |
| 每次推理成本 | 极高 | 大幅降低(只激活部分专家) |
| 类比 | 全院会诊 | 导诊分诊 |
实际中,一个总参数3万亿的MoE模型,每次处理问题时可能只激活3000亿个参数,其余2.7万亿处于“休眠”状态。
关于“激活参数”的正确理解:
在MoE架构中,“激活参数”指的是当前任务中被路由网络选中并唤醒的那部分“专家”内部的参数。它不是一个独立的参数类型,而是一个描述状态的说法——本质上是“正在被使用的权重和偏置”。同一个专家,这次被激活时它的参数就是“激活参数”,下次没被激活时就是“沉睡参数”。
| 概念 | 具体指什么 | 算不算“3万亿总参数”? |
|---|---|---|
| 权重/偏置 | 每个神经元输入的重要性 + 先天倾向 | 算(绝大部分) |
| 激活函数 | 固定不变的“阀门规则” | 不算 |
| 路由网络参数 | “导诊员”自己的判断参数 | 算(占比很小) |
| 激活参数 | 当前任务中被唤醒的那部分“专家”内部的权重和偏置 | 算(是权重/偏置的一部分,按需激活) |
第四部分:为什么不是“越大越好”?——代价与平衡
3万亿参数赋予的能力:
- 更大的“容量”去记忆复杂模式;
- 更精细的知识编码和上下文推理;
- 当层数和参数足够多时,会“涌现”出训练时未专门教过的能力(如三步逻辑推理、创意生成)。
伴随的巨大代价:
- 训练成本:需数万张顶级GPU连续运行数月,电费达数亿美元。
- 存储占用:仅模型文件就需约12TB显存(FP32训练态,推理量化后通常大幅降低)。
- 推理成本:每次回答都要计算全部参数,运营成本远高于小模型。
关键认知:
- 参数规模不是唯一指标,训练数据的质量同样关键。
- MoE架构可以在保证效果的同时大幅降低推理成本。
第五部分:当前大模型参数规模版图
全球头部大模型已进入万亿级别,国产开源模型表现亮眼。
全球前沿模型(估算值):
| 梯队 | 模型 | 估算参数规模 |
|---|---|---|
| 第一梯队 (3万亿+) | GPT-5、Claude Opus 4.7、Grok-4等 | 3.2万亿 ~ 10万亿 |
| 第二梯队 (1-3万亿) | GPT-4.1、Claude Sonnet 4.6、Gemini 2.5 Pro | 1.2万亿 ~ 2.2万亿 |
国产大模型突破:
| 模型 | 参数规模 | 亮点 |
|---|---|---|
| Kimi K3 | 2.8万亿 | 全球参数最大的开源模型 |
| MiniMax M3 Pro | 约2.7万亿 | 进入2-3万亿俱乐部 |
| 阿里千问 Qwen3.8-Max | 2.4万亿 | 代码工程、深度推理表现出色 |
| DeepSeek V4 Pro | 1.6万亿 | 后训练技术优秀,性能强劲 |
总结
| 维度 | 核心结论 |
|---|---|
| 神经网络是什么 | 无数个“打分决策器”串联并联,每个只做乘加运算和过门槛判断 |
| 微观原理 | 每个神经元 = 输入×权重 + 偏置 → 过激活函数门槛 → 输出 |
| 激活函数 | 固定不变的“阀门规则”,不是参数,不参与3万亿计数 |
| 激活参数 | MoE中当前被唤醒的专家内部的权重和偏置,本质是“正在被使用的参数”,计入3万亿总参数,按需激活 |
| 训练是什么 | 把3万亿个随机“旋钮”协同拧成能正确预测的精准数值 |
| “旋钮”怎么理解 | 每个权重和偏置在存储上独立,但训练中相互牵连,必须协同配合 |
| MoE架构 | “导诊分诊”机制,总参数3万亿但每次只激活约3000亿,大幅降低成本 |
| 层数的意义 | 底层处理“文字碎片”,顶层理解“完整意图”,层层抽象出人类概念 |
| 对话举例 | “熬夜喝什么”→从拆字→词义→句法→意图→推理→上下文→生成回答 |
| 现实平衡 | 参数大小≠智商高低,还需优质数据、架构设计(如MoE)共同作用 |
| 当前格局 | 头部模型竞争进入数万亿参数级别,国产开源模型正快速追赶 |
最后一句话:神经元的乘加运算就像砖块,几千层的堆叠和3万亿个相互牵连的旋钮就是设计图纸与建材总量,最终“涌现”出的智能,就是那座能抗风雨、容纳万人的摩天大楼。读懂这些数字背后的逻辑,比单纯比较大小更有价值。
AI
评论已关闭