从最早只能做简单分类的人工神经元,到今天能够写作、编程、看图、搜索资料和操作工具的大语言模型,中间并不是单纯把模型越做越大。真正的进化至少有五条主线:从数据中自动学习特征,理解词语之间的远距离关系,先大规模学习再适应新任务,学会遵循人的意图并进行多步推理,以及从单纯生成文字发展为能够调用工具和执行任务的 Agent。
一张时间表
| 时期 | 关键进化 | 通俗理解 |
|---|---|---|
| 1943—1958 | 人工神经元、感知机 | 把神经元简化成一个加权投票器 |
| 1980s | 多层网络、反向传播 | 做错题后,把责任逐层追溯并调整 |
| 1990s—2000s | RNN、LSTM、神经语言模型 | 给网络增加短期记忆,让它按顺序读文字 |
| 2012—2016 | GPU、词向量、Seq2Seq、注意力 | 词语有了坐标,模型能翻译并按需回看原文 |
| 2017 | Transformer | 所有词可以同时观察其他相关词 |
| 2018—2020 | GPT、BERT、预训练、规模化 | 先读海量文本,再适应各种任务 |
| 2021—2022 | Scaling Laws、CoT、RLHF、RAG、MoE | 更科学地扩大模型,让它打草稿、听人话、会查资料 |
| 2023—2024 | 多模态、开源模型、工具调用、Agent | 不只聊天,还能看图、运行代码、搜索和操作软件 |
| 2024—2026 | 推理模型、测试时计算、长任务、多 Agent | 回答前投入更多计算,并把复杂任务拆开执行 |
| 2026 | GPT-5.6 等模型家族 | 模型成为推理、工具和编排系统的核心 |
人工神经元:把思考变成数字计算
1943 年,McCulloch 和 Pitts 提出一种极简的神经元模型:接收若干输入,计算加权总和,超过阈值就激活。它证明了神经元网络可以表达逻辑运算。原始论文
可以把一个神经元想成一次投票:每项输入都有不同的重要程度,把所有票数加起来,超过门槛就输出结果。
1958 年,Rosenblatt 提出感知机,使权重可以根据样本自动调整。感知机论文
但单层感知机只能画一条直线来区分数据。现实问题通常不是线性的,因此需要很多层神经元共同工作。
反向传播:让多层网络真正学得动
多层网络首先遇到的问题是:最后答错了,前面几百万个参数分别该承担多少责任?
反向传播解决了这个责任分配问题:网络先给出答案,用损失函数衡量错了多少,再从输出层向前追溯每个参数对错误的贡献,最后沿着能够减小错误的方向微调参数。
它像老师批改一条很长的解题过程,不只是说答案错了,还会指出每一步应该怎样调整。1986 年的经典论文展示了反向传播如何让隐藏层自动学出有用特征。Rumelhart、Hinton 与 Williams
神经网络中的学习,本质上大多就是不断调整这些权重。
RNN 与 LSTM:网络开始拥有记忆
普通神经网络每次只处理固定输入,语言却有顺序。为了理解一句话后面的代词,模型必须记得前面出现过什么。
循环神经网络 RNN 会把上一步的状态传给下一步,像一个人边读边在脑中保留摘要。但句子一长,早期信息会逐渐消失,这就是长期依赖和梯度消失问题。
1997 年出现的 LSTM 增加了几个门,用来决定什么信息写入记忆、什么继续保留、什么应该忘掉,以及什么时候读取。它像一个有橡皮擦和书签的笔记本,而不是只能不断覆盖的便签。LSTM 随后长期用于语音识别、翻译和文本生成。
词向量:词语从编号变成空间坐标
早期系统把每个词当成互不相关的编号,模型看不出猫和狗比猫和冰箱更相似。
神经语言模型开始把词表示成向量,也就是高维空间里的坐标。含义相近、用法相似的词,会被放到相近的位置。2003 年的神经概率语言模型已经能够同时学习词的分布式表示和下一个词的概率;2013 年 Word2Vec 又让大规模词向量训练变得高效。神经概率语言模型、Word2Vec
今天模型处理的通常不是完整单词,而是 token。一个生僻词可能被拆成几个常见片段,这样不需要为世界上的每个词单独准备词典。
Seq2Seq 与注意力:不再把整句话硬塞进一张便签
2014 年,Seq2Seq 使用一个网络读取输入,再由另一个网络输出结果,在机器翻译上取得突破。Seq2Seq 论文
但它试图把整段输入压缩成一个固定长度向量,就像读完一篇文章后,只允许在一张便签上写摘要,再根据便签翻译全文。
注意力机制改变了这一点:生成每个词时,模型可以回头查看输入中最相关的位置。例如翻译 bank 时,根据上下文决定关注 river 还是 money。Bahdanau Attention
注意力的本质是:当前这个词,应该从其他哪些词那里读取信息,各读多少?
Transformer:现代大语言模型的骨架
2017 年的 Transformer 抛弃了按顺序运行的 RNN,把注意力变成核心计算方式。Attention Is All You Need
可以把一句话想成一个会议室。每个 token 都是一个参会者,每个人根据当前问题寻找相关的人。代词可能重点听它所指代的名词,一个多义词则会重点参考决定其含义的上下文。多层注意力不断组合这些关系,形成更抽象的理解。
Transformer 的关键优势是可以并行训练。RNN 像一个人从头读到尾;Transformer 可以让大量计算单元同时处理整段文字,这与 GPU、TPU 和分布式训练非常契合。
多头注意力允许模型同时从语法、指代、位置和主题等不同角度观察关系;残差连接则像给信息修了一条跨层高速公路,让深层网络更容易训练。ResNet 论文
GPT 与 BERT:先读书,再做题
GPT 是 Generative Pre-trained Transformer,也就是生成式预训练 Transformer。
预训练时,模型阅读海量文本,反复预测下一个 token。为了预测得更准,它不得不逐渐学会词法、语法、常见事实、文体、代码结构,以及人类文本中表现出来的一部分逻辑和推理模式。
这很像让一个学生阅读极其庞大的图书馆,但训练目标始终只是猜下一个片段。读完以后,再用少量任务数据教它分类、问答、摘要或对话,这一步叫微调。
2018 年,GPT-1 证明了生成式预训练再针对任务微调的通用性。GPT-1
同期的 BERT 会同时查看一个词左右两边的上下文,更适合理解、分类和信息抽取;GPT 采用从左到右生成,更自然地适合续写和对话。BERT 论文
GPT-2、GPT-3:规模本身开始产生通用能力
GPT-2 将模型、数据和训练规模扩大,发现只靠预测下一个词,模型就开始表现出零样本问答、摘要和翻译能力。GPT-2
GPT-3 进一步扩大到 1750 亿参数,并展现出上下文学习能力:不修改模型参数,只在提示词里给几个例子,它就能模仿新任务。这相当于模型不仅做过很多题,还在预训练中学会了从示例猜测当前游戏规则。GPT-3 论文
Scaling Laws 研究显示,模型损失与参数量、数据量、计算量之间存在相对平滑的幂律关系。研究者因此可以用较小实验预测扩大训练规模后的收益。Scaling Laws
不过后来的 Chinchilla 研究指出,不能只增加参数而不给足数据。在固定算力下,模型大小与训练 token 数需要更合理地共同增长。它用更小但训练更充分的模型超过了若干更大的模型。Chinchilla 论文
因此,现代模型竞争不再只是参数多少,还包括数据质量、去重、数据与参数配比、训练稳定性、推理成本和后训练质量。
指令微调与 RLHF:从续写器变成助手
纯预训练模型的本能是续写,而不是帮助用户。你问它怎样煮面,它可能续写成论坛讨论、广告或另一段问题,因为它只学过什么文字最可能接在后面。
指令微调用问题和理想回答告诉模型:现在你的角色是完成用户交代的任务。
RLHF,也就是基于人类反馈的强化学习,则让模型生成多个候选,由人类判断哪个更好,再训练一个奖励模型学习这些偏好,最后用奖励信号继续调整语言模型。InstructGPT 的实验中,较小的对齐模型甚至比大得多的原始 GPT-3 更受人类偏好。InstructGPT 论文
后来又出现 DPO 等更简单的偏好优化方法,不必完整运行复杂的强化学习流程。DPO 论文
可以把它概括成三层:预训练负责有知识、有语言能力;指令训练负责知道用户正在让它做事;偏好训练负责知道什么样的做法更有帮助、更安全。
推理能力:允许模型先打草稿
普通语言模型倾向于立即输出下一个答案,复杂数学、代码和规划却需要中间步骤。
Chain-of-Thought 研究表明,让足够大的模型先生成中间推理步骤,能够明显改善算术、常识和符号推理。思维链论文
直接回答相当于只允许学生填写最终答案;推理模式相当于允许使用草稿纸;更高的 reasoning effort 则相当于给学生更多草稿时间。
2024 年后的推理模型进一步使用强化学习和测试时计算:模型不仅在训练时学得更多,还能在回答困难问题时投入更多计算,检查路径并尝试替代方案。
不过,展示出来的解释不一定等于模型真实、完整的内部计算过程。写出推理步骤和内部具备可靠推理能力,也不是完全相同的事情。
RAG、工具调用与 Agent:承认大脑不必记住一切
模型参数是一种模糊压缩的记忆。它适合保存通用模式,却不适合确保每个事实都准确、最新。
RAG,也就是检索增强生成,会先从文档或数据库查找资料,再让模型根据资料回答。它相当于把闭卷考试改成开卷考试。RAG 论文
工具调用则允许模型生成结构化指令,去搜索网页、查询数据库、调用天气 API、运行代码或修改文件。工具返回结果后,模型再判断下一步。Toolformer 和 ReAct 等研究展示了模型如何在推理过程中选择工具并结合外部反馈。Toolformer、ReAct
于是出现了 Agent 循环:理解目标,制订计划,调用工具,查看结果,修正计划,再继续执行。这是从会说到会做的关键一步。
多模态:文字、图片、声音进入同一个语义空间
早期语言模型只能处理文本。多模态技术让模型把图片、语音和视频转换为可以共同处理的内部表示。
CLIP 的思路很直观:给模型大量图片和文字描述配对,让图片编码器和文字编码器把匹配内容放到相近的位置。CLIP 论文
后续模型进一步把视觉能力接入语言模型。它们不仅能判断图里有什么,还能阅读图表和截图、结合图片推理、理解界面并操作电脑,同时处理文字、图片和文件;实时模型还可以直接理解和生成语音。
多模态的意义不是给聊天机器人添加一个 OCR,而是让不同感官信息参与同一套推理过程。
MoE、蒸馏和量化:模型变大,也要变便宜
大模型能力提升以后,成本成了核心问题。
MoE,也就是混合专家模型,内部有很多专家,但每个 token 只激活其中少数几个。它像一家大型医院:医院有很多科室,但一个患者不需要所有医生同时会诊。这样可以增加总参数,而不让每次计算成本同比增长。Switch Transformer
蒸馏是让小模型学习大模型生成的答案和行为,类似资深老师把解题经验传给学生。量化则降低保存和计算参数所需的精度,像把高清原图适度压缩,在尽量少损失质量的情况下减少显存和算力消耗。
这些技术推动了小模型、端侧模型和开放权重模型的发展。LLaMA 的早期工作也证明,训练充分的较小模型可以超过参数更多但训练不足的模型。LLaMA 论文
到 GPT-5.6:模型正在变成认知操作系统
截至 2026 年 8 月,OpenAI 公布的 GPT-5.6 家族包括 GPT-5.6 Sol、Terra 和 Luna:Sol 面向复杂推理和专业工作,Terra 平衡能力与成本,Luna 面向低成本、高吞吐任务;gpt-5.6 默认指向 GPT-5.6 Sol。官方模型目录
公开文档还列出了程序化工具调用、持久化推理、更高推理强度、Prompt 缓存、多 Agent 编排测试版,以及原尺寸图片输入等能力。OpenAI 2026 年 7 月更新
但这里必须划清边界:OpenAI 没有公开 GPT-5.6 的完整网络结构、参数量、训练数据和所有训练方法。因此,不能仅凭产品能力断言它内部一定采用了某种 MoE 架构或某个特定参数规模。
今天所谓的大模型,实际上越来越像一整套系统:基础模型加上推理时计算、长上下文、检索、工具、代码执行、记忆、多模态、Agent 编排、安全策略、评测和监控。
最核心的理解
如果把八十年的进化压缩成一句话:人们先发明了可以调权重的神经元,再解决如何训练深层网络、如何记住上下文、如何让词语彼此关联、如何并行学习海量文本,最后又通过人类反馈、推理时计算、检索和工具,把预测下一个 token 的模型包装成了能够理解目标并采取行动的智能系统。
但它的底层目标依旧很朴素:根据已经看到的内容,计算下一个 token 的概率。
它之所以看起来会写作、翻译、编程和推理,是因为要在海量人类文本中持续做好这个预测,模型被迫学习语言背后的结构。它并不是简单背诵数据库,却也不是像人一样理解世界;它是一种规模极大、能力惊人的模式学习与生成系统。
这也解释了它最大的矛盾:它非常擅长生成看起来合理的内容,但最可能的文字并不天然等于真实的事实。RAG、工具调用、验证器、推理模型和 Agent 工作流,正是在不断弥补这个根本缺口。