从M-P神经元到感知机再到BP神经网络

系列文章见: 《回忆AI时代-从图灵机到人工智能》

本章目录

关于神经网络的演进

1943年,神经生理学家Warren McCulloch(沃伦·麦卡洛克)与数理逻辑学家 Walter Pitts(沃尔特·皮茨)提出了人类历史上首个人工神经元数学模型,M-P神经元模型(McCulloch-Pitts Neuron),它是一种模仿生物神经元工作方式的计算模型,奠定了人工神经网络的理论基础。

但它很快遇到了一个关键问题,没有学习能力。模型中的权重需要人工设定,只能完成简单的逻辑推理任务(AND、OR 等),无法根据数据自动调整自身参数。


1948年,图灵在《Intelligent Machinery》中提出了”无组织机器(Unorganized Machines)”模型,系统探讨了由大量简单计算单元组成并能够学习的网络结构,虽然当时这些想法尚未真正落地,但这篇论文对后来的神经网络、机器学习以及深度学习的发展产生了深远影响,被认为是人工智能早期的重要理论基础之一。


1958年,心理学家和计算机科学家Frank Rosenblatt提出了感知机(Perceptron)。他在M-P模型的基础上引入了权重自动调整机制,使模型能够根据训练数据学习规律,从而解决了“无法训练”的核心缺陷。

感知机成为历史上第一个真正具备学习能力的神经网络模型,开启了机器学习研究的新阶段。

1969年,人工智能先驱Marvin Minsky与Seymour Papert合著了《Perceptrons》一书系统指出了单层感知机的核心局限,如

  • 只能解决线性可分问题;
  • 无法处理 XOR(异或)等非线性问题;
  • 网络结构过于简单,仅包含单层神经元。

此后1974–1980年间进入了AI的寒冬期。


1986年,David Rumelhart、Geoffrey Hinton和Ronald Williams等人,系统推广了BP神经网络(Backpropagation Neural Network)。

BP神经网络通过反向传播(Backpropagation)算法训练多层神经网络,使网络能够自动学习隐藏层中的复杂特征,成功解决了单层感知机无法处理XOR等非线性问题的缺陷。然而,随着网络层数增加,新的挑战也逐渐显现:

  • 计算量巨大,而当时 CPU 性能有限;
  • 容易出现梯度消失或梯度爆炸问题;
  • 缺乏大规模训练数据;
  • 存储和计算资源不足。

因此,神经网络研究在随后再次进入低潮期。

Read More

如何理解机器学习

系列文章见: 《回忆AI时代-从图灵机到人工智能》

什么是机器学习

机器学习(Machine Learning, ML)本质就是让计算机“通过数据自己学规律”,而不是人手写规则。

举个例子:如下房价面积表格,人一眼就能看出来这里的规律是”面积 * 2 = 房价“,机器学习的目标就是,不告诉机器公式,让它自己从数据中学出来。

面积(㎡) 房价(万)
50 100
60 120
70 140
80 160

用一个Python程序来举例学习房价表格的规律:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
 # 训练数据
x = [50, 60, 70, 80]
y = [100, 120, 140, 160]

# 机器随机猜一个参数
w = 1.0

# 学习率
lr = 0.0001

# 训练10000次
for epoch in range(10000):

grad = 0

# 计算梯度
for xi, yi in zip(x, y):
pred = w * xi
grad += (pred - yi) * xi

# 更新参数
w = w - lr * grad

print("学到的参数:", w)

# 预测
area = 90
price = w * area

print("90平米预测房价:", price)

运行结果大概:

1
2
学到的参数: 2.0
90平米预测房价: 180

程序运行逻辑:

1
2
3
4
5
6
7


算错多少

调整

再猜

譬如:

1
w = 1

于是

1
2
50㎡ -> 50万
60㎡ -> 60万

然后计算误差:

1
2
3
4
真实值: 100
预测值: 50

误差 = 50

根据误差调整参数:

1
w = w - lr * grad

最终 w=2,和我们人算出来的一样,这就是机器学习,用一句话解释它规则 + 数据 = 结果

Read More

1956年人工智能诞生的那个夏天!

系列文章见: 《回忆AI时代-从图灵机到人工智能》

达特茅斯会议

1956年夏天,在美国达特茅斯学院,一群科学家首次提出“Artificial Intelligence(人工智能)”这一名称,开启了AI时代的序幕。会议由 John McCarthy、Marvin Minsky、Claude Shannon 和 Nathaniel Rochester 发起,被视为人工智能学科的起点。2006年,在达特茅斯会议50周年纪念活动上,AI先驱们再次相聚。

照片拍摄于美国达特茅斯学院草坪(1956年) ,2006年达特茅斯AI会议50周年纪念合影(2026)。
达特茅斯50年再聚首

1956年达特茅斯会议照片,这7位科学家从上到下依次是:

  • 1.奥利弗・塞尔弗里奇 (Oliver Selfridge): 模式识别、机器感知领域先驱,被称作 “机器感知之父”,早期视觉 AI研究者。
  • 2.纳撒尼尔・罗切斯特 (Nathaniel Rochester) IBM资深研究员,达特茅斯会议四位发起人之一,最早研究人工神经网络的学者。
  • 3.马文・明斯基( Marvin Minsky ) AI 奠基人,MIT人工智能实验室联合创始人,1969 年图灵奖得主,框架理论创立者。
  • 4.约翰・麦卡锡( John McCarthy ) “人工智能(Artificial Intelligence)” 术语的创造者Lisp编程语言发明者,1971年图灵奖得主。
  • 5.雷・所罗门诺夫( Ray Solomonoff ) 通用人工智能、算法信息论先驱,提出所罗门诺夫归纳推理,奠定概率机器学习理论基础。
  • 6.赫伯特・西蒙 ( Herbert A. Simon ) 双料诺奖(诺贝尔经济学奖 + 图灵奖)得主,认知科学、符号主义 AI 核心奠基人,研究人类决策与机器逻辑推理。
  • 7.克劳德・香农 (Claude Elwood Shannon) 信息论之父,数字电路理论开创者,现代计算机、通信、信息科学的基石人物。

Read More

什么是大模型?它是如何工作的,应用场景又是什么?

系列文章见: 《回忆AI时代-从图灵机到人工智能》

什么是大模型

大模型(Large Model)通常指参数量非常庞大的人工智能模型,它就像一个经过海量知识训练的“数字大脑”,能够理解、推理、生成内容,并完成各种复杂任务。而LLM(Large Language Model,大语言模型) 是大模型中的一种。那大模型中什么叫“大”

  • 参数量大
  • 训练数据大
  • 计算规模大

参数量

模型/阶段 参数量
早期神经网络 几万 ~ 几百万
BERT 3.4 亿(340M)
GPT-3 1750 亿(175B)
现代大模型 数百亿 ~ 数万亿

训练数据大
大模型训练时会阅读海量数据,例如:

  • 书籍
  • 论文
  • 网站
  • 代码
  • 新闻
  • 对话数据

训练数据规模通常达到TB甚至PB级别。

计算规模大
训练一次先进大模型可能需要:

  • 数千张 GPU
  • 数周甚至数月训练时间
  • 数百万美元成本

大模型是怎么工作的

目前主流大模型基本基于:Transformer 架构(2017年提出)

1
2
3
4
5
6
7
8
9
10
11
12
13
海量数据

预训练(Pretraining)

获得语言能力

指令微调(SFT)

学会听懂人类指令

强化学习(RLHF)

更符合人类需求

大模型应用场景

大模型应用场景:

  • 文本能力
  • 推理能力
  • 多模态能力
文本能力 推理能力 多模态能力
* 写文章
* 写代码
* 翻译
* 总结
* 问答
* 鸡兔同笼
* 数学题
* 逻辑题
* 图片
* 语音
* 视频

MCP在Agent的作用是什么?

系列文章见: 《回忆AI时代-从图灵机到人工智能》

什么是MCP

MCP(Model Context Protocol,模型上下文协议),这是由Anthropic在2024年11月推出的一个开放协议,用来让 AI 模型能够以统一方式连接外部工具、类似AI Agent世界里的USB-C接口,它可以统一连接:

  • 数据库
  • 文件系统
  • GitHub
  • Slack
  • Notion
  • 浏览器
  • 企业内部系统
  • 各种 API

在MCP未出现之前:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
Claude
├── GitHub Tool
├── Notion Tool
├── Slack Tool

GPT
├── GitHub Tool
├── Notion Tool
├── Slack Tool

Gemini
├── GitHub Tool
├── Notion Tool
├── Slack Tool

有了MCP之后

1
2
3
4
5
6
7
8
9
   MCP Server
/ | \
GitHub Notion Slack
\ | /
MCP
|
----------------
| | |
Claude GPT Gemini

Read More

Skill在Agent中的作用是什么?

系列文章见: 《回忆AI时代-从图灵机到人工智能》

什么是Skill

2025年10月16日(October 16, 2025),Anthropic当天发布了技术文章《Equipping agents for the real world with Agent Skills》首次公开介绍 Agent Skills、SKILL.md 结构以及动态加载机制。

Skill是一种把知识、流程、代码和资源打包成可复用能力模块的机制,让Agent遇到特定任务时能够直接加载并执行,而不是每次都重新推理。

以下是传统Agent工作方式与有了skill工作方式:

传统 Agent 工作方式 Skill 工作方式
用户任务

LLM 思考

调用工具

继续思考

完成任务
用户任务

发现 SEO Skill

加载 Skill

执行预定义流程

完成任务

Skill在Agent中位置

1
2
3
4
5
6
7
8
9
               Agent

┌───────────┼───────────┐
│ │ │
▼ ▼ ▼
SEO Skill Coding Skill Research Skill
│ │ │
▼ ▼ ▼
Tools Tools Tools
  • Agent 负责选 Skill
  • Skill 负责完成任务
  • Tool 负责执行动作

Read More

机器可以思考吗?图灵用一篇论文开启AI时代

系列文章见: 《回忆AI时代-从图灵机到人工智能》

图灵简介

艾伦·麦席森·图灵(Alan Mathison Turing)1912年6月23日-1954年6月7日, 英国数学家、计算机科学家、逻辑学家和密码分析学家,被誉为计算机科学与人工智能之父。

艾伦图灵

1939年,第二次世界大战期间,图灵加入了英国密码破译中心Bletchley Park,德国军方使用Enigma(恩尼格玛密码机)进行通信加密,图灵设计改进了Bombe(炸弹机)用于快速破解密码获取德军的实时情报信息。

图灵团队大幅缩短了战争时间,间接挽救了数千万人的生命。

图灵设计的Bombe(炸弹机)原型。
炸弹机

对AI与计算机重要的贡献

学术界一般认为图灵一生共发过约18~25篇论文,之所以统计的不精确是因为图灵发的渠道不一样,如在期刊、二战期间保密的密码学报告(多年后才公开)和演讲稿等,但它对AI与计算机重要贡献的三篇论文:

1. 图灵机-计算机的鼻祖

1936年,发表了《On Computable Numbers》(中文译 “论可计算数”)这是图灵最著名的论文,被许多人认为是计算机科学的开山之作。图灵在剑桥大学国王学院(King’s College Cambridge)时思考一个非常简单的问题,当一个人在纸上进行计算时,他究竟在做什么?图灵没有从数学公式出发,而是从人的行为出发,他观察到计算员(Computer,当时指人工计算员)实际上是在:

1
2
3
4
读取一个符号
根据规则决定下一步
写入一个符号
移动到下一格

于是图灵想到,如果把这种行为抽象出来,会得到一种最简单的计算机器,这就是后来著名的图灵机(Turing Machine)。

注:它并不是一台真实存在的机器,而是一种用于研究“什么问题能够被计算”的数学模型。

图灵机结构示意图
图灵机结构示意图

今天所有的计算机,本质上都是图灵机思想的工程实现。

图灵机 现代计算机
状态机 CPU
纸带 内存
读写头 CPU访问内存
状态转移表 程序

Read More