学习 AI
从零开始,系统学习人工智能。概念准确、循序渐进、可实操、可持续更新 —— 覆盖机器学习、深度学习、大语言模型与最新动态。
这是什么?
AI(人工智能 Artificial Intelligence)是研究如何让机器模拟人类智能的学科。本站从最基础的概念讲起,不需要任何前置知识。
怎么学?
按「学习路线图」分阶段推进:先通识 → 再理论 → 后实战。每章配里程碑检验,学完一章自测一次。
学到什么程度?
目标:能读懂主流 AI 资讯、理解模型原理、会用现成框架/API 完成小项目,并持续跟上「最新动态」栏目。
本站内容更新至 2026-08。AI 领域变化快,易变信息以标注时间为准。
2 · AI 基础概念
什么是人工智能?
人工智能(Artificial Intelligence, AI)是研究、开发用于模拟和扩展人类智能的理论、方法与技术的学科。「人工智能」一词由 John McCarthy 于 1956 年达特茅斯会议(Dartmouth Conference)正式提出,该会议被公认为 AI 学科诞生的标志。AI 的研究目标包括:
- 学习(Learning):从数据或经验中获取知识
- 推理(Reasoning):基于知识进行逻辑推导与决策
- 感知(Perception):理解图像、声音、传感器等输入
- 语言理解(Language Understanding):理解并生成自然语言
- 规划与决策(Planning & Decision-making):在不确定环境中采取行动达成目标
AI 是交叉学科,主要子领域包括:机器学习(Machine Learning)、计算机视觉(Computer Vision)、自然语言处理(Natural Language Processing, NLP)、语音识别、知识表示与推理(Knowledge Representation)、机器人学(Robotics)、多智能体系统(Multi-agent System)等。
图灵测试(Turing Test)
1950 年,Alan Turing 在论文《Computing Machinery and Intelligence》中提出:若一台机器能在文字对话中让人类无法区分它与真人,则可以说它具有智能。该思想实验即「图灵测试」。它定义了「行为主义」的智能判断标准,至今仍是讨论 AI 能力时的重要参照(注意:当代大模型在部分对话场景已能通过类似测试,但这不意味着真正理解)。
AI ⊃ 机器学习 ⊃ 深度学习 ⊃ 大模型
| 概念 | 英文 | 关系与说明 |
|---|---|---|
| 人工智能 | AI | 最广的学科范畴,涵盖知识表示、搜索、规划、感知、自然语言处理等。 |
| 机器学习 | Machine Learning | AI 的子领域:让程序从数据中自动学习规律,而非显式编程。 |
| 深度学习 | Deep Learning | 机器学习的子领域:基于多层神经网络(Neural Network)的方法。 |
| 大语言模型 | LLM | 深度学习在语言领域的规模化应用:基于 Transformer 的预训练模型。 |
它们的关系是层层包含:AI 包含 ML,ML 包含 DL,DL 在语言领域的规模化产物即大语言模型。理解这层包含关系,是读懂一切 AI 资讯的前提。
发展简史(时间线)
Turing 发表《Computing Machinery and Intelligence》,提出图灵测试。
达特茅斯会议,AI 学科正式诞生(符号主义主导)。
符号主义黄金期:逻辑推理、搜索、感知机(Perceptron, 1958)。
第一次「AI 寒冬」:算力与数据不足,早期承诺未能兑现,经费削减。
专家系统(Expert System)复兴,如医疗诊断系统 MYCIN;1986 年反向传播(Backpropagation)算法被系统化推广。
统计学习复兴:支持向量机、随机森林;1997 年深蓝(Deep Blue)战胜国际象棋世界冠军卡斯帕罗夫。
IBM Watson 在问答节目《危险边缘》中战胜人类冠军。
AlexNet 在 ImageNet 竞赛大幅胜出(top-5 错误率从约 26% 降至 15.3%),深度学习爆发。
AlphaGo 以 4:1 战胜围棋世界冠军李世石,深度学习+强化学习引起全球关注。
论文《Attention Is All You Need》提出 Transformer,奠定大模型基础。
预训练大模型时代:GPT-1(2018)、BERT(2018)、GPT-3(2020)、扩散模型(Diffusion Model)兴起。
ChatGPT(2022-11)引爆生成式 AI(AIGC);多模态模型、AI Agent、推理模型(Reasoning Model)快速发展。
AI 的分类
| 类型 | 英文 | 说明 |
|---|---|---|
| 弱人工智能 | Narrow AI | 只在特定任务上超过人类,如人脸识别、下棋、语音助手。当前所有 AI 系统都属于此类。 |
| 强人工智能 | AGI | 在所有认知任务上达到人类水平。目前尚未实现,属前沿研究目标。 |
| 超人工智能 | ASI | 假设性的、全面超越人类的智能,目前仅为哲学与伦理议题。 |
AI 能做什么 / 不能做什么
| ✅ AI 擅长(当前) | ❌ AI 不擅长(当前) |
|---|---|
| 海量数据处理与模式识别 | 真正的理解与常识推理(模型是统计拟合,不是理解) |
| 固定规则/目标明确的重复任务 | 长链条多步推理(易出错,需人类校验) |
| 内容生成(文本/图像/代码) | 对生成内容的事实保证(幻觉问题未解决) |
| 7×24 小时稳定执行 | 在开放、动态、对抗环境中的鲁棒决策 |
| 跨语言、跨模态的检索与摘要 | 价值观判断、伦理取舍、真正的创造力 |
此表描述 2026 年 AI 的一般能力水平,随技术发展需持续修订。
常见误解澄清
「AI 有自我意识?」
无科学证据。当前大模型只是统计性地生成文本,不具备意识或情感。自称「有意识」的模型输出是训练数据模式的结果。
「AI 会取代所有工作?」
更准确的说法是改变工作形态:重复性、可自动化环节被替代,同时创造新岗位。具体影响因行业而异,协作型(Human-in-the-loop)岗位反而增加。
「AI 无所不能?」
否。AI 受训练数据与任务边界约束,会产生幻觉(Hallucination,编造看似合理的信息),需要人核实。
「AI 就是聊天机器人?」
聊天只是应用之一。AI 还用于医疗影像、自动驾驶、科学发现(如蛋白质结构预测)、代码生成、工业控制等广泛领域。
「AI 训练一次就一劳永逸?」
否。模型知识截止于训练时间,需要微调(Fine-tuning)或检索增强(RAG)补充新知识,并持续评估监控。
「开源模型和闭源模型差不多?」
各有取舍:闭源(如 GPT、Claude)通常能力更强、服务省心;开源(如 Llama、DeepSeek)可私有化部署、可控数据、可微调,适合企业敏感场景。
3 · 机器学习(Machine Learning)
机器学习是 AI 的核心子领域。经典定义(Tom Mitchell, 1997《Machine Learning》):「计算机程序从经验 E 中学习,若其在任务 T 上的性能 P 随经验 E 的提升而提高。」
机器学习与传统编程的本质区别
| 传统编程 | 机器学习 | |
|---|---|---|
| 思路 | 人写规则(if/else),机器执行 | 人给数据,机器学规则 |
| 适用 | 规则清晰、可枚举(如计算器) | 规则难写但数据丰富(如图像识别、垃圾邮件) |
| 质量瓶颈 | 规则的完备性 | 数据的质量与数量 |
三大学习范式
| 范式 | 英文 | 原理 | 案例 |
|---|---|---|---|
| 监督学习 | Supervised Learning | 用带标签的数据(输入→正确答案)学习映射 | 垃圾邮件识别(分类)、房价预测(回归) |
| 无监督学习 | Unsupervised Learning | 从无标签数据中发现结构 | 用户分群(聚类)、数据降维 |
| 强化学习 | Reinforcement Learning | 智能体与环境交互,通过奖励信号学习策略 | AlphaGo、游戏 AI、机器人控制 |
经典算法(直觉 + 适用场景)
线性回归 回归
拟合一条直线/超平面使误差平方和最小。直觉:找到最贴近所有点的线。适用:房价、销量等连续量预测。
逻辑回归 分类
线性结果经 Sigmoid 函数映射为概率(0-1)。直觉:算「属于某类的概率」。适用:二分类,是分类任务基线。
决策树 / 随机森林
按特征逐层「是/否」划分;随机森林用多棵随机树投票。直觉:把判断写成问题树。适用:表格数据、需要解释性的场景。
SVM 支持向量机
找能分开两类且间隔最大的超平面,可用核技巧(Kernel Trick)处理非线性。直觉:划一条「最居中」的边界。适用:中小规模高维数据。
KNN 最近邻
新样本看最近的 K 个邻居投票。直觉:物以类聚。适用:小数据量、低维场景;大数据量时计算慢。
K-Means 聚类
迭代地把样本归到最近的簇中心(需先指定 K)。直觉:把数据分成 K 堆。适用:用户分群、图像压缩、异常检测。
朴素贝叶斯
基于贝叶斯定理,假设特征相互独立。直觉:按「词出现的概率」判断类别。适用:文本分类(垃圾邮件、情感分析)。
XGBoost
梯度提升决策树(GBDT)的工程化代表,含正则化与并行优化。直觉:一棵棵「纠错树」接力。适用:表格数据竞赛与工业场景常胜算法。
模型训练流程(标准 7 步)
- 数据采集(Data Collection):明确预测目标,收集足够且有代表性的样本;标注(Label)质量直接决定上限。
- 数据清洗:处理缺失值(删除/填充)、重复样本、异常值(Outlier);处理类别不平衡(欠采样/过采样)。
- 特征工程(Feature Engineering):特征选择(去冗余)、类别编码(One-hot)、归一化/标准化(Normalization,量纲统一)、必要时降维(PCA)。
- 划分数据集:训练集 / 验证集 / 测试集(常见比例 7:2:1);分类任务用分层抽样(Stratified Split)保持类别分布一致。
- 选择模型并训练:按任务类型选算法,定义损失函数(Loss)与优化器,在训练集上迭代更新参数。
- 在验证集上调参:用验证集(Validation Set)比较不同超参数与模型,防过拟合。
- 在测试集上做最终评估:测试集只用一次,得到无偏的性能估计,然后部署上线。
核心评估指标
| 指标 | 说明 | 适用 |
|---|---|---|
| 准确率 Accuracy | 预测正确的比例 | 类别均衡时 |
| 精确率 Precision | 预测为正的样本中真正为正的比例 | 误报代价高时 |
| 召回率 Recall | 真正为正的样本中被找出的比例 | 漏报代价高时(如癌症筛查) |
| F1 分数 | 精确率与召回率的调和平均 | 类别不平衡时 |
| AUC-ROC | 分类阈值无关的综合排序能力 | 二分类整体评估 |
过拟合(Overfitting):模型在训练集表现极好、在测试集表现差(记住而非泛化);欠拟合(Underfitting):模型过于简单,两边都差。缓解方法:更多数据、正则化(Regularization:L1/L2、Dropout)、交叉验证(Cross-validation)、简化模型或降低特征维度。
偏差-方差权衡(Bias-Variance Tradeoff):欠拟合对应高偏差(模型太简单、假设太强),过拟合对应高方差(对训练数据太敏感)。调参的本质就是在两者间找平衡点,交叉验证是寻找平衡的标准工具。
4 · 深度学习(Deep Learning)
深度学习使用多层神经网络自动学习数据中的层次化特征,是当前图像、语音、语言领域的主流方法。
神经网络基础
- 神经元(Neuron):接收多个输入 → 加权求和(权重 w × 输入 x + 偏置 b)→ 过激活函数 → 输出。一层网络就是「一次线性变换 + 一次非线性」。
- 激活函数(Activation Function):引入非线性。没有它,多层网络会退化成单层线性变换。常用:ReLU(默认首选,缓解梯度消失)、Sigmoid(输出 0–1,用于二分类概率)、Tanh(输出 -1 到 1)。
- 前向传播(Forward Propagation):输入从输入层流经隐藏层到输出层,得到预测值。
- 损失函数(Loss Function):衡量预测与真实值的差距。回归用均方误差(MSE),分类用交叉熵(Cross-Entropy)。
- 反向传播(Backpropagation):用链式法则(Chain Rule)从输出层向输入层逐层计算梯度(误差回传)。
- 梯度下降(Gradient Descent):按损失负梯度方向更新参数:w ← w − η·∂L/∂w。学习率(Learning Rate, η)决定步长:过大震荡不收敛,过小训练缓慢。
- 一次完整训练迭代:前向传播 → 计算损失 → 反向传播求梯度 → 更新参数 → 重复(一个 Epoch 即遍历全部数据一轮)。
动手理解:手写数字识别(MNIST)
MNIST 是 28×28 像素的手写数字(0–9)数据集,堪称深度学习的「Hello World」。一个全连接网络:784 个输入像素 → 隐藏层(如 128 个神经元)→ 10 个输出(每个数字的概率)。训练后正确率可达 99%+。理解这个例子,就能理解「输入 → 特征 → 分类」的完整链路;它也是无数教程(含 3Blue1Brown 的神经网络系列视频)的首选演示。
卷积神经网络(CNN)
CNN(Convolutional Neural Network)专为图像等网格数据设计,两大核心操作:
- 卷积(Convolution):小卷积核(如 3×3)滑过图像提取局部特征。局部感受野 + 权值共享使参数量远小于全连接,且天然具有平移不变性。
- 池化(Pooling):对局部区域降采样(常用最大池化 Max Pooling),压缩尺寸、保留关键信息、增强鲁棒性。
经典结构演进:LeNet(1998)→ AlexNet(2012,深度学习引爆点)→ VGG(2014)→ ResNet(2015,残差连接 ResNet 解决深层退化问题)。应用:图像分类、目标检测、语义分割、人脸识别、医学影像。
循环神经网络(RNN / LSTM)
RNN(Recurrent Neural Network)按时间步处理序列,当前步的输出依赖上一步的隐状态。LSTM(长短期记忆网络)通过门控机制(输入门/遗忘门/输出门)缓解长序列的梯度消失问题。局限:串行计算无法并行、长距离依赖仍然薄弱——如今文本任务多数已被 Transformer 取代,LSTM 仍用于部分时序预测场景。
Transformer 架构(重点)
2017 年论文《Attention Is All You Need》(Vaswani et al.)提出 Transformer,核心机制:
- 自注意力(Self-Attention):每个词生成 Query / Key / Value 三个向量,用 Q·K 计算该词与序列中所有词的注意力权重,再对 V 加权聚合。直觉:让每个词「自己决定该关注哪些词」。
- 位置编码(Positional Encoding):注意力本身不感知顺序,需注入位置信息。
- Encoder-Decoder 结构:编码器理解输入,解码器生成输出(GPT 类模型只用 Decoder,BERT 类只用 Encoder)。
相比 RNN 的两大优势:可并行计算(训练快)与长距离依赖(任意两词直接关联)。配合规模定律(Scaling Law:模型越大、数据越多,性能持续提升),Transformer 成为大模型时代的基石。
训练要点
- 正则化:Dropout(随机丢弃神经元)、权重衰减(Weight Decay, L2)、早停(Early Stopping)、数据增强(Data Augmentation,如图像旋转/翻转)。
- 归一化:Batch Normalization 稳定中间层分布、加速收敛(Transformer 类模型多用 Layer Normalization)。
- 关键超参数:学习率(可配学习率调度 Learning Rate Schedule)、批大小(Batch Size)、网络深度与宽度、训练轮数(Epochs)。
- 优化器:Adam(自适应学习率,实践默认首选)、SGD + 动量(Momentum)。
- 硬件:深度学习训练依赖 GPU(NVIDIA CUDA 生态最成熟);显存不足时用小批大小或梯度累积;无 GPU 可用 Google Colab / Kaggle 免费云端。
5 · 大语言模型与生成式 AI
什么是 LLM?
大语言模型(Large Language Model, LLM)是基于 Transformer 的、在大规模文本上预训练的语言模型。衡量规模的三个维度:参数量(数十亿到数万亿)、训练数据量与上下文窗口(一次能处理的 token 数)。Token 是文本的最小切分单元(约 1 个英文单词或 1 个汉字左右),模型按 token 逐个生成输出。
LLM 是怎么「训练」出来的(三步)
- 预训练(Pretraining):在海量互联网文本上自监督学习——反复练习「预测下一个 token」,学到语言规律与海量知识(成本最高,动辄千万美元级算力)。
- 监督微调(SFT):用高质量「指令→期望回答」数据微调,让模型从「会接话」变成「会听话」(遵循指令)。
- RLHF(基于人类反馈的强化学习):人类对多个回答排序打分,用奖励模型指导模型对齐人类偏好(更有用、更无害)。InstructGPT 与 ChatGPT 均采用此路线。
这也是为什么 ChatGPT 给人的感觉像「对话」而非「接龙」——本质仍是逐 token 预测,只是经过了指令对齐。
关键概念
| 概念 | 英文 | 说明 |
|---|---|---|
| 预训练 | Pretraining | 在海量文本上自监督学习语言规律(预测下一个词)。 |
| 监督微调 | SFT | 用高质量指令-回答数据微调,让模型学会遵循指令。 |
| RLHF | RLHF | 基于人类反馈的强化学习,对齐人类偏好(如 InstructGPT、ChatGPT 的做法)。 |
| 上下文学习 | In-Context Learning | 不更新参数,仅通过提示词中的示例让模型完成任务(Few-shot)。 |
| 幻觉 | Hallucination | 模型生成看似合理但实际错误/虚构的内容,是当前重要挑战。 |
| 温度 | Temperature | 控制输出随机性的超参数:低温度更稳定保守,高温度更多样有创意。 |
Prompt 工程(提示词工程)
Prompt 是与模型交互的「输入界面」,写得好坏直接影响输出质量。四要素详解:
- 角色(Role):让模型扮演专家,如「你是一位资深数据分析师」——约束输出视角与专业度。
- 任务(Task):明确动词与对象,如「总结以下文章的 3 个要点」。
- 约束(Constraints):限定格式与边界,如「200 字以内、用 Markdown 列表、不要猜测不确定的事实」。
- 示例(Examples):给 2–3 个「输入→期望输出」范例(Few-shot),比任何抽象描述都有效。
RAG(检索增强生成)
RAG(Retrieval-Augmented Generation)是解决「知识时效」与「幻觉」的主流工程方案,流程:
- 检索(Retrieval):把用户问题转成向量,在知识库(文档、数据库、网页)中检索最相关的片段(向量相似度检索)。
- 增强(Augment):把检索到的片段拼入提示词,作为「参考材料」。
- 生成(Generation):模型基于参考材料回答,并要求标注引用来源。
RAG 让模型「先查资料再回答」,适用于企业知识库问答、客服、法律/医疗文档辅助等场景,也是让开源模型低成本接入私有数据的首选方案。
AI Agent(智能体)
AI Agent = 大模型(大脑)+ 工具调用(Function Calling) + 规划(Planning)+ 记忆(Memory)。典型工作方式:接收目标 → 拆解为子任务 → 调用工具(搜索、写代码、操作软件)→ 观察结果 → 迭代直到完成。当前热点方向,已在代码生成、浏览器操作、工作流自动化等场景落地;可靠性、安全性与成本仍是主要挑战,能力边界尚无定论。
主流模型概览 更新至 2026-08
⚠️ 模型迭代极快,以下仅作入门认知,具体能力以官方最新发布为准。
| 系列 | 厂商 | 特点 |
|---|---|---|
| GPT 系列 | OpenAI | ChatGPT 的基座,通用对话与推理。 |
| Claude 系列 | Anthropic | 强调安全对齐,长文本能力强。 |
| Gemini 系列 | 原生多模态(文本/图像/音频/视频)。 | |
| DeepSeek 系列 | 深度求索 | 开源 + 高性价比,推理模型 DeepSeek-R1 等。 |
| Llama 系列 | Meta | 开源生态标杆,可本地部署与微调。 |
AIGC 应用
- 文本生成:写作、翻译、摘要、代码(Copilot 类工具)
- 图像生成:扩散模型(Diffusion Model,如 Stable Diffusion、DALL·E)
- 语音:语音合成(TTS)、语音识别(ASR)、实时翻译
- 视频:文生视频、数字人、视频修复
- 多模态:图文理解、视觉问答(VQA)、图像编辑
- 科学:蛋白质结构预测(AlphaFold)、代码/数学推理辅助
LLM 的能力与局限(务实认知)
| ✅ 强项 | ⚠️ 局限 |
|---|---|
| 通用对话、摘要、翻译、改写 | 知识截止于训练时间,新知识靠 RAG/微调补充 |
| 代码生成与解释 | 复杂长链推理易出错(幻觉),需校验 |
| 跨语言、长文本处理 | 长上下文有「迷失中间」现象,重要信息放开头/结尾更稳 |
| 快速原型与创意辅助 | 无真实世界感知与价值观判断,高风险决策需人工把关 |
6 · 学习路线图
按背景选择路线,每个阶段包含「学什么 / 练什么 / 里程碑检验」。
三条路线总览
| 路线 | 阶段一:入门(1–2 月) | 阶段二:进阶(2–4 月) | 阶段三:实战 |
|---|---|---|---|
| A. 零基础新手 | Python 基础 + AI 概念扫盲 | 机器学习基础 + 数学基础 | 用现成 API/库做小项目 |
| B. 开发者转 AI | 复习 Python 与数学 | 机器学习 + 深度学习框架 | 端到端项目 + Kaggle 竞赛 |
| C. 非技术从业者 | AI 通识 + 行业应用 | Prompt 工程 + AI 工具实操 | 业务场景落地 |
路线 A:零基础新手(推荐从这开始)
阶段一(1–2 月):学 Python 基础(变量、循环、函数、列表/字典);读本站「AI 基础概念」;练:写 20 个小脚本(计算器、猜数字、文本统计)。里程碑:能独立写 100 行以内的小程序。
阶段二(2–4 月):学机器学习基础与线性代数/概率初步;练:用 Scikit-learn 跑通鸢尾花分类、房价回归。里程碑:能讲清训练集/测试集、过拟合、评估指标。
阶段三(持续):选一个方向做小项目(图像分类、情感分析、问答机器人);练:用 Hugging Face 现成模型 + API 做应用。里程碑:产出一个可展示的完整项目。
路线 B:开发者转 AI
阶段一:快速复习 Python(NumPy/Pandas 熟练使用)与大学数学。里程碑:能熟练做数据清洗与探索性分析。
阶段二:学完本站机器学习 + 深度学习章节;上手 PyTorch 复现 CNN、Transformer 小例子。里程碑:独立实现并训练一个图像分类模型。
阶段三:Kaggle 打比赛(泰坦尼克→房价→图像分类);读顶会论文(NeurIPS/ICML/ICLR)。里程碑:Kaggle 铜牌以上,或产出端到端部署项目。
路线 C:非技术从业者
阶段一:读完「AI 基础概念」+「大语言模型」章节,理解关键术语。里程碑:能向同事准确解释 AI/ML/LLM 的区别。
阶段二:系统学 Prompt 工程;熟练使用主流 AI 工具(对话、写作、制图、数据分析)。里程碑:建立自己的提示词模板库。
阶段三:结合本行业找 1–2 个落地场景(如文档处理、客户问答、报表生成),用 RAG 或现成工具实现。里程碑:跑通一个真实业务用例。
7 · 工具与框架
| 工具/框架 | 用途 | 学习优先级 | 官方文档 |
|---|---|---|---|
| Python | AI 生态第一语言,必备 | ★★★★★ | python.org |
| NumPy / Pandas / Matplotlib | 数值计算、数据处理、可视化 | ★★★★★ | numpy.org / pandas |
| Scikit-learn | 经典机器学习算法库 | ★★★★☆ | scikit-learn.org |
| PyTorch | 深度学习框架(推荐优先) | ★★★★★ | pytorch.org |
| TensorFlow / Keras | 深度学习框架(工业部署多) | ★★★☆☆ | tensorflow.org |
| Hugging Face | 预训练模型库与生态(Transformers) | ★★★★★ | huggingface.co |
| Jupyter Notebook | 交互式实验环境 | ★★★★☆ | jupyter.org |
| Kaggle | 数据集、竞赛、社区学习 | ★★★★☆ | kaggle.com |
| OpenAI / Anthropic API | 大模型应用开发 | ★★★★☆ | 各厂商官方文档 |
| LangChain | LLM 应用编排框架(RAG/Agent) | ★★★☆☆ | langchain.com |
| Ollama | 本地部署开源模型 | ★★★☆☆ | ollama.com |
8 · 数学基础(学到「够用」即可)
不需要成为数学家。理解「为什么需要」比死记公式更重要,多数公式可查。
线性代数
向量、矩阵、特征值。用于理解神经网络中的张量运算与权重。
概率与统计
分布、期望/方差、贝叶斯定理。用于理解模型不确定性、损失函数、评估指标。
微积分
导数、偏导数、链式法则。用于理解梯度下降与反向传播。
最优化
梯度下降及变体(SGD、Adam)。用于理解模型「如何训练」。
| 学习阶段 | 需要的数学 | 用途 |
|---|---|---|
| 入门(AI 通识) | 无需 | 读懂概念即可 |
| 机器学习基础 | 线性代数 + 概率初步 | 理解特征、相似度、贝叶斯 |
| 深度学习 | 微积分(导数/链式法则) | 理解梯度下降与反向传播 |
| 进阶/研究 | 最优化 + 统计推断 | 理解收敛性、泛化理论、论文 |
9 · 伦理、安全与合规
算法偏见与公平性
训练数据若含历史偏见,模型会放大歧视(如招聘、信贷场景)。需做偏见检测与公平性评估。
隐私与数据安全
训练数据可能包含个人信息;使用 AI 时注意不要上传敏感数据到第三方服务。
幻觉与错误信息
模型会自信地编造内容。重要场景(医疗、法律、新闻)必须人工核实。
对齐与可解释性
AI Alignment 研究如何让模型目标与人类意图一致;可解释性(XAI)研究如何理解模型决策。
监管动态 更新至 2026-08
- 欧盟《人工智能法案》(EU AI Act):全球首部全面 AI 监管法规,2024 年 8 月生效,分风险等级监管。
- 中国《生成式人工智能服务管理暂行办法》:2023 年 8 月 15 日施行,规范生成式 AI 服务提供者。
- 中国《人工智能生成合成内容标识办法》:2025 年 9 月 1 日施行,要求深度合成内容显式标识。
10 · AI 动态与趋势 人工精选 + 自动聚合
自动聚合权威来源(未审核)+ 人工精选解读(已审核)分层呈现。自动数据每 30 分钟刷新一次。
📌 本周精选(人工审核)
📡 实时动态(自动聚合 · 未审核)
正在加载最新动态…(如长时间无内容,可能为网络限制,请稍后刷新)
📊 趋势雷达(随聚合数据更新)
热度基于近 7 日聚合结果统计,仅作趋势参考。
🗒 更新日志
- 2026-08-18:深度填充核心知识栏目(基础概念/机器学习/深度学习/大模型)与增强栏目(v0.2)
- 2026-08-18:网站骨架上线(v0.1)
11 · 资源库 / 术语表 / FAQ
免费课程
| 课程 | 作者/机构 | 适合 |
|---|---|---|
| Machine Learning Specialization | Andrew Ng(吴恩达) | 机器学习入门首选 |
| Practical Deep Learning | fast.ai (Jeremy Howard) | 上手式深度学习 |
| CS231n | 斯坦福大学 | 计算机视觉 |
| 《动手学深度学习》 | 李沐等 | 中文最佳实战教材,代码可跑 |
| 3Blue1Brown 数学系列 | Grant Sanderson | 线性代数/微积分/神经网络可视化 |
经典书籍
- 《人工智能:一种现代方法》 Stuart Russell & Peter Norvig —— AI 领域最权威通识教材
- 《机器学习》(西瓜书) 周志华 —— 中文机器学习经典教材
- 《深度学习》(花书) Ian Goodfellow 等 —— 深度学习权威专著
- 《动手学深度学习》 李沐等 —— 理论与代码并重,开源可在线读
论文与社区
- 论文:arXiv(cs.AI / cs.LG / cs.CL)、Papers with Code
- 社区:GitHub、Kaggle、知乎、Reddit r/MachineLearning
- 动态:本站「AI 动态与趋势」栏目、各机构官方博客(OpenAI / Google DeepMind / Anthropic / Meta AI / 智源)
术语表(高频 30+ 个)
AI 与机器学习
人工智能 AI(Artificial Intelligence):让机器模拟人类智能的学科。
机器学习 ML(Machine Learning):从数据中自动学习规律。
深度学习 DL(Deep Learning):基于多层神经网络的学习方法。
大语言模型 LLM(Large Language Model):基于 Transformer 的大规模预训练语言模型。
监督/无监督/强化学习:带标签 / 无标签 / 交互奖励 三种学习范式。
分类/回归:预测离散类别 / 预测连续数值。
聚类(Clustering):无监督地把样本分组。
特征(Feature):用于预测的输入变量。
过拟合/欠拟合(Overfitting/Underfitting):模型记住训练集 / 模型过于简单。
交叉验证(Cross-validation):把数据分多折轮流训练评估,稳定估计模型性能。
深度学习与模型
神经网络(Neural Network):由多层神经元组成的模型。
激活函数:引入非线性的函数(ReLU/Sigmoid/Tanh)。
损失函数(Loss):衡量预测误差。
梯度下降(Gradient Descent):沿负梯度更新参数优化模型。
反向传播(Backpropagation):链式法则求梯度回传误差。
CNN:卷积神经网络,图像任务主力。
RNN / LSTM:循环网络,序列建模(多已被 Transformer 取代)。
Transformer:基于自注意力机制的架构,大模型基石。
注意力机制(Attention):让模型关注输入中更相关的部分。
嵌入(Embedding):把词/实体映射为稠密向量。
预训练/微调(Pretraining/Fine-tuning):先在大数据上训练,再用任务数据调整。
大模型应用与治理
Prompt(提示词):给模型的输入指令。
Few-shot / CoT:给示例提示 / 思维链逐步推理。
RLHF:基于人类反馈的强化学习,对齐人类偏好。
幻觉(Hallucination):模型生成虚假却看似合理的内容。
RAG(检索增强生成):检索知识库辅助生成,缓解幻觉与时效问题。
Agent(智能体):能规划、调用工具、记忆的自主系统。
AIGC:AI 生成内容(文本/图像/音视频)。
AGI(通用人工智能):达到人类水平的通用智能,尚未实现。
对齐(Alignment):让模型目标与人类意图一致。
深度伪造(Deepfake):AI 生成的逼真假象,需防范滥用。
FAQ(常见问题)
学 AI 需要多深的数学?
入门阶段高中数学足够;进阶机器学习需要线性代数、概率统计、微积分的基础,但只需「理解概念 + 会查公式」,不必成为数学专家。按需补学效率最高。
完全没有编程基础能学吗?
可以。走「路线 A」:先学 Python 基础(约 1 个月),再学 AI。非技术从业者也可走「路线 C」,先用现成工具与 API 做应用,不写模型代码。
需要什么电脑配置?
入门与经典机器学习:普通电脑即可。深度学习训练建议 NVIDIA 显卡(显存 ≥ 8GB)或使用 Google Colab / Kaggle 免费云端 GPU。调用现成大模型 API 无需特殊硬件。
多久能入门?
认真投入:基础概念 + Python 约 1–2 个月;机器学习基础再加 2–4 个月;做出第一个完整项目约半年。坚持每周 5–10 小时,效果远好于突击。
AI 会取代程序员吗?
AI 会大幅提升编程效率(代码生成、调试辅助),但需求理解、架构设计、质量把关、业务判断仍需人类。趋势是「会用 AI 的程序员取代不会用的」,而非 AI 取代程序员。
如何跟上 AI 最新动态?
看本站「AI 动态与趋势」栏目(聚合 arXiv / Hacker News / 机构博客);关注 Hugging Face 热门模型、Papers with Code;警惕营销号标题党,重要信息回原文核实。
有哪些免费学习资源?
吴恩达 Machine Learning Specialization(可旁听)、fast.ai、李沐《动手学深度学习》、3Blue1Brown、CS231n、Kaggle Learn 全部免费,见「资源库」。
如何避免被 AI 错误信息误导?
记住模型会产生幻觉;重要事实交叉验证(查原文/权威来源);让模型给出依据;区分「事实」与「AI 生成的观点」;涉及健康、法律、财务等高风险场景务必人工复核。