学习 AI

从零开始,系统学习人工智能。概念准确、循序渐进、可实操、可持续更新 —— 覆盖机器学习、深度学习、大语言模型与最新动态。

这是什么?

AI(人工智能 Artificial Intelligence)是研究如何让机器模拟人类智能的学科。本站从最基础的概念讲起,不需要任何前置知识。

怎么学?

按「学习路线图」分阶段推进:先通识 → 再理论 → 后实战。每章配里程碑检验,学完一章自测一次。

学到什么程度?

目标:能读懂主流 AI 资讯、理解模型原理、会用现成框架/API 完成小项目,并持续跟上「最新动态」栏目。

本站内容更新至 2026-08。AI 领域变化快,易变信息以标注时间为准。

2 · AI 基础概念

什么是人工智能?

人工智能(Artificial Intelligence, AI)是研究、开发用于模拟和扩展人类智能的理论、方法与技术的学科。「人工智能」一词由 John McCarthy 于 1956 年达特茅斯会议(Dartmouth Conference)正式提出,该会议被公认为 AI 学科诞生的标志。AI 的研究目标包括:

  • 学习(Learning):从数据或经验中获取知识
  • 推理(Reasoning):基于知识进行逻辑推导与决策
  • 感知(Perception):理解图像、声音、传感器等输入
  • 语言理解(Language Understanding):理解并生成自然语言
  • 规划与决策(Planning & Decision-making):在不确定环境中采取行动达成目标

AI 是交叉学科,主要子领域包括:机器学习(Machine Learning)、计算机视觉(Computer Vision)、自然语言处理(Natural Language Processing, NLP)、语音识别、知识表示与推理(Knowledge Representation)、机器人学(Robotics)、多智能体系统(Multi-agent System)等。

图灵测试(Turing Test)

1950 年,Alan Turing 在论文《Computing Machinery and Intelligence》中提出:若一台机器能在文字对话中让人类无法区分它与真人,则可以说它具有智能。该思想实验即「图灵测试」。它定义了「行为主义」的智能判断标准,至今仍是讨论 AI 能力时的重要参照(注意:当代大模型在部分对话场景已能通过类似测试,但这不意味着真正理解)。

AI ⊃ 机器学习 ⊃ 深度学习 ⊃ 大模型

概念英文关系与说明
人工智能AI最广的学科范畴,涵盖知识表示、搜索、规划、感知、自然语言处理等。
机器学习Machine LearningAI 的子领域:让程序从数据中自动学习规律,而非显式编程。
深度学习Deep Learning机器学习的子领域:基于多层神经网络(Neural Network)的方法。
大语言模型LLM深度学习在语言领域的规模化应用:基于 Transformer 的预训练模型。

它们的关系是层层包含:AI 包含 ML,ML 包含 DL,DL 在语言领域的规模化产物即大语言模型。理解这层包含关系,是读懂一切 AI 资讯的前提。

发展简史(时间线)

Turing 发表《Computing Machinery and Intelligence》,提出图灵测试。

达特茅斯会议,AI 学科正式诞生(符号主义主导)。

符号主义黄金期:逻辑推理、搜索、感知机(Perceptron, 1958)。

第一次「AI 寒冬」:算力与数据不足,早期承诺未能兑现,经费削减。

专家系统(Expert System)复兴,如医疗诊断系统 MYCIN;1986 年反向传播(Backpropagation)算法被系统化推广。

统计学习复兴:支持向量机、随机森林;1997 年深蓝(Deep Blue)战胜国际象棋世界冠军卡斯帕罗夫。

IBM Watson 在问答节目《危险边缘》中战胜人类冠军。

AlexNet 在 ImageNet 竞赛大幅胜出(top-5 错误率从约 26% 降至 15.3%),深度学习爆发。

AlphaGo 以 4:1 战胜围棋世界冠军李世石,深度学习+强化学习引起全球关注。

论文《Attention Is All You Need》提出 Transformer,奠定大模型基础。

预训练大模型时代:GPT-1(2018)、BERT(2018)、GPT-3(2020)、扩散模型(Diffusion Model)兴起。

ChatGPT(2022-11)引爆生成式 AI(AIGC);多模态模型、AI Agent、推理模型(Reasoning Model)快速发展。

AI 的分类

类型英文说明
弱人工智能Narrow AI只在特定任务上超过人类,如人脸识别、下棋、语音助手。当前所有 AI 系统都属于此类。
强人工智能AGI在所有认知任务上达到人类水平。目前尚未实现,属前沿研究目标。
超人工智能ASI假设性的、全面超越人类的智能,目前仅为哲学与伦理议题。

AI 能做什么 / 不能做什么

✅ AI 擅长(当前)❌ AI 不擅长(当前)
海量数据处理与模式识别真正的理解与常识推理(模型是统计拟合,不是理解)
固定规则/目标明确的重复任务长链条多步推理(易出错,需人类校验)
内容生成(文本/图像/代码)对生成内容的事实保证(幻觉问题未解决)
7×24 小时稳定执行在开放、动态、对抗环境中的鲁棒决策
跨语言、跨模态的检索与摘要价值观判断、伦理取舍、真正的创造力

此表描述 2026 年 AI 的一般能力水平,随技术发展需持续修订。

常见误解澄清

「AI 有自我意识?」

无科学证据。当前大模型只是统计性地生成文本,不具备意识或情感。自称「有意识」的模型输出是训练数据模式的结果。

「AI 会取代所有工作?」

更准确的说法是改变工作形态:重复性、可自动化环节被替代,同时创造新岗位。具体影响因行业而异,协作型(Human-in-the-loop)岗位反而增加。

「AI 无所不能?」

否。AI 受训练数据与任务边界约束,会产生幻觉(Hallucination,编造看似合理的信息),需要人核实。

「AI 就是聊天机器人?」

聊天只是应用之一。AI 还用于医疗影像、自动驾驶、科学发现(如蛋白质结构预测)、代码生成、工业控制等广泛领域。

「AI 训练一次就一劳永逸?」

否。模型知识截止于训练时间,需要微调(Fine-tuning)或检索增强(RAG)补充新知识,并持续评估监控。

「开源模型和闭源模型差不多?」

各有取舍:闭源(如 GPT、Claude)通常能力更强、服务省心;开源(如 Llama、DeepSeek)可私有化部署、可控数据、可微调,适合企业敏感场景。

3 · 机器学习(Machine Learning)

机器学习是 AI 的核心子领域。经典定义(Tom Mitchell, 1997《Machine Learning》):「计算机程序从经验 E 中学习,若其在任务 T 上的性能 P 随经验 E 的提升而提高。」

机器学习与传统编程的本质区别

传统编程机器学习
思路人写规则(if/else),机器执行人给数据,机器学规则
适用规则清晰、可枚举(如计算器)规则难写但数据丰富(如图像识别、垃圾邮件)
质量瓶颈规则的完备性数据的质量与数量

三大学习范式

范式英文原理案例
监督学习Supervised Learning用带标签的数据(输入→正确答案)学习映射垃圾邮件识别(分类)、房价预测(回归)
无监督学习Unsupervised Learning从无标签数据中发现结构用户分群(聚类)、数据降维
强化学习Reinforcement Learning智能体与环境交互,通过奖励信号学习策略AlphaGo、游戏 AI、机器人控制

经典算法(直觉 + 适用场景)

线性回归 回归

拟合一条直线/超平面使误差平方和最小。直觉:找到最贴近所有点的线。适用:房价、销量等连续量预测。

逻辑回归 分类

线性结果经 Sigmoid 函数映射为概率(0-1)。直觉:算「属于某类的概率」。适用:二分类,是分类任务基线。

决策树 / 随机森林

按特征逐层「是/否」划分;随机森林用多棵随机树投票。直觉:把判断写成问题树。适用:表格数据、需要解释性的场景。

SVM 支持向量机

找能分开两类且间隔最大的超平面,可用核技巧(Kernel Trick)处理非线性。直觉:划一条「最居中」的边界。适用:中小规模高维数据。

KNN 最近邻

新样本看最近的 K 个邻居投票。直觉:物以类聚。适用:小数据量、低维场景;大数据量时计算慢。

K-Means 聚类

迭代地把样本归到最近的簇中心(需先指定 K)。直觉:把数据分成 K 堆。适用:用户分群、图像压缩、异常检测。

朴素贝叶斯

基于贝叶斯定理,假设特征相互独立。直觉:按「词出现的概率」判断类别。适用:文本分类(垃圾邮件、情感分析)。

XGBoost

梯度提升决策树(GBDT)的工程化代表,含正则化与并行优化。直觉:一棵棵「纠错树」接力。适用:表格数据竞赛与工业场景常胜算法。

学习建议:先吃透「线性回归 → 逻辑回归 → 决策树/随机森林 → XGBoost」这条主线,再按需补充 SVM、KNN、聚类,足以应对绝大多数表格类问题。

模型训练流程(标准 7 步)

  1. 数据采集(Data Collection):明确预测目标,收集足够且有代表性的样本;标注(Label)质量直接决定上限。
  2. 数据清洗:处理缺失值(删除/填充)、重复样本、异常值(Outlier);处理类别不平衡(欠采样/过采样)。
  3. 特征工程(Feature Engineering):特征选择(去冗余)、类别编码(One-hot)、归一化/标准化(Normalization,量纲统一)、必要时降维(PCA)。
  4. 划分数据集:训练集 / 验证集 / 测试集(常见比例 7:2:1);分类任务用分层抽样(Stratified Split)保持类别分布一致。
  5. 选择模型并训练:按任务类型选算法,定义损失函数(Loss)与优化器,在训练集上迭代更新参数。
  6. 在验证集上调参:用验证集(Validation Set)比较不同超参数与模型,防过拟合。
  7. 在测试集上做最终评估:测试集只用一次,得到无偏的性能估计,然后部署上线。
防数据泄漏(Data Leakage):测试集必须与训练过程完全隔离,任何「看过测试集」的信息(包括用测试集调参)都会让评估结果虚高,导致上线后实际效果远差于预期。特征工程也须只在训练集上拟合(如归一化的均值/方差),再应用到测试集。

核心评估指标

指标说明适用
准确率 Accuracy预测正确的比例类别均衡时
精确率 Precision预测为正的样本中真正为正的比例误报代价高时
召回率 Recall真正为正的样本中被找出的比例漏报代价高时(如癌症筛查)
F1 分数精确率与召回率的调和平均类别不平衡时
AUC-ROC分类阈值无关的综合排序能力二分类整体评估
警惕「准确率陷阱」:类别不平衡时准确率会骗人。例如癌症筛查中 99% 为健康人,模型「全预测健康」也有 99% 准确率,却漏掉所有病人。此时应看召回率(Recall)与精确率(Precision)。

过拟合(Overfitting):模型在训练集表现极好、在测试集表现差(记住而非泛化);欠拟合(Underfitting):模型过于简单,两边都差。缓解方法:更多数据、正则化(Regularization:L1/L2、Dropout)、交叉验证(Cross-validation)、简化模型或降低特征维度。

偏差-方差权衡(Bias-Variance Tradeoff):欠拟合对应高偏差(模型太简单、假设太强),过拟合对应高方差(对训练数据太敏感)。调参的本质就是在两者间找平衡点,交叉验证是寻找平衡的标准工具。

4 · 深度学习(Deep Learning)

深度学习使用多层神经网络自动学习数据中的层次化特征,是当前图像、语音、语言领域的主流方法。

神经网络基础

  • 神经元(Neuron):接收多个输入 → 加权求和(权重 w × 输入 x + 偏置 b)→ 过激活函数 → 输出。一层网络就是「一次线性变换 + 一次非线性」。
  • 激活函数(Activation Function):引入非线性。没有它,多层网络会退化成单层线性变换。常用:ReLU(默认首选,缓解梯度消失)、Sigmoid(输出 0–1,用于二分类概率)、Tanh(输出 -1 到 1)。
  • 前向传播(Forward Propagation):输入从输入层流经隐藏层到输出层,得到预测值。
  • 损失函数(Loss Function):衡量预测与真实值的差距。回归用均方误差(MSE),分类用交叉熵(Cross-Entropy)。
  • 反向传播(Backpropagation):用链式法则(Chain Rule)从输出层向输入层逐层计算梯度(误差回传)。
  • 梯度下降(Gradient Descent):按损失负梯度方向更新参数:w ← w − η·∂L/∂w。学习率(Learning Rate, η)决定步长:过大震荡不收敛,过小训练缓慢。
  • 一次完整训练迭代:前向传播 → 计算损失 → 反向传播求梯度 → 更新参数 → 重复(一个 Epoch 即遍历全部数据一轮)。
「深度」的含义:深层网络逐层学习层次化特征——以图像为例,浅层学边缘/纹理,中层学部件(眼睛、轮子),深层学完整物体。这种自动特征提取正是深度学习相对传统机器学习(需人工特征工程)的核心优势。

动手理解:手写数字识别(MNIST)

MNIST 是 28×28 像素的手写数字(0–9)数据集,堪称深度学习的「Hello World」。一个全连接网络:784 个输入像素 → 隐藏层(如 128 个神经元)→ 10 个输出(每个数字的概率)。训练后正确率可达 99%+。理解这个例子,就能理解「输入 → 特征 → 分类」的完整链路;它也是无数教程(含 3Blue1Brown 的神经网络系列视频)的首选演示。

卷积神经网络(CNN)

CNN(Convolutional Neural Network)专为图像等网格数据设计,两大核心操作:

  • 卷积(Convolution):小卷积核(如 3×3)滑过图像提取局部特征。局部感受野 + 权值共享使参数量远小于全连接,且天然具有平移不变性。
  • 池化(Pooling):对局部区域降采样(常用最大池化 Max Pooling),压缩尺寸、保留关键信息、增强鲁棒性。

经典结构演进:LeNet(1998)→ AlexNet(2012,深度学习引爆点)→ VGG(2014)→ ResNet(2015,残差连接 ResNet 解决深层退化问题)。应用:图像分类、目标检测、语义分割、人脸识别、医学影像。

循环神经网络(RNN / LSTM)

RNN(Recurrent Neural Network)按时间步处理序列,当前步的输出依赖上一步的隐状态。LSTM(长短期记忆网络)通过门控机制(输入门/遗忘门/输出门)缓解长序列的梯度消失问题。局限:串行计算无法并行、长距离依赖仍然薄弱——如今文本任务多数已被 Transformer 取代,LSTM 仍用于部分时序预测场景。

Transformer 架构(重点)

2017 年论文《Attention Is All You Need》(Vaswani et al.)提出 Transformer,核心机制:

  • 自注意力(Self-Attention):每个词生成 Query / Key / Value 三个向量,用 Q·K 计算该词与序列中所有词的注意力权重,再对 V 加权聚合。直觉:让每个词「自己决定该关注哪些词」。
  • 位置编码(Positional Encoding):注意力本身不感知顺序,需注入位置信息。
  • Encoder-Decoder 结构:编码器理解输入,解码器生成输出(GPT 类模型只用 Decoder,BERT 类只用 Encoder)。

相比 RNN 的两大优势:可并行计算(训练快)与长距离依赖(任意两词直接关联)。配合规模定律(Scaling Law:模型越大、数据越多,性能持续提升),Transformer 成为大模型时代的基石。

训练要点

  • 正则化:Dropout(随机丢弃神经元)、权重衰减(Weight Decay, L2)、早停(Early Stopping)、数据增强(Data Augmentation,如图像旋转/翻转)。
  • 归一化:Batch Normalization 稳定中间层分布、加速收敛(Transformer 类模型多用 Layer Normalization)。
  • 关键超参数:学习率(可配学习率调度 Learning Rate Schedule)、批大小(Batch Size)、网络深度与宽度、训练轮数(Epochs)。
  • 优化器:Adam(自适应学习率,实践默认首选)、SGD + 动量(Momentum)。
  • 硬件:深度学习训练依赖 GPU(NVIDIA CUDA 生态最成熟);显存不足时用小批大小或梯度累积;无 GPU 可用 Google Colab / Kaggle 免费云端。

5 · 大语言模型与生成式 AI

什么是 LLM?

大语言模型(Large Language Model, LLM)是基于 Transformer 的、在大规模文本上预训练的语言模型。衡量规模的三个维度:参数量(数十亿到数万亿)、训练数据量上下文窗口(一次能处理的 token 数)。Token 是文本的最小切分单元(约 1 个英文单词或 1 个汉字左右),模型按 token 逐个生成输出。

LLM 是怎么「训练」出来的(三步)

  1. 预训练(Pretraining):在海量互联网文本上自监督学习——反复练习「预测下一个 token」,学到语言规律与海量知识(成本最高,动辄千万美元级算力)。
  2. 监督微调(SFT):用高质量「指令→期望回答」数据微调,让模型从「会接话」变成「会听话」(遵循指令)。
  3. RLHF(基于人类反馈的强化学习):人类对多个回答排序打分,用奖励模型指导模型对齐人类偏好(更有用、更无害)。InstructGPT 与 ChatGPT 均采用此路线。

这也是为什么 ChatGPT 给人的感觉像「对话」而非「接龙」——本质仍是逐 token 预测,只是经过了指令对齐。

关键概念

概念英文说明
预训练Pretraining在海量文本上自监督学习语言规律(预测下一个词)。
监督微调SFT用高质量指令-回答数据微调,让模型学会遵循指令。
RLHFRLHF基于人类反馈的强化学习,对齐人类偏好(如 InstructGPT、ChatGPT 的做法)。
上下文学习In-Context Learning不更新参数,仅通过提示词中的示例让模型完成任务(Few-shot)。
幻觉Hallucination模型生成看似合理但实际错误/虚构的内容,是当前重要挑战。
温度Temperature控制输出随机性的超参数:低温度更稳定保守,高温度更多样有创意。

Prompt 工程(提示词工程)

Prompt 是与模型交互的「输入界面」,写得好坏直接影响输出质量。四要素详解:

  • 角色(Role):让模型扮演专家,如「你是一位资深数据分析师」——约束输出视角与专业度。
  • 任务(Task):明确动词与对象,如「总结以下文章的 3 个要点」。
  • 约束(Constraints):限定格式与边界,如「200 字以内、用 Markdown 列表、不要猜测不确定的事实」。
  • 示例(Examples):给 2–3 个「输入→期望输出」范例(Few-shot),比任何抽象描述都有效。
进阶技巧:思维链(Chain-of-Thought, CoT)——要求模型「一步步思考再回答」,可显著提升数学/逻辑类问题准确率;复杂任务可拆成多轮子任务(Plan-and-Solve)。技巧有效性与模型相关,需实测

RAG(检索增强生成)

RAG(Retrieval-Augmented Generation)是解决「知识时效」与「幻觉」的主流工程方案,流程:

  1. 检索(Retrieval):把用户问题转成向量,在知识库(文档、数据库、网页)中检索最相关的片段(向量相似度检索)。
  2. 增强(Augment):把检索到的片段拼入提示词,作为「参考材料」。
  3. 生成(Generation):模型基于参考材料回答,并要求标注引用来源。

RAG 让模型「先查资料再回答」,适用于企业知识库问答、客服、法律/医疗文档辅助等场景,也是让开源模型低成本接入私有数据的首选方案。

AI Agent(智能体)

AI Agent = 大模型(大脑)+ 工具调用(Function Calling) + 规划(Planning)+ 记忆(Memory)。典型工作方式:接收目标 → 拆解为子任务 → 调用工具(搜索、写代码、操作软件)→ 观察结果 → 迭代直到完成。当前热点方向,已在代码生成、浏览器操作、工作流自动化等场景落地;可靠性、安全性与成本仍是主要挑战,能力边界尚无定论。

主流模型概览 更新至 2026-08

⚠️ 模型迭代极快,以下仅作入门认知,具体能力以官方最新发布为准。

系列厂商特点
GPT 系列OpenAIChatGPT 的基座,通用对话与推理。
Claude 系列Anthropic强调安全对齐,长文本能力强。
Gemini 系列Google原生多模态(文本/图像/音频/视频)。
DeepSeek 系列深度求索开源 + 高性价比,推理模型 DeepSeek-R1 等。
Llama 系列Meta开源生态标杆,可本地部署与微调。

AIGC 应用

  • 文本生成:写作、翻译、摘要、代码(Copilot 类工具)
  • 图像生成:扩散模型(Diffusion Model,如 Stable Diffusion、DALL·E)
  • 语音:语音合成(TTS)、语音识别(ASR)、实时翻译
  • 视频:文生视频、数字人、视频修复
  • 多模态:图文理解、视觉问答(VQA)、图像编辑
  • 科学:蛋白质结构预测(AlphaFold)、代码/数学推理辅助

LLM 的能力与局限(务实认知)

✅ 强项⚠️ 局限
通用对话、摘要、翻译、改写知识截止于训练时间,新知识靠 RAG/微调补充
代码生成与解释复杂长链推理易出错(幻觉),需校验
跨语言、长文本处理长上下文有「迷失中间」现象,重要信息放开头/结尾更稳
快速原型与创意辅助无真实世界感知与价值观判断,高风险决策需人工把关

6 · 学习路线图

按背景选择路线,每个阶段包含「学什么 / 练什么 / 里程碑检验」。

三条路线总览

路线阶段一:入门(1–2 月)阶段二:进阶(2–4 月)阶段三:实战
A. 零基础新手Python 基础 + AI 概念扫盲机器学习基础 + 数学基础用现成 API/库做小项目
B. 开发者转 AI复习 Python 与数学机器学习 + 深度学习框架端到端项目 + Kaggle 竞赛
C. 非技术从业者AI 通识 + 行业应用Prompt 工程 + AI 工具实操业务场景落地
学习节奏建议:每周投入 5–10 小时比周末突击更有效;每完成一个阶段用「里程碑」自测,未达标就回头补,不要贪快;三条路线可交叉(如开发者先用路线 C 的 Prompt 部分快速上手工具)。
路线 A:零基础新手(推荐从这开始)

阶段一(1–2 月):学 Python 基础(变量、循环、函数、列表/字典);读本站「AI 基础概念」;:写 20 个小脚本(计算器、猜数字、文本统计)。里程碑:能独立写 100 行以内的小程序。

阶段二(2–4 月):学机器学习基础与线性代数/概率初步;:用 Scikit-learn 跑通鸢尾花分类、房价回归。里程碑:能讲清训练集/测试集、过拟合、评估指标。

阶段三(持续):选一个方向做小项目(图像分类、情感分析、问答机器人);:用 Hugging Face 现成模型 + API 做应用。里程碑:产出一个可展示的完整项目。

路线 B:开发者转 AI

阶段一:快速复习 Python(NumPy/Pandas 熟练使用)与大学数学。里程碑:能熟练做数据清洗与探索性分析。

阶段二:学完本站机器学习 + 深度学习章节;上手 PyTorch 复现 CNN、Transformer 小例子。里程碑:独立实现并训练一个图像分类模型。

阶段三:Kaggle 打比赛(泰坦尼克→房价→图像分类);读顶会论文(NeurIPS/ICML/ICLR)。里程碑:Kaggle 铜牌以上,或产出端到端部署项目。

路线 C:非技术从业者

阶段一:读完「AI 基础概念」+「大语言模型」章节,理解关键术语。里程碑:能向同事准确解释 AI/ML/LLM 的区别。

阶段二:系统学 Prompt 工程;熟练使用主流 AI 工具(对话、写作、制图、数据分析)。里程碑:建立自己的提示词模板库。

阶段三:结合本行业找 1–2 个落地场景(如文档处理、客户问答、报表生成),用 RAG 或现成工具实现。里程碑:跑通一个真实业务用例。

7 · 工具与框架

工具/框架用途学习优先级官方文档
PythonAI 生态第一语言,必备★★★★★python.org
NumPy / Pandas / Matplotlib数值计算、数据处理、可视化★★★★★numpy.org / pandas
Scikit-learn经典机器学习算法库★★★★☆scikit-learn.org
PyTorch深度学习框架(推荐优先)★★★★★pytorch.org
TensorFlow / Keras深度学习框架(工业部署多)★★★☆☆tensorflow.org
Hugging Face预训练模型库与生态(Transformers)★★★★★huggingface.co
Jupyter Notebook交互式实验环境★★★★☆jupyter.org
Kaggle数据集、竞赛、社区学习★★★★☆kaggle.com
OpenAI / Anthropic API大模型应用开发★★★★☆各厂商官方文档
LangChainLLM 应用编排框架(RAG/Agent)★★★☆☆langchain.com
Ollama本地部署开源模型★★★☆☆ollama.com
新手工具顺序建议:① Python 语法 → ② NumPy/Pandas(数据处理)→ ③ Scikit-learn(跑通经典 ML)→ ④ PyTorch(深度学习)→ ⑤ Hugging Face(用现成模型)。LLM 开发工具(API、LangChain、Ollama)可在掌握前五项后按需学习。

8 · 数学基础(学到「够用」即可)

不需要成为数学家。理解「为什么需要」比死记公式更重要,多数公式可查。

线性代数

向量、矩阵、特征值。用于理解神经网络中的张量运算与权重。

概率与统计

分布、期望/方差、贝叶斯定理。用于理解模型不确定性、损失函数、评估指标。

微积分

导数、偏导数、链式法则。用于理解梯度下降与反向传播。

最优化

梯度下降及变体(SGD、Adam)。用于理解模型「如何训练」。

学习建议:先学机器学习时按需补数学,遇到看不懂的公式再回头查对应知识点,效率最高(3Blue1Brown 的线性代数/微积分系列是公认的最佳入门视频)。
学习阶段需要的数学用途
入门(AI 通识)无需读懂概念即可
机器学习基础线性代数 + 概率初步理解特征、相似度、贝叶斯
深度学习微积分(导数/链式法则)理解梯度下降与反向传播
进阶/研究最优化 + 统计推断理解收敛性、泛化理论、论文

9 · 伦理、安全与合规

算法偏见与公平性

训练数据若含历史偏见,模型会放大歧视(如招聘、信贷场景)。需做偏见检测与公平性评估。

隐私与数据安全

训练数据可能包含个人信息;使用 AI 时注意不要上传敏感数据到第三方服务。

幻觉与错误信息

模型会自信地编造内容。重要场景(医疗、法律、新闻)必须人工核实。

对齐与可解释性

AI Alignment 研究如何让模型目标与人类意图一致;可解释性(XAI)研究如何理解模型决策。

监管动态 更新至 2026-08

  • 欧盟《人工智能法案》(EU AI Act):全球首部全面 AI 监管法规,2024 年 8 月生效,分风险等级监管。
  • 中国《生成式人工智能服务管理暂行办法》:2023 年 8 月 15 日施行,规范生成式 AI 服务提供者。
  • 中国《人工智能生成合成内容标识办法》:2025 年 9 月 1 日施行,要求深度合成内容显式标识。
负责任使用清单:不用于深度伪造(Deepfake)与诈骗;学术场景遵守诚信规范;生成内容发布前核实;涉及他人数据先获授权。

10 · AI 动态与趋势 人工精选 + 自动聚合

自动聚合权威来源(未审核)+ 人工精选解读(已审核)分层呈现。自动数据每 30 分钟刷新一次。

📌 本周精选(人工审核)

示例:某开源推理模型发布 已审核

【编辑替换】此处放本周最重要动态 + 一句话解读「为什么重要、影响谁」。每条需注明来源与链接、发布时间。

来源:来源名 · 2026-08-1X

📡 实时动态(自动聚合 · 未审核)

正在加载最新动态…(如长时间无内容,可能为网络限制,请稍后刷新)

📊 趋势雷达(随聚合数据更新)

多模态(Multimodal)--
AI Agent(智能体)--
推理模型(Reasoning)--
RAG / 检索增强--
端侧模型(On-device)--

热度基于近 7 日聚合结果统计,仅作趋势参考。

🗒 更新日志

  • 2026-08-18:深度填充核心知识栏目(基础概念/机器学习/深度学习/大模型)与增强栏目(v0.2)
  • 2026-08-18:网站骨架上线(v0.1)

11 · 资源库 / 术语表 / FAQ

免费课程

课程作者/机构适合
Machine Learning SpecializationAndrew Ng(吴恩达)机器学习入门首选
Practical Deep Learningfast.ai (Jeremy Howard)上手式深度学习
CS231n斯坦福大学计算机视觉
《动手学深度学习》李沐等中文最佳实战教材,代码可跑
3Blue1Brown 数学系列Grant Sanderson线性代数/微积分/神经网络可视化

经典书籍

  • 《人工智能:一种现代方法》 Stuart Russell & Peter Norvig —— AI 领域最权威通识教材
  • 《机器学习》(西瓜书) 周志华 —— 中文机器学习经典教材
  • 《深度学习》(花书) Ian Goodfellow 等 —— 深度学习权威专著
  • 《动手学深度学习》 李沐等 —— 理论与代码并重,开源可在线读

论文与社区

  • 论文:arXiv(cs.AI / cs.LG / cs.CL)、Papers with Code
  • 社区:GitHubKaggle、知乎、Reddit r/MachineLearning
  • 动态:本站「AI 动态与趋势」栏目、各机构官方博客(OpenAI / Google DeepMind / Anthropic / Meta AI / 智源)

术语表(高频 30+ 个)

AI 与机器学习

人工智能 AI(Artificial Intelligence):让机器模拟人类智能的学科。
机器学习 ML(Machine Learning):从数据中自动学习规律。
深度学习 DL(Deep Learning):基于多层神经网络的学习方法。
大语言模型 LLM(Large Language Model):基于 Transformer 的大规模预训练语言模型。
监督/无监督/强化学习:带标签 / 无标签 / 交互奖励 三种学习范式。
分类/回归:预测离散类别 / 预测连续数值。
聚类(Clustering):无监督地把样本分组。
特征(Feature):用于预测的输入变量。
过拟合/欠拟合(Overfitting/Underfitting):模型记住训练集 / 模型过于简单。
交叉验证(Cross-validation):把数据分多折轮流训练评估,稳定估计模型性能。

深度学习与模型

神经网络(Neural Network):由多层神经元组成的模型。
激活函数:引入非线性的函数(ReLU/Sigmoid/Tanh)。
损失函数(Loss):衡量预测误差。
梯度下降(Gradient Descent):沿负梯度更新参数优化模型。
反向传播(Backpropagation):链式法则求梯度回传误差。
CNN:卷积神经网络,图像任务主力。
RNN / LSTM:循环网络,序列建模(多已被 Transformer 取代)。
Transformer:基于自注意力机制的架构,大模型基石。
注意力机制(Attention):让模型关注输入中更相关的部分。
嵌入(Embedding):把词/实体映射为稠密向量。
预训练/微调(Pretraining/Fine-tuning):先在大数据上训练,再用任务数据调整。

大模型应用与治理

Prompt(提示词):给模型的输入指令。
Few-shot / CoT:给示例提示 / 思维链逐步推理。
RLHF:基于人类反馈的强化学习,对齐人类偏好。
幻觉(Hallucination):模型生成虚假却看似合理的内容。
RAG(检索增强生成):检索知识库辅助生成,缓解幻觉与时效问题。
Agent(智能体):能规划、调用工具、记忆的自主系统。
AIGC:AI 生成内容(文本/图像/音视频)。
AGI(通用人工智能):达到人类水平的通用智能,尚未实现。
对齐(Alignment):让模型目标与人类意图一致。
深度伪造(Deepfake):AI 生成的逼真假象,需防范滥用。

FAQ(常见问题)

学 AI 需要多深的数学?

入门阶段高中数学足够;进阶机器学习需要线性代数、概率统计、微积分的基础,但只需「理解概念 + 会查公式」,不必成为数学专家。按需补学效率最高。

完全没有编程基础能学吗?

可以。走「路线 A」:先学 Python 基础(约 1 个月),再学 AI。非技术从业者也可走「路线 C」,先用现成工具与 API 做应用,不写模型代码。

需要什么电脑配置?

入门与经典机器学习:普通电脑即可。深度学习训练建议 NVIDIA 显卡(显存 ≥ 8GB)或使用 Google Colab / Kaggle 免费云端 GPU。调用现成大模型 API 无需特殊硬件。

多久能入门?

认真投入:基础概念 + Python 约 1–2 个月;机器学习基础再加 2–4 个月;做出第一个完整项目约半年。坚持每周 5–10 小时,效果远好于突击。

AI 会取代程序员吗?

AI 会大幅提升编程效率(代码生成、调试辅助),但需求理解、架构设计、质量把关、业务判断仍需人类。趋势是「会用 AI 的程序员取代不会用的」,而非 AI 取代程序员。

如何跟上 AI 最新动态?

看本站「AI 动态与趋势」栏目(聚合 arXiv / Hacker News / 机构博客);关注 Hugging Face 热门模型、Papers with Code;警惕营销号标题党,重要信息回原文核实。

有哪些免费学习资源?

吴恩达 Machine Learning Specialization(可旁听)、fast.ai、李沐《动手学深度学习》、3Blue1Brown、CS231n、Kaggle Learn 全部免费,见「资源库」。

如何避免被 AI 错误信息误导?

记住模型会产生幻觉;重要事实交叉验证(查原文/权威来源);让模型给出依据;区分「事实」与「AI 生成的观点」;涉及健康、法律、财务等高风险场景务必人工复核。