EMBEDDED AI FIELD GUIDE
从神经网络到可交付的端侧 AI 系统
为熟悉 ESP32、USB、网络协议栈的嵌入式工程师设计。每天一个主题,沿着“模型 → 表示 → Runtime → Kernel → 内存/带宽 → 硬件 → 产品”逐层收束;每章用历史时间轴说明来路,用类比图解建立直觉,再让数据在可交互动画里真正跑一遍。
只保存在本机
你的学习进度
进度、错题与实验笔记只保存在当前浏览器,不会上传。
0 / 15已完成章节
0连续学习天数
0待复习错题
阶段徽章
神经网络基础Day 1–3
端侧部署Day 4–6
LLM 基础Day 7–10
LLM 工程Day 11–15
连续三日3 天
学习档案与隐私
导出档案可跨浏览器备份进度、错题和实验笔记;恢复会替换当前浏览器中的学习状态。
神经网络基础
从张量、层与损失函数建立神经网络直觉
张量 带形状与数据类型的多维数值块,是模型输入、权重和中间结果的统一表示。 Shape 描述各维长度及其语义,例如 NCHW 的 batch、通道、高和宽。 激活函数 在线性变换后加入非线性,使多层网络能表达复杂边界。 MAC 一次乘加运算;常用于粗略估算计算量。 理解神经网络如何把输入张量变成可优化的预测,并能读懂一次前向与反向传播。 DAY 02训练与推理
把可学习状态冻结为可移植、可验证的模型产物
eval 模式 让 Dropout、BatchNorm 使用推理语义的模式。 优化器 依据梯度更新参数的算法及其状态。 计算图 以节点和边描述张量如何经过算子得到输出。 ONNX opset 模型声明的算子语义版本。 理解训练态与推理态的差异,并能把 checkpoint 转换为包含计算图、权重、版本和预处理契约的部署产物。 DAY 03模型量化
用更少的 bit 换取更低的存储与带宽
Scale 整数码与真实数值之间的比例系数。 Zero-point 映射中代表真实零值的整数偏移。 校准集 用于估计激活范围的代表性输入样本。 Per-channel 为不同权重通道分别使用量化参数。 掌握对称/非对称量化、scale/zero-point,并能判断误差来源。 DAY 04算子与 Kernel
从数学定义走到布局、融合与硬件执行路径
Kernel 针对具体硬件实现一个算子的低层计算代码。 Layout 张量维度在内存中的排列方式,如 NCHW 或 NHWC。 Fusion 将多个连续算子合并为一次执行。 Tiling 把大计算分块以适配寄存器或 cache。 理解算子语义、内存布局、kernel 选择和算子融合之间的关系。 DAY 05端侧模型部署
把非 LLM 视觉、音频与传感器模型真正烧进设备
代表性数据 覆盖真实设备工况的数据集合。 Tensor arena 为 MCU 推理预分配输入、输出和中间张量的内存区。 前处理 将原始传感器数据变成模型输入的步骤。 混淆矩阵 按真实类别与预测类别统计的表。 完成数据、训练、导出、量化、部署、验证的闭环,重点覆盖 MCU 常见小模型。 DAY 06端侧视觉流水线
在内存、带宽与实时约束中把摄像头帧变成稳定事件
峰值活跃内存 某一时刻同时需要保留的所有 buffer 总量。 PSRAM 通过外部接口连接的大容量 RAM。 Stride 同一行相邻像素数据在内存中的跨度。 Letterbox 保持比例缩放并填充边缘的 resize 方法。 能够为 MCU/NPU 视觉系统计算峰值内存和带宽,定义 frame buffer、几何变换、后处理与所有权契约,并用稳态证据验收。 DAY 07LLM 基础
从语言模型起源建立发展脉络、工作原理与关键术语地图
语言模型 估计 token 序列概率或下一个 token 条件概率的模型。 参数 训练得到并在推理时固定复用的权重,是模型的长期统计状态。 预训练 / 对齐 预训练学习通用模式;对齐用指令、偏好或规则塑造可用行为。 幻觉 模型生成流畅但不受事实证据支持或与现实不一致的内容。 理解 LLM 从统计语言模型、神经语言模型到 Transformer、预训练与指令对齐的发展脉络,并能准确解释 token、参数、上下文、预训练、推理与幻觉等核心术语。 DAY 08Tokenizer
理解文本如何变成模型可消费的整数流
Vocabulary token 到整数 id 的映射表。 BPE 通过合并常见子串构建 token 的算法。 Special token 表示开始、结束、角色等控制含义的 token。 Chat template 将消息列表格式化为模型训练期预期字符串的模板。 能解释 vocabulary、merges、special tokens、padding 与 token budget,并定位端侧分词开销。 DAY 09Transformer 架构
先看清整座模型,再深入其中的 Attention 数据流
Transformer block 由 Attention、FFN、残差与归一化等子层组成并重复堆叠的序列计算单元。 Decoder-only 只堆叠带因果可见性的 decoder 风格 block,以统一的序列目标生成下一个 token。 FFN / MLP 在每个序列位置独立执行、各位置共享参数的非线性前馈子层。 Residual + Norm 用短路径保留已有表示,并控制深层堆叠中的数值尺度。 理解 Transformer 如何把 embedding、位置机制、Attention、FFN、残差连接和归一化组织为 encoder、decoder 与 decoder-only 架构,并能从模型配置还原一次从 token 到 logits 的完整前向路径。 DAY 10Attention 机制
把序列依赖变成可并行计算的显式数据流
Attention 用 Query 与 Key 的匹配分数对 Value 加权聚合的信息交换机制。 Multi-head 把表示投影到多个子空间并行执行注意力,再拼接输出。 Causal mask 阻止当前位置访问未来 token 的上三角可见性约束。 Positional encoding 向无循环的注意力网络注入 token 顺序或相对距离信息。 从 Attention 的对齐问题出发,理解缩放点积、Query、Key、Value、多头注意力、causal mask 与位置交互,并能说明其并行优势、二次复杂度和 I/O 边界。 DAY 11KV Cache
用会话内存换取 Decode 阶段的历史投影复用
Prefill 批量处理已有 prompt 并为每层建立初始 K/V 状态的阶段。 Decode 根据上一步输出逐 token 追加位置并生成下一 token 的阶段。 KV cache 保存历史 token 在每层产生的 Key 与 Value 投影的会话状态。 GQA / MQA 让多组 Query head 共享更少 K/V head,从结构上降低每 token cache 宽度。 理解 Prefill 与 Decode 的工作负载差异、K/V 为什么可缓存、cache 张量布局和容量斜率,并能比较 MHA、GQA、MQA、分页与低精度策略。 DAY 12LLM 量化与 GGUF
把低比特权重与 metadata 封装成可部署模型包
GGUF GGML 系执行器使用的模型容器格式。 Block quantization 按块共享 scale 等参数的低比特编码。 Weight-only 只量化权重、激活保持较高精度的策略。 mmap 将文件映射到虚拟内存按需访问。 理解 block quantization、混合精度、权重元数据及 GGUF 容器的关系。 DAY 13LLM Runtime
把模型包、生成循环与异构 backend 组织成可观测执行路径
Context 一次推理会话持有的 token 和 KV 状态。 Cancellation 中止已失效请求并释放资源的机制。 Backend 把 runtime 请求映射到特定硬件的实现层。 Offload 把部分层或子图交给加速器执行。 理解 runtime 如何加载模型、管理会话、调度 Prefill/Decode、执行采样与流式取消,并能用分层验收矩阵比较 CPU、GPU、NPU backend、编译方式、子图分区和 fallback。 DAY 14LLM 性能与 Infra
从单机 TTFT/ITL 追到集群数据移动、并行拓扑与 SLO
TTFT 从请求发出到首个 token 返回的时间。 p95 95% 请求不超过的尾延迟分位数。 Goodput 在给定正确性与 SLO 约束内完成的有效工作量,而非原始峰值吞吐。 PD 解耦 把 Prefill 与 Decode 放到可独立调度和扩缩容的 worker 池。 用可复现实验定位单机推理瓶颈,并理解训练并行、KV 调度、Prefill/Decode 解耦与服务 SLO 如何把同一资源账本扩展到集群。 DAY 15端侧 LLM 产品化
把模型、异构硬件、MCU/Host 边界与运营证据收束为可交付系统
安全边界 必须由确定性组件强制执行的权限和范围限制。 Delegate 接收已分区子图并在 CPU/GPU/NPU 等特定后端编译执行的接口。 Peak RSS 进程在测量期间达到的最大常驻物理内存,用于发现加载或 Prefill 峰值。 显式回退 在权限、隐私、时限与失败行为已定义的条件下转到另一 backend 或云端。 完成端侧 LLM 的三级职责边界、模型包契约、异构执行、容量与能耗预算、故障降级、版本发布和验收报告。