首页 / 第 7 章

🏗️ 从实验到产品

学科透镜:工程分解(需求 → 接口 → 模块 → 约束) 难度:★★★☆☆ 本章 4 图 + 1 视频

实验室里"跑通一个 notebook"和产品里"服务几百万用户",中间隔着整个工程学科。SICP 教我们的第一课:把模糊需求拆成接口、模块与约束。本章把"做个 AI 产品"拆成一条管道和两个世界:训练世界(离线、算钱、慢慢来)和推理世界(在线、算延迟、7×24)。最后给你 MLOps 的最小闭环。

🧱

本学科心法:先定接口,再填实现;把约束写进设计

工程分解的次序:需求 → 拆模块 → 定接口(模块之间怎么对接)→ 定约束(延迟、成本、规模)→ 最后才写代码。模型只是其中一个模块。

7.1一个 AI 产品的全流程管道

先俯瞰全局:从需求到迭代,六个环节,一个闭环。注意"模型训练"只占其中一小格。

六个环节 = 一条产品管道(模型训练只是其中一格) ① 需求 给谁用? 指标是什么? (先于一切) ② 数据 采集/清洗/标注 版本化 (常占 60% 时间) ③ 模型 选型/训练/调参 (第 3~6 章) ④ 评估 体检/消融/ 线上小流量验证 (第 4 章) ⑤ 部署 推理服务/量化 容器/接口 ⑥ 监控 延迟/漂移/ 用户反馈 监控发现问题 → 回到 ①/②/③ 迭代(产品永不完工,只有不断迭代) 工程分解口诀:先想清楚"每个环节的输入输出接口",再逐环节填实现——管道才能并行、替换、回滚
图 7-1 · 产品管道。六个环节首尾相接,外加一条迭代回路。注意③模型训练只是六分之一——"我模型很牛"不等于"产品成了"。接口先行,是工程和手艺的分水岭。

7.2数据管线:模型的"食品工厂"

数据是模型的饭。一条正规的数据管线像食品工厂:进料 → 清洗 → 质检 → 分装 → 保鲜。每个环节都标注"常见坑"。

数据管线五道工序 ① 采集 爬取/API/日志/众包 坑:来源混乱/重复/版权 ② 清洗 去重/去噪/格式统一 坑:统计量污染测试集 ③ 标注/质检 打标签/交叉质检 坑:标注不一致=标签噪声 ④ 增强/切分 数据增强/随机划分 坑:时序数据要按时间切 ⑤ 版本化 快照/哈希/血缘记录 坑:数据变了模型却不自知 数据质量的黄金法则(工程界的共识) Garbage In, Garbage Out —— 垃圾进,垃圾出。数据质量决定模型上限, 再好的模型结构也只是在逼近这个上限。多数项目:修数据比换模型见效快 10 倍。
图 7-2 · 数据管线。五道工序 + 五条"坑"标注。工程分解在这里的价值:把"整理数据"这种模糊活儿,拆成有输入、有输出、有验收标准的五道工序。

7.3两个世界:训练世界与推理世界

同一个模型文件,在两个世界过着完全不同的日子。工程上必须分别设计——这是最容易被人忽略的"约束"。模型文件只是中间产物,两边都要为它铺路。

同一个模型文件,两个完全不同的世界 训练世界(离线 · 实验室) ⏱ 时间观念:慢没关系,跑几周都可以 📦 批处理:一次喂几千条样本(大 batch) 💰 关注成本:GPU 利用率越高越好 🧪 要能重跑:随机种子、日志、版本全记录 产出:一份模型权重文件(如 7B 参数的 14GB) 转换 推理世界(在线 · 生产) ⏱ 延迟敏感:用户等 200ms 就烦了 📦 单条请求:一次只处理一个用户输入 📈 关注吞吐:并发、峰值、7×24 在线 🛡 要能回滚:灰度、监控、快速下线 服务形态:API 接口 / 边缘设备 / 手机 App 内嵌 部署优化三件套(把大模型塞进生产环境):量化(INT8/FP16)· 蒸馏(大模型教小模型)· 剪枝(砍不重要的参数)
图 7-3 · 两个世界。训练要"利用率"和"可复现",推理要"延迟"和"吞吐"——指标完全不同,所以架构分开设计(训练集群 vs 推理服务)。模型文件在两世界之间还要过一道"部署优化"关卡。

7.4MLOps 最小闭环:让实验可以复现

工程分解的最后一块:把"炼丹"变成"科学"。没有记录就没有科学——一个无法复现的实验等于没做。

MLOps 最小闭环:记录 → 对比 → 复现 → 再实验 ① 实验 代码 + 超参 + 数据版本 ② 记录 指标 + 损失曲线 + 日志 ③ 对比 看板:哪个版本最好? 实验追踪 平台/表格 (如 W&B / MLflow) 跑 存 查 复现/迭代(回到①) 复现四件套:代码版本 + 数据版本 + 超参数 + 随机种子 —— 四样齐全,别人(或三个月后的你)才能复现你的结果
图 7-4 · MLOps 闭环。工程分解的收尾:把"记忆"外包给系统。从跑第一个实验起就记录,比事后补记录靠谱一百倍。这也是《模型思维》里"可证伪性"的工程化——没有记录,你连"什么有效"都无法证明。

▶配合视频:吴恩达深度学习(中文语音版)

工程章的配餐是吴恩达的体系课——他把"从想法到落地"的流程讲得最结构化,正好呼应本章的管道思维。

🎬 吴恩达《深度学习》中文语音版(双语字幕 · 高清)—— 结构化程度极高,呼应第 1 章地图与本章管道 在 B 站打开 ↗

★本章小结

1
看管道需求 → 数据 → 模型 → 评估 → 部署 → 监控,闭环迭代。模型只是六分之一。
2
建数据管线采集 → 清洗 → 标注 → 切分 → 版本化,五道工序各有验收标准。
3
分两个世界训练要利用率/可复现,推理要延迟/吞吐;部署优化三件套:量化、蒸馏、剪枝。
4
上 MLOps 闭环实验 → 记录 → 对比 → 复现;复现四件套:代码 + 数据 + 超参 + 种子。
← 上一章
⑥ 复杂科学:Transformer 与涌现