首页 / 第 7 章
🏗️ 从实验到产品
实验室里"跑通一个 notebook"和产品里"服务几百万用户",中间隔着整个工程学科。SICP 教我们的第一课:把模糊需求拆成接口、模块与约束。本章把"做个 AI 产品"拆成一条管道和两个世界:训练世界(离线、算钱、慢慢来)和推理世界(在线、算延迟、7×24)。最后给你 MLOps 的最小闭环。
🧱
本学科心法:先定接口,再填实现;把约束写进设计
工程分解的次序:需求 → 拆模块 → 定接口(模块之间怎么对接)→ 定约束(延迟、成本、规模)→ 最后才写代码。模型只是其中一个模块。
7.1一个 AI 产品的全流程管道
先俯瞰全局:从需求到迭代,六个环节,一个闭环。注意"模型训练"只占其中一小格。
图 7-1 · 产品管道。六个环节首尾相接,外加一条迭代回路。注意③模型训练只是六分之一——"我模型很牛"不等于"产品成了"。接口先行,是工程和手艺的分水岭。
- 最常见翻车点:跳过①直接训模型、跳过⑥上线即裸奔、②的数据没版本导致④无法复现。
- 最小可行产品(MVP)思维:第一条管道不必全自动——先"人肉跑通"每个环节,再逐个自动化,风险最低。
7.2数据管线:模型的"食品工厂"
数据是模型的饭。一条正规的数据管线像食品工厂:进料 → 清洗 → 质检 → 分装 → 保鲜。每个环节都标注"常见坑"。
图 7-2 · 数据管线。五道工序 + 五条"坑"标注。工程分解在这里的价值:把"整理数据"这种模糊活儿,拆成有输入、有输出、有验收标准的五道工序。
7.3两个世界:训练世界与推理世界
同一个模型文件,在两个世界过着完全不同的日子。工程上必须分别设计——这是最容易被人忽略的"约束"。模型文件只是中间产物,两边都要为它铺路。
图 7-3 · 两个世界。训练要"利用率"和"可复现",推理要"延迟"和"吞吐"——指标完全不同,所以架构分开设计(训练集群 vs 推理服务)。模型文件在两世界之间还要过一道"部署优化"关卡。
- 显存是第一约束:7B 参数 FP16 约 14GB,两张普通卡才放得下——所以量化(INT8 减半)是推理标配。
- KV Cache 的工程意义(呼应第 1 章知识树):大模型推理要缓存已算过的注意力键值,代价是显存随上下文线性增长——这就是长对话"越聊越贵"的根源。
7.4MLOps 最小闭环:让实验可以复现
工程分解的最后一块:把"炼丹"变成"科学"。没有记录就没有科学——一个无法复现的实验等于没做。
图 7-4 · MLOps 闭环。工程分解的收尾:把"记忆"外包给系统。从跑第一个实验起就记录,比事后补记录靠谱一百倍。这也是《模型思维》里"可证伪性"的工程化——没有记录,你连"什么有效"都无法证明。
- 开始用工具:个人起步可以先用"实验记录表 + 命名规范"(如
v3_lr1e-4_batch64_seed42),团队再上 MLflow / W&B 这类平台。 - 监控不止是模型:数据分布漂移(第 4 章提到的 Q3)、模型输入变化、用户反馈回流——生产环境的"体检"永远在线(图 7-1 的第⑥环)。
▶配合视频:吴恩达深度学习(中文语音版)
工程章的配餐是吴恩达的体系课——他把"从想法到落地"的流程讲得最结构化,正好呼应本章的管道思维。
🎬 吴恩达《深度学习》中文语音版(双语字幕 · 高清)—— 结构化程度极高,呼应第 1 章地图与本章管道
在 B 站打开 ↗
★本章小结
1
看管道需求 → 数据 → 模型 → 评估 → 部署 → 监控,闭环迭代。模型只是六分之一。
2
建数据管线采集 → 清洗 → 标注 → 切分 → 版本化,五道工序各有验收标准。
3
分两个世界训练要利用率/可复现,推理要延迟/吞吐;部署优化三件套:量化、蒸馏、剪枝。
4
上 MLOps 闭环实验 → 记录 → 对比 → 复现;复现四件套:代码 + 数据 + 超参 + 种子。