FEATURED · 精选文章

MLOps Zoomcamp 课程更新战略:面向生产级 ML 与 AI 系统的课程重构方案

发布时间 / 2026/9/14 11:36:08
来源 / 创域科博编辑部
栏目 / 资讯中心
MLOps Zoomcamp 课程更新战略:面向生产级 ML 与 AI 系统的课程重构方案 MLOps Zoomcamp 课程更新战略面向生产级 ML 与 AI 系统的课程重构方案【免费下载链接】mlops-zoomcampFree MLOps course from DataTalks.Club. Register here to get notified about the next cohort项目地址: https://gitcode.com/GitHub_Trending/ml/mlops-zoomcamp本文基于 MLOps Zoomcamp 仓库中的深度研究文档 research/course-renewal-strategy.md系统梳理 MLOps 课程在 2026 年前后的更新战略为什么课程不应关停、也不应改成 LLMOps 单一课程而是围绕“生产级 ML 与 AI 系统工程”这一持久能力重构教学。读完本文你可以掌握一份可直接执行的课程审计结论、八个模块的新课程结构、推荐技术栈选择原则、AI 辅助学习验证协议、期末项目评分标准重设计以及利用现有流量完成平滑迭代的落地路线图并用当前仓库的源码与课程材料验证每一项判断。执行摘要保留品牌更新承诺研究文档的核心结论明确课程不应被关停也不应改造成 LLMOps 单一课程。最强选项是保留高辨识度的MLOps Zoomcamp品牌同时更新其课程承诺MLOps Zoomcamp: Production ML AI Systems学习如何把一个模型或 AI 功能变成可靠、可观测、可治理且经济上可持续的生产系统。文档把课程定位为“一个有累积技术债的强搜索与社区资产”而非死资产。当前仓库 READMEREADME.md也印证了这一判断课程以 9 周结构覆盖从训练、实验跟踪到部署与监控的完整链路且当前处于“2026 年没有 live cohort、完全可自定进度学习”的状态。研究文档同时指出一处必须优先修复的信息不一致仓库已说明 2026 年没有 live cohort但落地页仍可能给访客留下“春季通常开课”的印象。访客应当在第一时间清楚地了解课程当前是否活跃是否支持自定进度学习哪些模块是最新的哪些模块属于遗留内容是否计划推出更新版本在哪里订阅后续动态。对于一个更新版课程研究文档给出的合理内容配比是75–80%通用生产 ML 工程——数据、流水线、测试、部署、可观测性、可靠性、安全、治理与成本15–20%GenAIOps 与 LLMOps作为同一生产生命周期的延伸5–10%AI 辅助工程——用 AI 做代码生成、测试、迁移、调试、基础设施即代码、文档与事故分析。整个战略的关键机会是把课程重新定位到一个持久的能力上工程化并运营那些包含 ML 或 AI 组件的生产系统。一、MLOps 是否仍然重要组织语境变了而不是学科消失了研究文档的第一个论点是AI 采用量暴涨但“用 AI”和“可靠地运营 AI”是两回事。许多组织可以搭原型、调 API、训模型但远 fewer 的组织能持续做到发布后保持质量诊断性能退化安全地更新模型控制延迟与成本复现历史结果管理数据血缘与审批流程把技术指标连接到业务结果。这就是现代 MLOps 问题。行业调研如 DORA、Stanford AI Index 等公开研究文档中列为参考来源持续表明ML 系统中的故障诊断困难、缓慢且很少与可度量的业务价值挂钩。因此市场问题早已不是“怎么训模型”而是如何把模型和 AI 功能变成可靠的产品职位头衔在变化职责内核稳定“MLOps”一词仍在使用但相关工作日益分散到以下角色Machine Learning Engineer、ML Platform Engineer、AI Platform Engineer、ML Infrastructure Engineer、Applied AI Engineer、GenAI Platform Engineer、Production AI Engineer。无论头衔如何这些角色的重复职责高度相似训练与评估流水线、批处理与在线推理、模型服务、CI/CD、数据与模型质量、特征基础设施、可观测性、事故响应、平台开发者体验、治理、基础设施与 GPU 利用率、延迟与成本优化、LLM 评估与追踪。一个有用的定位陈述是MLOps 仍然是一门重要的工程学科但它不太可能再作为独立的运营职能由专职 MLOps 团队拥有它正在成为 ML 工程与 AI 平台工程的核心组成部分。学习者可能不会去投一个叫“MLOps Engineer”的岗位但课程技能对 ML Engineer、AI Engineer 和 Platform Engineer 岗位依然高度相关。二、今天的 MLOps 日常工作Ship、Operate、Enable、Govern、Improve现代生产 ML 工作不再以“持续训练新模型”为中心而是严肃的软件、数据、平台与可靠性工程。研究文档把它划分为五大类这一划分可以作为新课程的教学骨架。2.1 Ship安全地交付变更工程师把一个 notebook 或原型转化为可维护的软件包、训练流水线、批处理作业、在线服务、可复用的内部组件。随后再加上自动化测试、代码评审、依赖管理、可复现环境、CI、模型或评估门禁、部署自动化、回滚流程。在线系统可能还包括契约测试、负载测试、金丝雀发布、影子流量、版本路由。批处理系统则涉及分区、回填backfill、重试、幂等性、新鲜度检查、SLA 监控。这一角色的定义性特征正日益成为端到端所有权——从特征与训练到部署与生产排障。仓库中的 03-orchestration/README.md 就体现了这一教学思路模块 3.3 要求学习者把 notebook 转成的 Python 脚本接入编排器完成“运行工具 → 编排工作流 → 参数化每月调度训练数据取前两个月、验证数据取前一个月→ 回填历史月份 → 可选部署上云”的完整链路。2.2 Operate让系统持续运转工作中相当大一部分是处理运行期故障流水线失败、数据过期、上游 schema 变更、延迟上升、错误率上升、推理成本过高、离线与在线结果发散、新版本模型行为异常、外部供应商行为变化、事故需要调查与缓解。常见的生产关注点包括SLO 与 SLI、可用性、延迟、token 用量、GPU 利用率、队列深度、吞吐量、失败率、单请求成本、运维 runbook、postmortem。2.3 Enable为其他团队构建平台在很多公司MLOps 或 ML 平台工程师并不被期望手动部署每个模型而是为其他工程师和数据科学家打造黄金路径golden path。典型的平台交付物包括项目模板、可复用流水线组件、SDK 与 CLI、标准服务运行时、标准 CI/CD 工作流、内建可观测性、算力接入、制品与模型注册表、密钥与权限管理、文档、自助部署。ML 平台团队的“产品”不是模型而是让其他团队能安全交付 ML 系统的内部平台与开发者体验。2.4 Govern让系统可审计、可控制生产 ML 系统应当能回答这些问题这个版本用了哪些数据训练哪些代码与配置产出了它谁批准了这次发布部署前有哪些评估结果服务可以访问哪些数据密钥存放在哪里结果能否复现系统能否回滚哪些操作被记录在审计日志中这些要求已不再局限于强监管行业血缘、文档、访问控制、审批工作流与可审计性正在成为常规生产工程关注点。欧盟 AI 法案也提高了治理、文档、透明度和风险管理的实践重要性。课程不必变成法律课但应教授让治理成为可能的工程基础。2.5 Improve把技术性能连接到真实结果成熟的 ML 团队不只监控模型准确率和漂移还关注覆盖率、采用率、转化、用户投诉、人工覆盖manual override、单预测成本、下游错误、延迟结果、人工审查率、反馈回路质量。这正是“监控 画一张漂移图”这一定义不再充分的主要原因之一。三、过去五年发生了什么变化研究文档用一张对照表总结了新旧 MLOps 重心的迁移这张表可以直接作为课程更新的“差异清单”早期 MLOps 重心当前生产重心模型是主要制品系统才是制品数据、特征、代码、模型、API、工作流、策略与可观测性实验跟踪完整血缘代码 → 数据 → 特征 → 模型 → 评估 → 部署注册表的 Staging/Production 阶段版本、别名alias、标签、策略、审批与部署元数据一次性 API 部署批处理、在线、流式安全发布、回滚、影子、金丝雀监控准确率与漂移服务 基础设施 数据 模型 业务 成本的可观测性以自动再训练为目标有意为之的再训练定时/事件/人工触发 评估门禁与审批针对 Python 代码的 CI/CD覆盖代码、数据、模型、策略与评估检查的 CI/CD/CT单一云厂商的专用技术栈架构模式与可移植接口接收工单的集中式 MLOps 团队自助服务化平台与黄金路径以手工开发基础设施为主带强制验证的 AI 辅助工程只有预测式 ML通用生产基础 GenAI 特有制品各大云厂商与平台厂商如今普遍把 GenAIOps 描述为 MLOps 生命周期的扩展而非替代。传统制品依然重要代码、数据、特征、模型二进制、环境、部署、指标。GenAI 新增了这些制品prompt、链与工作流、检索索引、评估数据集、适配器、工具定义、安全策略、会话追踪、token 用量、用户反馈。监控已经变成可观测性现代课程至少应教授五个可观测性层1. 服务层可用性、延迟、吞吐量、错误、饱和度。2. 基础设施层CPU 与 GPU、内存、磁盘、队列深度、网络、自动扩缩行为。3. 数据层新鲜度、schema、缺失值、分布、取值范围、类别覆盖、时间点正确性point-in-time correctness。4. 模型层预测分布、校准、质量、漂移、分群表现、延迟标签评估、在线/离线一致性。5. 产品与业务层采用率、转化、收入或节省、用户反馈、人工干预、单次成功结果的成本。对 GenAI 系统还需额外关注prompt 与模型版本、追踪、检索到的文档、工具调用、token 用量、评判模型judge分数、安全失败、用户反馈、供应商错误、缓存命中率。OpenTelemetry 正在为生成式 AI 可观测性制定语义约定semantic conventions这正是课程应聚焦概念与接口而非单一厂商工具的一个例证。四、当前 MLOps Zoomcamp 哪里过时了逐模块审计研究文档首先肯定当前学习路径整体依然扎实——基础设施、实验跟踪与模型注册表、编排、部署、监控、测试与 CI/CD、期末项目问题不在主题清单而在于部分模块过于贴近 2022–2024 年的技术现实。下面结合仓库实际内容对文档中的模块审计表逐条给出佐证。模块审计总表模块建议应改变什么介绍与环境重写环境准备用现代可复现环境替换旧版 Anaconda 方案pyproject.toml、锁文件、容器或 devcontainer、一致的任务运行器实验跟踪与 MLflow保留并更新概念仍然相关但注册表阶段已弃用应教授别名、标签、血缘与晋升标准编排大幅重写不要一次教五个编排器选定一个规范工具教授工作流设计、重试、幂等、分区、回填与故障处理部署保留模式替换规范实验Flask、Lambda、Kinesis 降为可选或遗留示例以批处理打分与容器化 FastAPI 为主路径监控最激进地重写用端到端可观测性取代狭窄的漂移看板方法SLO、延迟标签、业务指标、告警、事故与 postmortem最佳实践与 CI/CD保留并扩展增加数据契约、模型与评估门禁、密钥管理、安全扫描、部署策略、血缘与成本检查期末项目替换评分标准奖励可复现性、可靠性、可观测性、安全发布、成本意识、安全与工程权衡——而不是工具或云服务数量审计结论在仓库中的证据1. 介绍模块Anaconda 2022 版安装脚本。01-intro/README.md 的 1.2.2 节给出的环境准备是下载Anaconda3-2022.05安装包、apt 安装 Docker 的四步流程。这正对应审计表中“用pyproject.toml、锁文件、容器/devcontainer 替换旧 Anaconda 方案”的判断——脚本已经与 2026 年的可复现环境实践脱节。值得注意的是仓库中其实已存在更现代的参照06-best-practices/code/pyproject.toml 与 06-best-practices/code/Makefile 展示了pyproject.toml Makefile 任务运行器的形态说明“现代环境”在仓库内已有现成样本可以提炼为规范。2. 实验跟踪模块MLflow 阶段弃用是真实的版本债。02-experiment-tracking/README.md 中明确标注“从 MLflow 2.9 起模型注册表阶段被弃用应改用模型版本标签与别名如用set_registered_model_alias替代transition_model_version_stage”并提示list_experiments已被search_experiments取代。这与审计表“保留并更新教别名、标签、血缘、晋升标准”完全一致——概念层实验跟踪、注册表、模型管理仍然成立需要更新的是 API 与治理语义。3. 编排模块五个编排器并列 “用 ChatGPT 帮忙”正是核心教学问题。03-orchestration/README.md 的 3.3 节写道“This unit has no video, but you can use ChatGPT to help you”随后给出工具清单Airflow、Prefect、Dagster、Kestra、Mage “或其他工具”并指向历史 cohort 的 Prefect2022/2023与 Mage2024笔记。审计表所说的“不要一次教五个编排器”与“AI 不能替代教学”在这份 README 中有直接文本证据。同时cohorts/ 目录下按 2022–2025 逐年保留了不同的编排方案实现Prefect 笔记、2023 的 Prefect 3.x 分节实验、2024 的 Mage既是“遗留分支”的自然形态也说明“稳定概念与版本化实验分离”这一建议在仓库结构中已有雏形。4. 部署模块Flask / KinesisLambda / Batch 三轨并存。04-deployment/README.md 的结构是4.2 用 Flask Docker 部署 Web 服务04-deployment/web-service/4.3 从 MLflow 注册表拉取模型04-deployment/web-service-mlflow/4.4 可选的 Kinesis Lambda 流式部署04-deployment/streaming/README 自己标注该实验涉及 AWS 费用、属于可选4.5 批处理打分脚本04-deployment/batch/含score.py、score_backfill.py、score_deploy.py。审计表建议“保留 Flask、Lambda、Kinesis 为可选或遗留示例以批处理打分与容器化 FastAPI 为主路径”与这个目录结构一一对应——当前仓库实际上已经把流式标注为可选方向正确需要的是把批处理与容器化在线服务提升为主干。5. 监控模块版本敏感与“漂移看板”定位。05-monitoring/README.md 展示了当前监控实验的面貌Evidently 指标计算05-monitoring/evidently_metrics_calculation.py→ PostgreSQL 存储 → Grafana 预配置看板docker-compose up启动db/adminer/grafana三个服务每 10 秒模拟一次每日批处理监控。同时 README 专门注明“Evidently 0.7.0 之后有大规模更新Evidently ≥ 0.7.0 的可用示例见post-evidently-0.7文件夹”05-monitoring/post-evidently-0.7/README.md5.7 节甚至提示“视频中的 Prefect 段落可以跳过Prefect 在 2024 版课程中不被官方支持”。这些标注本身就是审计表“监控模块应最激进重写”的证据内容围绕漂移检测与 Evidently 报告/测试套件05-monitoring/debugging_nyc_taxi_data.ipynb而缺少 SLO、告警、事故演练与 postmortem 这条现代主线。6. 最佳实践模块质量工程骨架完整但仍是“单云实现”。06-best-practices/README.md 的 Part A 覆盖 pytest 单测、docker-compose 集成测试、LocalStack 云服务测试、linting/格式化、pre-commit、MakefilePart B 用 Terraform 搭建 AWS 流式流水线Kinesis 生产/消费、Lambda 服务 API、S3 模型制品、ECR 镜像仓库四个模块对应 06-best-practices/code/infrastructure/modules/ 下的ecr、kinesis、lambda、s3四个 Terraform 模块再用 GitHub Actions 做 CIci-tests.yml环境准备、单测、集成测试、Terraform plan触发条件为pull-request到develop与 CDcd-deploy.ymlTerraform plan/apply、Docker 构建推送 ECR、更新 Lambda 配置触发条件为push到develop。配套脚本见 06-best-practices/code/scripts/deploy_manual.sh、publish.sh、test_cloud_e2e.sh测试代码见 06-best-practices/code/tests/model_test.py 与 06-best-practices/code/integration-test/test_kinesis.py。这一模块的问题与审计表一致内容应“保留并扩展”——在现有 CI/CD 上补数据契约、模型/评估门禁、密钥、安全扫描、部署策略、血缘与成本检查并让 Terraform 案例从“AWS 专用栈”上升为“架构模式 可移植接口”的教学。7. 期末项目现行评分标准奖励“技术数量”。07-project/README.md 的 Evaluation Criteria 按维度打分Cloud0/2/4 分最高分要求云上 IaC、实验跟踪与注册表最高 4 分、工作流编排最高 4 分、模型部署最高 4 分、模型监控最高 4 分、可复现性最高 4 分、最佳实践单测 1 分 集成测试 1 分 linter 1 分 Makefile 1 分 pre-commit 1 分 CI/CD 2 分。这正是文档所说的“奖励额外技术或云服务会助长架构表演architecture theater”——学习者可能加更多工具却没有得到更可靠的系统。文档中“替换评分标准、奖励证据与工程质量”的建议就是针对这张打分表的。核心教学问题AI 不能替代教学文档点明一个课程级的教学问题不应把“让 ChatGPT 去实现若干工具之一”当作教学的替代品。AI 当然应该被纳入更新后的课程但必须受控AI 产出初稿。学习者必须通过测试、指标、受控故障与明确的架构理由来验证其行为。DORA 研究也持类似观点AI 放大的是已经存在的工程系统在交付基础薄弱、反馈回路差的组织里AI 可能提高产出的同时降低稳定性。五、2026 年的现代课程在教什么文档对 2026 年的课程格局做了比较注意区分“2026 年新开设”与“2026 年更新的既有课程”外部课程仅作为方向参考Google Cloud 的 MLOps for Generative AI当前课程把预测式 ML 与 GenAI 组合而非互相替代常见主题包括特征存储、训练流水线、模型评估、血缘、自动化工作流、Kubeflow 组件与 AI 辅助的数据科学工作流。可借鉴点教一套预测与生成式系统共用的生命周期把评估纳入流水线教血缘与可复用工作流组件把 AI agent 当作工程助手或工作负载而非神秘的独立学科。Microsoft AI-300运营化 ML 与 GenAI 方案把 MLOps 与 GenAIOps 合并进同一个运营角色内容覆盖基础设施、传统 ML 生命周期管理、GenAI 应用与 agent、评估、监控、优化、GitHub Actions、命令行工具与 IaC。可借鉴点ML 与 GenAI 共享的运营层把基础设施、可观测性、治理列为一等主题部署后评估与优化agent 只是众多工作负载类型之一不是课程中心。CMU 的 Machine Learning in Production涵盖经典 ML、LLM 与 agent但组织方式围绕真实生产系统——真实用户、生产负载、安全、公平、透明、部署与运维。这是重构 MLOps Zoomcamp 特别有用的范本课程围绕工程决策与失效模式组织而不是工具清单。可借鉴点从产品与系统需求出发而不是从 MLflow 出发选工具之前先讨论失效模式与风险按后果而非技术数量评估架构。KodeKloud 的 Hands-on MLOps与Board Infinity 的 MLOps前者仍以经典 MLOps 为主摄取、编排、跟踪、部署、监控、治理、CI/CD/CT后者覆盖 FastAPI、Docker、GitHub Actions、多云、多模型 API、A/B 测试、延迟、批处理与实时部署。两者共同传递一个强信号传统生产 ML 没有消失也不需要变成 LLM 专属课程。LLMOps 专项课程当前 LLMOps 课程常见内容——token 成本、延迟、可靠性、LLM-as-a-judge 门禁、追踪、RAG、部署模式、评估数据集、安全检查——适合作为 GenAI 模块的参考但不应成为整个 MLOps Zoomcamp 的模板。总体模式强的现代课程要么走“完整生产 ML 基础 GenAI 评估与可观测性扩展”要么走“单独的 LLMOps 模块/专项”它们几乎都不宣称预测式 ML 过时或 MLOps 现在就该只讲 prompt 与向量数据库。六、建议的新课程结构Module 0–7Module 0生产级 ML 系统而不只是模型第一个模块应给学习者一张完整系统地图源数据、转换、特征、训练、评估、注册表、批处理与在线推理、下游消费者、反馈、可观测性、治理。关键学习目标是把三件事区分开模型性能、服务性能、产品性能。技术环境准备应包含现代 Python 工程结构、pyproject.toml、锁定的依赖、Makefile 或任务运行器、容器或 devcontainer、配置管理、密钥分离。Module 1从 Notebook 到可维护的 ML 代码目标要超越“把 notebook 单元格搬进.py文件”。主题包括包结构、显式接口、配置、数据契约、单元测试、基于属性的测试、确定性行为、可复现训练、依赖边界、日志与错误处理。AI 练习让 AI 把一个组织混乱的 notebook 重构成一个包然后给学习者隐藏测试、边界用例、故意破坏的假设、可复现性要求。评估点是学习者能否识别并修正 AI 生成的问题。Module 2实验、数据集、血缘与注册表文档认为 MLflow 值得保留——它现在横跨传统实验跟踪、模型注册表、追踪、评估、prompt 管理与 GenAI/agent 工作流是连接经典 ML 与生成式 AI 的实用桥梁。课程应教授什么必须被记录一次 run 如何关联代码与数据版本如何比较模型如何定义晋升标准别名与标签如何用部署如何复现实验跟踪与生产血缘有何不同。对照仓库现状02-experiment-tracking/ 模块已有实验跟踪、模型保存/加载、注册表与 AWS 上的 MLflow 部署02-experiment-tracking/mlflow_on_aws.md等内容更新重点就是把“stages”语义迁移到“别名 标签 血缘”。Module 3流水线与编排主路径只选一个规范编排器其他工具放入对比指南、可选实验或社区维护的示例。核心概念任务与资产、调度与事件触发、重试、幂等性、分区、回填、缓存、制品、故障处理、本地与远程执行、血缘、流水线可观测性。工具选择两个合理选项——Airflow行业认知度高、与数据工程重合大或Dagster现代资产导向教学模型、开发者体验好。具体工具的重要性低于“避免五编排器目录”这一点。对照 03-orchestration/README.md 现状五个工具并列 ChatGPT 兜底这正是最需要重写的模块。Module 4服务与安全交付模块应把三种部署模式都当作一等公民。批处理批处理推理不应被视为简化的部署模式在许多真实系统中它是主要架构。主题分区作业、回填、输出契约、幂等性、新鲜度 SLA、成本控制、下游依赖。当前 04-deployment/batch/ 中的score.py/score_backfill.py已经是这条主线的起点。在线规范实验采用 FastAPI 或专用服务框架 Docker内容包括模型加载与预热、健康检查与就绪检查、schema 校验、负载测试、延迟预算、自动扩缩、托管容器运行时。流式保留为进阶或可选实验。Kinesis Lambda 可以继续作为遗留 AWS 实现但不应成为每个学习者的必经路径——这与 04-deployment/README.md 中已把 4.4 流式节标注为 Optional 的处理方向一致。发布工程新增模型与 API 兼容性、金丝雀部署、影子部署、蓝绿部署、回滚、版本路由、类生产流量验证。KServe 可以作为这些模式在 Kubernetes 上的可选实现引入而不是必选前置。Module 5可观测性、可靠性与事故文档建议这成为更新后课程的核心模块。度量什么服务指标可用性、错误率、p50/p95/p99 延迟、吞吐量数据指标新鲜度、缺失值、schema 有效性、取值范围、类别、覆盖率模型指标预测分布、校准、漂移、分群表现、延迟标签质量产品指标采用率、业务结果、人工覆盖、单次成功决策的成本流水线指标耗时、失败、重试、过期分区、数据可用性。实战作业运行一个服务故意引入——schema 变更、过期数据、延迟回归、分布漂移、损坏的依赖、某个用户分群的质量退化。学习者必须1检测到问题2定义告警3估计影响面4定位原因5执行缓解或回滚6写一份简短的 postmortem。这比只做一个漂移看板更贴近真实生产工作。工具选型可能的技术栈——OpenTelemetry 负责追踪、指标与上下文Prometheus Grafana 负责服务与基础设施指标Evidently 或自定义检查负责数据与模型质量结构化日志告警。进阶 GenAI 服务场景下vLLM 可作为可选运行时展示其 Prometheus 指标与逐请求信息可用于 SLA 与成本核算。对照仓库现状05-monitoring/ 已有 Prometheus/Evidently/Grafana 的端到端演示与 Prefect MongoDB 的批处理监控05-monitoring/dummy_metrics_calculation.py重写时可以在这套骨架上补齐告警、SLO 与事故演练而非推倒重来。Module 6CI/CD、基础设施、安全、治理与成本现有最佳实践模块对照 06-best-practices/README.md 的 Part A/Part B 结构可以升级为一个完整的质量体系。流水线应当检查格式化与静态分析、单元测试、集成测试、契约测试、数据契约、训练可复现性、模型质量阈值、分群回归、延迟、容器镜像体积、依赖漏洞、基础设施 plan、评估报告、生产发布所需的审批。附加主题Terraform 或 OpenTofu、IAM 与最小权限、密钥管理、依赖扫描、制品签名与 SBOM作为进阶、数据访问控制、审计日志、血缘、成本预算与配额。特征存储应被教授为针对特定问题的解法训练-服务一致性、时间点正确性、可复用在线特征而不是每个 ML 系统的必选项。Module 7GenAIOps 与 LLMOps 扩展该模块应回答一个问题在生产生命周期中什么保持不变什么是 LLM/RAG/agent 系统特有的保持不变的版本控制、CI/CD、部署、访问控制、可观测性、回滚、SLO、成本管理、事故响应、用户反馈。新增的prompt 版本、模型与供应商版本、链与 agent 配置、检索语料与索引血缘、评估数据集、确定性检查、基于模型的评估、人工审查、追踪与工具调用、prompt 注入检查、不安全输出检查、token 成本、上下文大小、缓存命中率、供应商降级、会话级评估。各大云厂商就是这样描述 GenAIOps 的它是 MLOps 的特化扩展带 prompt 管理、检索、评估、监控与反馈回路。为什么 LLMOps 不应成为主焦点LLM 工具链的演进远快于底层生产概念。围绕当前流行 agent 框架组织的课程很快就会再次过时。更好的设计是做一个小型 RAG 或使用工具的应用用它来教评估、追踪、版本化、安全发布、延迟与成本权衡、事故调查。GenAI 成为第二类工作负载用来演示相同的生产原则。七、学习者应如何使用 AI验证协议与披露要求AI 以两种方式改变了 ML 工程1工程师现在运营 GenAI 系统2工程师用 AI 构建和维护包括预测式 ML 在内的各类软件。这两个主题应当分开教。AI 作为工程助手任务AI 如何帮忙工程师必须验证什么Notebook 转包重构与脚手架接口、隐藏状态、可复现性测试生成测试用例覆盖率、断言是否有意义、边界用例流水线生成 DAG 或资产幂等性、重试、回填、依赖API脚手架端点校验、并发、错误处理基础设施即代码起草 TerraformIAM、破坏性变更、网络、成本监控建议告警信号质量、阈值、误报事故分析汇总日志与追踪根因与支撑证据评估生成合成用例与评分标准偏差、泄漏、代表性文档起草 runbook 与 ADR准确性、与实际行为一致强制 AI 验证协议每个 AI 辅助任务都应以五个制品收尾代码或配置的 diff测试运行证据简短的决策说明已知风险或未验证假设的清单。这既教学习者如何使用 AI也教他们不要盲目信任 AI。期末项目可以要求一份AI 使用披露在哪些地方用了 AI、用了哪个工具、它生成了什么、结果如何验证、发现了哪些 AI 错误。课程应评估验证过程的质量而不是评估是否使用了 AI。八、推荐技术栈每个能力选一个规范工具课程不应变成大型产品目录。应定义能力并为每个能力选一个规范工具能力规范选项可选/进阶替代Python 环境pyproject.toml 锁定依赖devcontainer 或 Codespaces实验跟踪与注册表MLflow托管替代品放入对比指南编排Airflow或DagsterPrefect、Kestra、Mage 作为可选实验批处理推理被编排的 Python 作业Spark、Databricks 作为进阶在线服务FastAPI 容器BentoML、Ray ServeKubernetes 服务不要求KServe 作为进阶LLM 推理基础实验用供应商 APIvLLM 作为进阶指标Prometheus Grafana托管云监控追踪OpenTelemetryMLflow tracing 或专用 LLM 工具数据与模型检查契约 Evidently 或自定义检查Great Expectations 及替代品CI/CDGitHub Actions可复用工作流基础设施即代码Terraform 或 OpenTofu云厂商特定模块打包与发布Docker注册表、签名、SBOM 作为进阶技术选型原则不要把 Kubernetes 设为必选。K8s 对平台工程很重要但对第一条生产路径复杂度太高。学习者应先在托管容器平台上理解服务、扩缩、发布、回滚、可观测性这些概念再引入 Kubernetes。保留 MLflow。这是“更新现有栈比替换更实际”的少数案例之一。它现在支持传统 ML 跟踪、注册表、评估、追踪、prompt、LLM 与 agent 工作流是连接经典与生成式 AI 的桥梁——这与 02-experiment-tracking/ 模块“保留并更新”的审计结论互相印证。把批处理当作一等模式。在线端点不是所有 ML 项目的终点。批处理对推荐、风险评分、预测、数据增强、定时决策系统、大规模离线处理依然关键——仓库中 04-deployment/batch/ 的独立目录结构说明这条线从未消失只是过去被放在课程末尾。把稳定概念与版本化实验分离。讲幂等性、金丝雀部署、延迟标签的视频可以用很多年而绑定某一个特定版本的 Prefect 或 Evidently 的分步教程可能几个月内过时。课程应显式区分稳定的概念课 vs 版本化的动手实验。仓库中 05-monitoring/post-evidently-0.7/ 这种“为新版 Evidently 单独维护一套实验”的做法正是一种朴素的版本化实验隔离值得推广为正式机制。九、重设期末项目从“技术数量”到“工程证据”现行项目页07-project/README.md要求“选数据集、训练并跟踪实验、建训练流水线、以批处理/Web/流式方式部署、监控模型、遵循最佳实践”允许使用课程之外的技术并要求解释所用工具——问题不在任务描述而在评分标准奖励云服务与 IaC 的组合数量。新评分标准应奖励证据与工程质量共九个维度1. 产品定位用户或消费者预测或决策延迟与新鲜度预期业务指标基线失败影响。2. 可复现性与血缘版本化代码与配置可重复环境数据集与版本信息训练 run模型别名或版本部署元数据。3. 自动化质量门禁代码测试数据检查模型评估分群评估集成或契约测试延迟或负载测试。4. 部署与回滚批处理或在线部署显式发布流程上一版本保留回滚或版本路由兼容性考量。5. 可观测性服务指标数据与模型指标产品指标日志或追踪告警看板。6. 运维runbook一次模拟事故诊断缓解postmortem。7. 安全、治理与成本密钥访问模型数据敏感度可审计性与血缘粗略成本模型或预算已知风险。8. 工程理由学习者应解释——为什么选批处理或在线为什么需要/不需要特征存储为什么选这个编排器哪些权衡是有意接受的。9. AI 使用披露在哪里用了 AI它生成了什么如何验证发现了哪些错误。这样的项目比“在同一个方案里同时要求 Terraform、Kubernetes 和多个 AWS 服务”更能证明学习者具备真实生产工作的能力——它恰好回应了现行 07-project/README.md 评分表中“Cloud IaC 拿满分”的倾向。十、如何利用现有流量导航、状态与路由10.1 保留现有 URL 与主品牌。“MLOps Zoomcamp”应保留在标题、URL、仓库名、落地页首段中以保住累积的搜索意图、反链与社区认知。加一个现代副标题即可Production ML AI Systems: From Experimentation to Reliable Operation完整改名为“AI Platform Engineering Zoomcamp”或许更时髦但会削弱现有搜索与品牌资产。10.2 立即澄清课程状态。落地页应明确写出课程支持自定进度学习2026 年没有 live cohort材料正在更新中哪些模块是最新的哪些是遗留的在哪里订阅更新。落地页与仓库必须传达一致状态——当前 README.md 中的对照表Live Cohort “Not currently scheduled” / Self-Paced “Anytime”和 2026 无 cohort 的 NOTE 已经做到了仓库侧需要落地页同步。10.3 发布《MLOps 自第一版以来发生了什么变化》。这可以成为独立文章与新课程的入口建议章节模型阶段 → 别名与策略仅 Flask 部署 → 批处理 容器服务漂移看板 → 端到端可观测性CI/CD → 质量与策略门禁模型制品 → 生产系统MLOps → ML 与 AI 平台工程LLMOps 增量AI 辅助工程。这篇文章既能向老学员解释更新原因也能给新访客一张现代领域地图。10.4 每节课标注元数据。每节课可以展示概念状态stable实验验证日期测试版本维护者核心/社区遗留替代方案链接。这样可避免一个过时的 Prefect 实验让编排概念本身显得过时。10.5 把流量当研究渠道。用短问卷替代通用等待列表问题包括当前角色目标求职、生产项目或平台工作预测式 ML 还是 GenAI最大生产挑战偏好云还是本地优先自定进度还是 cohort是否对 capstone 评审感兴趣。同时分析模块间导航、跳出率、搜索词、GitHub issues、Slack 问题、热门旧视频、项目启动与完成情况。让更新由真实用户意图驱动而不是假设。10.6 把页面变成 DataTalksClub 生态的路由器。访客目标各异生产 ML → 更新后的 MLOps 核心LLM、RAG、agent → LLM 课程AI 辅助开发 → AI 开发者工具内容模型训练基础 → ML 课程。老流量可以在完整课程更新完成之前就先支撑更广的教育生态。十一、不重写全部内容的更新路径第一步修复信任与导航。1同步落地页与 README2明确标注自定进度状态与 2026 无 cohort3给每个模块加状态与最后验证日期4发布更新路线图5保留遗留分支或 release——cohorts/ 目录按 2022–2025 逐年归档的结构如 cohorts/2022/03-orchestration/ 与 cohorts/2025/03-orchestration/homework.md已经提供了天然的“遗留版本”载体。然后更新最过时的部分。推荐优先级1监控 → 可观测性与可靠性2编排3服务与安全交付4环境与可复现性5MLflow 迁移6期末项目评分标准7GenAIOps 扩展。监控、编排与部署这三项决定课程读起来是现代生产工程还是 MLOps 工具史概览。保留稳定讲解。许多概念课可以继续用实验跟踪、模型注册表、测试、CI/CD、IaC、批处理 vs 在线、部署模式。它们可能只需要新导言、迁移说明、更新后的实验。在完整 cohort 之前先用“Refresh”格式发布。一个小型MLOps Refresh即可一节新的导论课、一个现代端到端项目、一个可观测性与事故实验、一个 GenAIOps 扩展、一份新 capstone 评分标准。这能揭示现有流量背后的真实需求构成职业转型、实用生产工程、GenAI、平台工程还是老反链与历史兴趣。十二、不要做的事清单研究文档给出了明确的负面清单全部继承如下不要把课程变成 LangChain 与 Agent 课程——过时很快且与 LLM 课程重叠不要在主路径上教五个编排器——用一个规范实现其他放对比或社区实验不要把 Kubernetes 设为必选——它应作为进阶平台工程路径不要把监控定义为漂移看板——监控必须覆盖可靠性、数据、模型、产品、成本与事故不要用“问 ChatGPT”替代课程材料——AI 应参与带验证的受控工程工作流对照 03-orchestration/README.md 中“no video, use ChatGPT”的现状这一条指向性最强不要奖励技术数量——评估证据、可靠性、可复现性与权衡不要把持续再训练当作最高成熟度——对许多系统带评估与审批的受控再训练比全自动再训练更成熟不要创建全新的网站或仓库——更新现有资产保留链接、历史与社区。最终建议MLOps Zoomcamp 的下一版研究文档的收敛结论是最强的下一版是 “MLOps Zoomcamp: Production ML AI Systems”。课程承诺学习如何把一个 ML 或 AI 原型变成可复现、可测试、可安全发布、可观测、可运营、可改进、可治理且成本可控的生产系统。核心课程可维护的 ML 代码血缘与注册表流水线批处理与在线服务安全发布可观测性事故CI/CD 与 IaC安全、治理与成本。现代扩展prompt、RAG 与 agent 制品评估与追踪用户反馈安全token 与延迟经济学供应商与模型版本化。学习过程中的 AI学习者用 AI 做代码、测试、IaC、调试、文档每一处 AI 生成的变更都必须有测试、指标、运行证据、说明与风险评估支撑。这套结构不依赖明年最时髦的是预测式 ML、RAG 还是 agent。它教的是更持久的技能如何工程化并运营包含 ML 或 AI 组件的系统。对当前仓库而言落地路径清晰可见——各模块的 README、cohorts 归档、监控实验的目录结构与 best-practices 的 CI/CD Terraform 骨架都为“保留模式、替换规范实验、分离稳定概念与版本化实验”提供了现成的改造基础。【免费下载链接】mlops-zoomcampFree MLOps course from DataTalks.Club. Register here to get notified about the next cohort项目地址: https://gitcode.com/GitHub_Trending/ml/mlops-zoomcamp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻