AI 技能百科 English

模型服务:把机器学习模型部署成可靠的生产 API

AI 技能百科 › AI 工程 · 最后更新: 2026-08-08

定义

模型服务指围绕已训练模型上线运行的一整套工程实践:加载模型权重和预处理逻辑,暴露 HTTP/gRPC 接口,做请求路由、批处理、GPU/CPU 资源分配、自动扩缩容、版本发布、监控告警与回滚。它既可以是一个轻量 FastAPI 推理服务,也可以是基于 Triton、KServe、Ray Serve 或 BentoML 的生产级推理平台。

为什么对 AI 求职重要

AI 公司重视模型服务,因为模型只有稳定承接真实流量才会产生业务价值。掌握这项技能的人能把训练产物和线上系统连接起来,排查延迟、吞吐、显存、冷启动和错误率问题,并设计带版本、灰度、监控和成本控制的部署流程。它横跨机器学习、后端、Kubernetes、GPU 和 SRE,是 AI Infra/Platform 岗位的高频要求。

核心概念

  • Serving runtime:负责加载模型工件、暴露推理接口,并在明确资源限制内执行请求的运行时。
  • Batching 与并发:通过合并请求、调整 worker 或 replica 数,在吞吐和延迟之间做权衡。
  • 模型工件管理:对权重、tokenizer、预处理代码和配置做版本化,保证部署可复现。
  • 自动扩缩容:根据 QPS、队列长度、延迟或自定义推理指标调整实例和 GPU 资源。
  • 灰度发布:用 canary、blue-green、shadow 或 A/B 测试降低坏模型上线风险。
  • 可观测性:持续跟踪延迟、错误、资源饱和度、token 用量、漂移和模型质量信号。

学习路径

  1. 先用 FastAPI 服务一个 scikit-learn 或 PyTorch 小模型,加入 health endpoint,并打包成 Docker 镜像。
  2. 把镜像部署到 Kubernetes 或托管 endpoint,补上请求日志、延迟指标和便于回滚的镜像标签。
  3. 试用 NVIDIA Triton、KServe、Ray Serve 或 BentoML,对比 batching、GPU 支持和发布流程。
  4. 做 load test,调优并发和 batching,记录 p50/p95 延迟、吞吐、成本和失败模式。
  5. 加入模型版本、灰度发布,并同时监控系统指标和预测质量回归。

资源链接