Back to Moonshot jobs

Job Description

你将负责什么

  1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。
  • 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。
  • 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。
  • 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。
  1. 发布工程与变更安全
  • 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。
  • 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。
  • 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。
  1. 可观测性与可靠性工程
  • 与研发共建统一的 Telemetry 标准(Metrics / Logs / Traces),构建从业务指标到基础设施指标的全链路可观测性。
  • 用软件工程手段消除重复劳动(toil):自动化诊断、容量与性能管理、混沌工程与合成测试,把高频人工操作变成自助服务。
  • 持续优化资源利用率与成本效率。
  1. AI-native 与平台协作
  • 用 AI Agent 重做可靠性工作:告警分析、事故总结、自动巡检——把已在内部跑通的雏形产品化,做「AI 时代 SRE 怎么工作」的探索者。
  • 参与需求与架构评审,把可靠性前置到设计阶段,帮助业务团队早期规避技术债。
  • 用好公司统一 infra 能力,把平台能力转化为业务指标。

我们期待的你 必须项

  • 具备架构能力和意识:能清晰定义和描述业务架构,画得出系统全貌,看得清模块间的接缝;能对跨团队的技术方向形成判断并推动对齐。
  • 系统功底扎实:精通 Linux 操作系统、网络、存储,具备深度诊断与优化能力。
  • 精通 Cloud Native 架构:Kubernetes、Grafana、Loki、Helm、ArgoCD 等生态有生产环境实践。
  • AI-native 工作方式:对 AI Agent 有独到理解,自己就在用 AI 工具重做运维流程、提升工程效率。
  • 有实打实的开发能力:精通 Go 语言,必须做过 DevOps 平台或系统,能用代码把重复工作自动化掉。
  • 大规模在线业务的生产可靠性实战经验(SRE / Production Engineer / 后端出身均可),包括 on-call、故障响应与复盘驱动的改进。
  • 对业务有热情,对细节问题一丝不苟;owner 意识强烈,有强烈的推动问题解决的意愿。
  • 熟悉海内外主流云厂商的资源配置和使用。

加分项

  • 有大模型 serving / 推理链路运维经验,理解 AI 产品的可靠性特性。
  • 主导过从混乱到秩序的 SRE 建设:报警治理、发布流程重构、On-call 体系搭建。
  • 可观测性或基础设施开源项目贡献者;熟悉 Chaos Engineering、eBPF、Service Mesh 等前沿技术。

我们能提供什么

  • 直接的业务影响力:千万级用户的产品与高频模型发布,你的改进立即作用于核心业务,解决真实且紧迫的痛点。
  • 前沿的真实战场:参与快速变化的 AI 架构与产品演进路线,你遇到的可靠性问题大多是新问题。
  • 建设而非维护:我们处于快速成长期,你需要建立标准而非遵守过时的标准,有充足的发挥空间和资源支持。
  • AI-native 的实践场:把 AI Agent 用进可靠性工程,把你的 SRE Agent 产品化,这是一次全新的尝试。
  • 与优秀的工程团队协作:我们是一群务实、对技术有追求的工程师,相信你能在这里找到技术共鸣。

About Moonshot

First seen: August 15, 2026
Last updated: August 24, 2026