Back to Moonshot jobs
Job Description
职位概览 在 Moonshot,我们相信强化学习是通往 AGI 的关键路径。我们正在寻找深谙 GPU 性能极限的 RL Infra 工程师,打造支撑下一代大模型自我进化的基础设施。 你将直面 RL 训练的核心矛盾:训练与采样的异构负载、频繁权重复制带来的通信开销、多轮超长Agentic Coding和KimiClaw 场景的rollout效率。通过极致的工程优化,让 RL 训练跑得更快、更稳——每一次参数更新,都让 Kimi 的推理能力更进一步。
核心职责 RL 训练架构:针对大规模 Agentic RL 场景,设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享 Rollout 效率优化:深度定制 vLLM,优化 Rollout 阶段的 KV Cache 复用、量化和投机方法,将 Token 生成延迟压至极限 算法/框架/硬件协同优化:深入理解硬件,为 RL 的不同算法负载、不同硬件设施定制最优并行策略,最大化 MFU。
技术要求 希望你至少熟悉其中一个方面:
- 通用训练/推理
- 精通 Megatron-LM 分布式并行(TP/PP/CP/EP),能针对 RL 的多模型场景定制调度策略
- 熟悉 vLLM / SGLang 核心机制(PageAttention、Prefix Caching、FlashAttention、MTP),具备二次开发能力
- 扎实的 CUDA / Triton / Cutlass 编程能力,有过算子开发经验,能编写贴合 SM 调度与内存层次的高性能 Kernel
- 熟练使用 Nsight 工具链进行全链路性能分析,用数据驱动优化
- 强化学习
- 深入理解 RLHF / RL 推理的数据流:Policy 采样 → Reward 评估 → 优势估计 → 策略更新,能针对每个环节的负载特征做针对性优化
- 熟悉 PPO、GRPO、DPO 等算法的工程实现细节,理解其稳定性挑战与优化技巧
- 有大规模 RL 训练(千卡以上)实战经验,处理过训练崩溃、奖励 Hack、方差爆炸等典型问题
为什么是你 希望你具备第一性原理的思维方式和精益求精的极致追求。不满足于"跑通 RL",而是持续压榨硬件效率的上限,并与算法团队深度协同,探索下一代 RL 训练框架的演进方向。 加入 Moonshot,让每一次 RL 训练都成为 Kimi 智能跃迁的阶梯。
About Moonshot
First seen: May 11, 2026
Last updated: August 14, 2026