岗位职责
● 为后训练全链路(数据合成、评测、SFT、RL)提供稳定好用的 Agent 运行环境
● 封装统一的环境管理层,屏蔽底层差异,支持 Linux / Windows / GUI / MCP 工具等多形态环境的一键交付
● 建设 Agent 评测平台,支持 环境 × Agent × 模型 自由组合的评测与数据合成任务
● 打通评测与 RL 的环境供给,保障 rollout 阶段的并发、稳定性与可复现性
● 规模化生产镜像与任务环境,泛化 code、GUI、工具调用等场景的环境数据
● 对接云服务厂商,负责容量规划、成本优化与问题闭环
任职要求
● 知名院校大学本科学历以上,计算机相关专业
● 3 年以上后端或平台研发经验,Go / Python 熟练
● 熟悉容器与 Kubernetes 的使用,能快速定位环境类问题
● 熟悉 Claude Code、OpenCode 等 Agent 框架,了解 MCP、Skill 等机制
● 熟悉 SWE-bench、Terminal-bench、OSWorld 等评测榜单的运行与实现
● 理解 RL rollout 与评测链路对环境的需求,能将其抽象为平台能力
● 有平台化思维和服务意识,能主动对齐算法需求并承接 oncall
加分项
● 有 veRL / slime 等 RL 框架的环境侧对接经验
● 有大规模环境的成本优化实战经验
● 相关开源项目贡献