机器人强化学习算法工程师 80-85k
上海 1-3年 硕士 招1人 今日更新
收藏
年终奖金 股票期权 绩效奖金 五险一金 领导好 发展空间大 公司规模大 管理规范
avator
王先生 4小时前在线 已认证
高级猎头顾问 · 北京圣凯程管理咨询有限公司
简历处理快 回复速度快
聊一聊
职位介绍
职位描述 1. 设计 real robot RL 训练框架,包括 residual RL、batch online RL、human-in-the-loop RL; 2. 设计 offline RL / reward model / critic,用成功、失败、接管轨迹学习更好的策略偏好; 3. 设计安全约束下的 RL 训练方式,包括 action bound、force / velocity / workspace constraint、early stop 和 safety shield 对接; 4. 设计 rollout buffer / replay buffer 数据结构,支持真机 rollout、失败轨迹、人工接管和安全事件回流; 5. 设计 reward、task progress 和 failure label,降低 reward hacking 风险; 6. 和机器人系统工程师合作,建立真机 rollout、自动 reset、灰度评测和回滚机制; 7. 和运控工程师合作,定义 action 边界、控制频率、接管接口和安全控制中间层; 8. 和评测工程师合作,定义 real RL 前后的成功率、稳定性、安全事件率和数据效率指标; 9. 和策略模型算法工程师合作,将 RL 作为 BC / post-train 后的收口模块,而不是从零探索。 职位要求 1. 硕士及以上学历,计算机、人工智能、机器人、自动化、控制、电子工程、数学等相关专业;博士优先; 2. 熟悉强化学习基础方法,理解 policy gradient、actor-critic、offline RL、model-based RL、imitation learning 等方向; 3. 有真实机器人、机械臂、灵巧手、自动驾驶或其他真实系统 RL 经验优先; 4. 熟悉 residual RL、offline RL、reward model、DAgger、preference learning、safe RL 中至少一类方法; 5. 理解机器人控制和真机系统约束,包括控制频率、延迟、安全边界、reset、数据落盘; 6. 有 PyTorch / JAX 等深度学习框架经验,能独立完成训练、评测和实验分析。 7. 具备较强实验设计能力,能通过 ablation 判断 RL 是否真的提升了真实任务成功率。 加分项 1. 做过 sim-to-real、real robot RL、contact-rich manipulation 或 dexterous manipulation; 2. 熟悉 MuJoCo、Isaac Sim、Genesis、SAPIEN、ManiSkill 等仿真平台; 3. 熟悉 VLA、diffusion policy、ACT、behavior cloning、offline RL 等机器人策略模型; 4. 有 reward model、preference learning、人类接管数据利用经验; 5. 有安全约束控制、MPC、轨迹优化或机器人系统部署经验。
其他信息
语言要求:普通话
行业要求:智能硬件/消费电子,人工智能

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-16