算法专家 90-120k·13薪
深圳 5-10年 学历不限 招1人 8月12日更新
收藏
avator
游女士 2天前在线 已认证
高级猎头顾问 · 广州云猎科技有限公司
简历处理快 回复速度快
聊一聊
职位介绍
工作职责 1. 环境建模与MDP设计: 将亚⻢逊⼴告投放全链路(SP/SB/SD)抽象为⻢尔可夫决策过程,定义状态空间(竞价环境、产品⽣命周期、竞争格局、库存状态等)、动作空间(出价调整、预算分配、关键词开关、时段策略等)与奖励函数(ACOS、ROAS、利润率等多⽬标平衡); 2. 策略算法研发: 设计并实现适⽤于⼴告投放场景的强化学习算法,包括但不限于: 在线/离线策略优化(PPO、SAC、CQL、IQL、Decision Transformer等) 多智能体协同(多⼴告活动、多产品线的联合优化) 约束优化与安全RL(预算硬约束、ACOS上限保障) 上下⽂Bandit与探索-利⽤权衡(新品冷启动、新关键词探索) 3. 仿真环境构建: 搭建⾼保真⼴告竞价仿真器,基于历史数据建模竞争对⼿⾏为与平台机制,⽀持策略的离线评估与快速迭代; 4. ⾮标品适配: 针对服装类⽬多变体(颜⾊/尺码/款式)、季节性、⽣命周期短等特点,设计⾃适应策略迁移与快速适应机制(Meta-RL / Few-shot Adaptation); 5. 线上部署与效果闭环: 设计安全的策略上线机制(渐进式部署、A/B实验框 架),建⽴从离线评估到在线效果的完整验证体系,持续迭代提升核⼼业务指标; 6. 前沿技术探索: 跟踪RL领域最新进展(Offline RL、World Model、Modelbased RL等),评估其在⼴告投放场景的适⽤性,推动技术创新与落地。 工作要求 1. 学历背景: 计算机、⼈⼯智能、运筹学、统计学、控制理论等相关专业硕⼠及 以上学历,博⼠优先; 2. 强化学习功底: 深⼊理解MDP理论、策略梯度、值函数⽅法、Actor-Critic架 构,熟悉主流RL算法(DQN/PPO/SAC/TD3等)的原理与实现细节; 3. ⼯程实现能⼒: 精通Python,熟练使⽤PyTorch,有RL相关框架(Ray RLlib、Stable-Baselines3、TorchRL、d4rl等)的实际项⽬经验; 4. 建模与数学能⼒: 扎实的数学基础(概率论、随机过程、优化理论、博弈 论),能将复杂业务问题抽象为可求解的数学模型; 5. 实验素养: 具备严谨的实验设计能⼒,熟悉离线策略评估(OPE)、A/B实验 设计与因果推断⽅法; 6. 项⽬经验: 5年以上算法研发经验,有RL算法从研发到线上部署的完整落地经验
其他信息
语言要求:不限
行业要求:批发/零售,电子商务

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-14