资深预训练算法专家 / 基础模型负责人 90-100k
深圳 3-5年 硕士 招1人 8月16日更新
收藏
avator
裴女士 14小时前在线 已认证
人力资源经理 · 上海到耶至猎企业管理有限公司
简历处理快 回复速度快
聊一聊
职位介绍
【岗位定位】 作为基础模型研发的核心成员/负责人,您将参与从零构建下一代先进大语言模型。不同于应用层的微调与开发,本岗位聚焦于预训练阶段的范式创新、架构设计及大规模分布式训练优化,旨在探索智能边界并打造业界基础模型基座。 【岗位职责】 1、预训练范式创新与架构设计:主导前沿Transformer架构的改进与优化(如MoE稀疏化、长上下文扩展、高效Attention机制),探索下一代基础模型架构(如SSM、线性Attention等),持续提升模型基础能力。 2、大规模分布式训练实施:负责千卡/万卡级别集群上的预训练全流程,包括数据加载优化、训练稳定性维护、故障自动恢复及通信拓扑优化,追求极致算力利用率(MFU)。 3、数据工程与全流程构建:把控TB级训练数据的清洗、去重、配比及合成数据策略,确保数据质量与多样性。深度参与RLHF全流程(偏好数据构建、奖励模型训练、强化学习对齐)及模型幻觉控制。 4、推理成本优化:协同工程团队,通过量化、剪枝、蒸馏及投机采样等技术,在保持模型性能的前提下,持续降低推理延迟与部署成本。 5、前沿探索与团队建设:跟进学术界(NeurIPS/ICML/ICLR)及工业界最新进展,并作为技术导师带领团队成员进行技术攻坚与创新。 【任职要求】 基本资格 计算机科学、人工智能、数学等相关专业硕士及以上学历,博士优先。 深度经验:5年以上深度学习研发经验,3年以上大语言模型预训练或核心算法研发经验,有主导过基础模型从0到1训练的全流程经验。 工程能力:精通Python/C++,具备极强的代码实现能力;熟练掌握PyTorch框架及其底层机制。 框架掌握:精通主流分布式训练框架(如Megatron-LM、DeepSpeed),对混合精度训练、梯度累积、重计算、并行策略(DP/TP/PP/EP)有深刻理解和实际调优经验。 【优先条件】 学术背景:在NeurIPS、ICML、ICLR、CVPR、ACL、EMNLP等顶会上以第一作者或核心作者身份发表过论文。 实验室经历:拥有FAIR、Google Brain、DeepMind、OpenAI等AI实验室,或国内一流大厂/独角兽的基础模型核心团队工作经验。 技术视野:对业界前沿技术(如RWKV、Mamba、Diffusion Model在文本中的应用等)有强烈好奇心与独到见解。
其他信息
语言要求:不限
行业要求:IT服务

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-16