AI算子开发与性能优化工程师 30-50k·15薪
上海 3-5年 硕士 招1人 8月7日更新
收藏
avator
李女士 2天前在线 已认证
合伙人 · 上海德筑企业管理有限公司
简历处理快 回复速度快
聊一聊
职位介绍
岗位职责: 负责自研平台的 AI/LLM 核心算子开发、移植和性能优化; 开发CUDA风格算子kernel,并在后端中接入新算子,实现PyTorch op到kernel的参数检查shape推导、tensor分配和launch;进行kernel调优,包括thread/block映射、tiling、访存优化、local memory/cache使用、循环展开和同步策略; 优化Transformer推理关键路径,包括 matmul/linear、RMSNorm、RoPE、softmax、embedding、SwiGLU、attention、argmax等; 在仿真与真实硬件路径上验证算子行为,定位runtime、DMA、memory layout、kernel ABI相关问题;与编译器、runtime、RTL/FPGA团队协作,推动算子 ABI、kernel launch、内存模型和硬件特性的协同优化; 建立并维护算子正确性测试,与CPU/CUDA reference对齐,覆盖多shape、多dtype、边界条件和随机输入;分析单算子性能和端到端模型性能,建立性能基线、profiling方法和回归测试; 编写算子开发文档、调优记录,提升团队新增算子的效率; 岗位要求: 3年以上AI算子、CUDA kernel、GPU 性能优化、HPC、AI编译器或异构计算相关经验; 熟悉C/C++、Python,能独立阅读和修改PyTorch C++ extension相关代码; 熟悉CUDA或类GPU编程模型,理解grid/block/thread、kernel launch、global memory、shared/local memory、reduction、tiling等概念; 熟悉常见深度学习推理算子,理解Transformer/LLM 中 matmul、attention、RMSNorm、RoPE、softmax、activation、embedding等计算模式; 具备性能优化能力,能够分析算子的计算量、访存量、并行度和瓶颈,并给出可落地的优化方案; 熟悉Linux开发环境、Make/CMake/bash、调试工具和基本profiling方法; 能够构建可靠的单元测试和数值对比测试,理解浮点误差、边界条件、shape sweep的重要性; 有较强跨层调试能力,能从PyTorch调用、C++ 扩展、kernel参数、runtime launch到设备执行链路中定位问题;
其他信息
语言要求:不限
行业要求:电子/半导体/集成电路

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-14