AI infra 35-65k·15薪
深圳 经验不限 统招本科 招1人 8月14日更新
收藏
avator
路女士 2天前在线 已认证
猎头顾问/助理 · 泰利企业管理咨询(苏州)有限公司
简历处理快 回复速度快
聊一聊
职位介绍
训练方向: 1. 大规模分布式训练系统:在千卡级 GPU 集群上构建稳定、高效的分布式训练系统,支持 VLA 等具身大模型的预训练与微调; 2. 训练效率优化:优化大规模训练中的计算效率、通信效率与 I/O 效率,消除训练瓶颈,提升集群整体利用率; 3. 训练数据加载流水线:构建从存储到 GPU 显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的 I/O Stall; 4. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 推理方向: 具身模型推理与优化开发 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构; 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略; 开发模型解析、转换、性能剖析、可视化profiling工具; 具身模型性能分析与系统部署 对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略; 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度); 探索结构化剪枝、算子重参数化、神经架构搜索与推理引擎的联合优化。 前沿探索 跟进VLA、世界模型、空间智能等算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术; 职位要求 训练方向: 1. 千卡级训练实战经验:有千卡级 GPU 集群上的大模型训练实战经验,熟悉大规模训练中的常见问题与解决方案; 2. 分布式训练框架:精通 PyTorch 分布式训练机制(DDP/FSDP),熟悉 DeepSpeed、Megatron-LM 等大规模训练框架的原理与使用; 3. 并行策略:深入理解 多维并行(Data Parallel / Tensor Parallel / Pipeline Parallel)的实现原理与适用场景,能够根据模型特点设计并行策略; 4. 性能分析与调优:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈。 推理方向: 专业技能 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构; 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链; 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等); 具备AI处理器profiling能力(perf、简单性能计数器、硬件事件、功耗测量)与AI计算负载量化分析能力; 加分项 参与过开源推理引擎贡献(MNN、Tengine、OpenCV、TVM、vLLM、SGLang等); 熟悉MLIR、IREE、Triton、TileLang等编译栈或Dialect开发;
其他信息
语言要求:不限
行业要求:智能硬件/消费电子,人工智能

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-14