大模型端侧部署工程师 35-65k·15薪
深圳 经验不限 统招本科 招1人 8月13日更新
收藏
avator
路女士 2天前在线 已认证
猎头顾问/助理 · 泰利企业管理咨询(苏州)有限公司
简历处理快
聊一聊
职位介绍
- 主导大模型在 SoC 平台上的端侧部署与性能优化:面向 NVIDIA Jetson、瑞芯微 RK 系列、地平线 RDK(如 X5/S100)、及其他国产 AI SoC 平台,完成大语言模型(LLM)或视觉-语言模型(VLM)的量化、转换、部署与推理加速; - 开展大模型轻量化技术研究与工程落地: - 实施结构化/非结构化剪枝、知识蒸馏、低秩分解、权重共享等模型压缩技术; - 针对目标 SoC 硬件特性,调整模型架构(如层数、注意力头数、隐藏维度等),实现精度与延迟的平衡; - 支持量化感知训练(QAT)与后训练量化(PTQ),保障 INT8/INT4 量化下的模型精度; - 构建端到端的大模型部署工具链:集成 ONNX、TensorRT、RKNN Toolkit、Horizon BPU Toolchain、CANN、MagicMind 等工具,开发自动化转换、校准、验证脚本,提升部署效率; - 深度协同算法与硬件团队:参与大模型选型与设计评审,从部署可行性角度提出模型结构调整建议;配合芯片厂商调试 NPU 驱动、自定义算子、内存调度等问题; - 性能分析与瓶颈优化:使用 profiling 工具(Nsight, Perf, adb systrace 等)定位 SoC 上的 CPU/NPU/GPU/内存带宽瓶颈,针对性优化数据流水线与计算图; - 沉淀大模型端侧部署规范:输出量化策略、剪枝方案、精度评估、功耗测试等标准化文档,建立可复用的轻量化模型交付流程。 职位要求 - 本科及以上学历,计算机、人工智能、电子工程、自动化等相关专业; - 1–3 年大模型或深度学习模型在边缘/端侧 SoC 上的部署经验,有实际 LLM/VLM 在 NVIDIA TensorRT、RKNN、RDK BPU、昇腾 CANN、寒武纪 MagicMind 等平台成功落地项目者优先; - 精通大模型轻量化核心技术:熟悉剪枝(Magnitude/Structured Pruning)、量化(PTQ/QAT)、蒸馏、MoE 稀疏化等方法,具备动手调参和精度恢复能力; - 熟练掌握主流部署工具链: - 模型格式:PyTorch → ONNX → 目标平台 IR; - 量化工具:TensorRT(INT8 calibration/QAT)、RKNN Toolkit2/3、Horizon ModelZoo、Ascend ATC 等; - 能处理常见部署问题:算子不支持、精度掉点、内存溢出、推理延迟高等; - 扎实的编程能力:精通 Python,熟悉 C++;能编写高效数据预处理、推理封装及性能测试代码; - 熟悉大模型基础架构(如 LLaMA、Qwen3等),了解 Attention、RoPE、RMSNorm 等模块的计算特性; - 具备良好的工程素养:熟悉 Git、CI/CD、Docker,有模块化封装和接口设计经验; - 加分项: - 有自定义 NPU 算子开发经验(CUDA / OpenCL / BPU Kernel); - 熟悉 TVM、MLIR、OpenVINO 等编译栈; - 参与过机器人、车载、IoT 等场景的大模型端侧产品落地。
其他信息
语言要求:不限
行业要求:具身智能与机器人

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-14