边端侧大模型推理框架部署优化高级工程师 30-60k·16薪
杭州 经验不限 本科 招1人 8月5日更新
收藏
avator
杭女士 2天前在线 已认证
猎头顾问 · 上海先豊商务咨询有限公司
简历处理快 回复速度快
聊一聊
职位介绍
职位描述 作为边端侧大模型推理框架部署优化高级工程师,负责将亿级/十亿级参数的大模型 (LLM, VLM, Audio LM)部署到终端芯片平台,并进行极致的性能与能效优化。需精通 从模型压缩、核心算子优化到运行时内存管理的全栈技术,确保大模型在资源受限环境 下,依然能提供流畅、稳定的智能服务。 核心职责 1. 端侧推理引擎深度定制与优化:  主导 vLLM、Ollama 等框架在 ARM CPU、NPU、GPU 等异构计算平台上的 移植、 适配与深度优化。重点攻克 注意力机制、KV Cache管理、解码策略 在内存受限下 的高效实现。  针对终端特性,深度优化或自研 高性能、低内存占用的推理运行时,核心优化方 向包括:算子融合、计算图优化、静态内存规划、Zero-Copy数据流。  集成并优化 MLIR、TVM 等编译器栈,实现面向终端芯片的自动调度与代码生成, 最大化发挥专用加速器(NPU/DSP)性能。 2. 模型极限制压缩与适配:  推动并落地前沿的 端侧模型压缩技术,包括但不限于:4/8-bit权重量化(AWQ, GPTQ)、激活值动态量化、稀疏化、知识蒸馏、模型剪枝。在精度与性能间取得 最佳平衡。  建立端侧模型的 自动化压缩-部署-评估流水线,快速迭代不同芯片平台上的最优 模型变体。  与算法团队紧密合作,设计 硬件感知的端侧模型架构(如MobileLLM),从源头 优化部署效率。 3. 系统集成与全栈性能调优:  将优化后的推理引擎无缝集成到终端操作系统中,处理复杂的多任务调度策略。  构建端到端的性能分析与调试工具链,从应用层、框架层到驱动层进行全栈性能 剖析,定位瓶颈。  设计和实现 混合推理架构(如端-云协同、大模型小模型协同),在复杂场景下 动态分配计算负载。 任职要求(必要条件) 1. 教育背景:计算机科学、电子工程、通信工程等相关专业本科及以上学历,硕士优先。 2. 深厚的嵌入式与AI系统经验:  5年以上 嵌入式系统、移动端或边缘侧AI应用开发与优化经验。  精通 C/C++ 和 Python,具备出色的嵌入式编程、性能调优和内存调试能力。  深入理解 ARM体系架构、内存管理、多线程编程、硬件中断与DMA。 3. 丰富的端侧AI部署经验:  熟悉至少一种主流端侧推理框架,并有深度优化经验。  对 Transformer 模型结构有清晰理解,有在端侧部署相关模型的实际项目经验。  熟悉 模型量化工具和流程。 3. 硬件与芯片理解:  熟悉主流终端芯片平台(华为麒麟/昇腾、英伟达Orin/NX)的AI加速器 (NPU/APU/GPU)架构与编程模型(如OpenCL)。 优先考虑条件 1. 有成功将 >1B参数 的大模型部署到汽车或机器人等终端设备并量产的完整经验。 2. 深入参与过 vLLM、Ollama、llama.cpp 等框架在ARM平台的优化或贡献代码。 3. 熟悉 TVM/MLIR 编译栈,并有为自定义硬件后端开发的经验。
其他信息
语言要求:不限
行业要求:电子/半导体/集成电路

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-08-14