软件开发工程师(LLM) 20-40k
深圳 1-3年 硕士 招1人 7月9日更新
收藏
年终奖金 五险一金 领导好 发展空间大 公司规模大
avator
张先生 一周前在线 已认证
猎头顾问 · 重庆合纵杰才人力资源管理有限公司
聊一聊
职位介绍
岗位职责: 1.负责基于C/C++和Python的AI推理工程化代码开发,将主流开源大模型(如LLaMA、Qwen、Deepseek等)部署到公司NPU芯片上,实现高性能、低延迟的推理服务。 2.深入理解llama.cpp等开源推理框架的架构,分析其在CPU/GPU上的运行机制,并将相关推理流程迁移或适配到NPU平台,包括模型加载、算子映射、内存管理和流水线调度。 3.基于对Transformer模型(Attention、FFN、LayerNorm、位置编码等核心模块)的充分理解,完成模型在NPU上的推理正确性验证与端到端功能对齐,确保精度符合预期。 4.使用TensorRT(或类似推理后端)作为参考基准,对比分析NPU推理的性能与精度,定位部署过程中的算子不兼容、显存(或NPU内部存储)瓶颈等问题。 5.设计与实现NPU推理服务的高层封装(Python API / RESTful接口),支持动态batch、多流并发、模型热更新等生产环境特性。 6.编写NPU部署相关技术文档,包括模型转换流程、算子支持列表、性能调优指南,并协助测试团队完成稳定性与压测。 任职要求: 2. 语言能力:(1)熟悉C/C++:能高效编写底层推理调度代码,熟悉内存池、多线程同步、跨平台编译(交叉编译经验更佳),具备跨平台(windows/linux)开发经验。(2)熟悉Python:熟悉 transformers、accelerat库能够使用 sentencepiece / tokenizers 库完成大模型文本预处理与后处理(包括特殊 token、padding、attention mask);了解 ONNX Runtime / OpenVINO 等后端的 Python API,便于与 TensorRT 或 NPU SDK 进行基准对比。 3. llama.cpp架构:熟悉llama.cpp的核心组件,ggml张量库、量化方法(Q4_K/ Q5K / Q8_0等)、KV Cache管理;有实际修改llama.cpp源码或将其某个模型推理流程移植到其他硬件(如NPU、DSP、FPGA)的经验者优先。 4. 大模型知识:深入理解Transformer模型结构,Multi-Head Attention、Feed-Forward、残差连接、LayerNorm、Rotary位置编码;清楚大模型推理的关键KV Cache大小随序列长度线性增长、首token延迟与生成token吞吐的权衡;了解常见量化方法(INT8/INT4)对推理精度和存储的影响等。 5. TensorRT相关知识:熟悉TensorRT的基本使用流程:ONNX → TensorRT engine → 推理运行;能够解析TensorRT的层融合日志和性能分析报告,用于对标NPU推理能力(例如:某算子在TensorRT上延迟为ms,在NPU上需达到接近水平);了解TensorRT中的动态shape、显存复用等技术思路,可借鉴到NPU推理优化中。 6.AI工具:熟悉Ai工具的使用,具备skill/prompt等编写能力,善于利用ai进行编码以及解决实际问题的能力。
其他信息
语言要求:不限
行业要求:电子/半导体/集成电路

猎聘温馨提示:

1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
  • · 扣押您的身份证件或者其他证件;
  • · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
  • · 强迫您入股或者向您集资;
  • · 以招聘名义牟取不正当利益;
  • · 发布虚假招聘广告信息;
  • · 工作时长违反劳动法规定;
  • · 存在其他损害您的合法权益的行为。
2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
3. 本平台招聘方不向求职者提供任何收费服务。
查看全部
更新时间:2026-07-28