模型部署工程师
20-40k
深圳
2-6年
统招本科
招1人
8月14日更新
资深猎头总监
· 河北海睿人力资源服务有限公司
简历处理快
聊一聊
- 职位介绍
- 【岗位职责】
1、客户需求对接与方案设计:深入沟通了解客户的大模型应用场景(如对话系统、RAG、代码生成、视频生成等),评估算力需求,制定基于我司AI芯片的大模型部署与交付方案;
2、模型部署与集成:负责将主流开源大模型(DeepSeek/LLaMA/Qwen/ChatGLM等)及小模型(ResNet50、BERT-Base/Large、YOLOv5/v8、StableDiffusion等)封装为标准的API接口,通过容器化技术(Docker/Kubernetes)部署至生产环境,完成业务联调;
3、性能优化与加速:结合原厂提供的软件栈及工具,对大模型推理过程进行性能剖析与调优(包括但不限于算子优化、显存优化、KVCache管理、并发吞吐量提升等),满足客户的业务延迟与吞吐指标;
4、全链路监控与维护:开发和维护相关的模型转换、调试、精度和性能分析工具,支持内部和客户的高效开发与部署。建立模型生产环境监控体系,跟踪推理服务表现,快速定位性能瓶颈或异常,确保系统稳定性和可维护性;
5、跟踪 LLM 推理前沿技术(PagedAttention、Speculative Decoding、Continuous Batching、MoE offloading等),输出性能Benchmark与落地方案;
6、沉淀实践:整理大模型部署过程中的避坑指南与调优经验,撰写技术白皮书、部署手册及售前打单所需的技术材料。
【任职要求】
1、2年及以上AI算法工程化或模型部署经验,有完整的大模型(LLM)落地项目经历
2、统招本科及以上学历,计算机、人工智能、自动化等相关专业
3、大模型基础:熟悉Transformer架构,熟练使用PyTorch深度学习框架;
4、推理框架与工具:熟悉主流大模型推理框架或引擎的原理,如vLLM、SGLang、TensorRT-LLM、HuggingFace TG等,有多种GPU部署适配经验者优先;
5、工程化能力:有大模型应用开发与部署经验,具备大模型生产环境部署经验,熟悉容器化(Docker/K8s)和云计算平台(AWS/Azure/GCP/阿里云/腾讯云等),了解模型量化、剪枝等优化方法;
6、系统优化能力:熟悉GPU/NPU异构计算架构,掌握CUDA编程、性能分析工具(Nsight、Profiler),能针对性优化算子性能与资源利用。
- 其他信息
- 语言要求:不限
- 行业要求:电子/半导体/集成电路
猎聘温馨提示:
- 1. 如您发现平台内招聘方存在以下违规行为的,请立即举报
-
- · 扣押您的身份证件或者其他证件;
- · 要求您提供担保人、担保金或者以其他名义向您收取财物( 如培训费、体检费、资料费、置装费、押金等);
- · 强迫您入股或者向您集资;
- · 以招聘名义牟取不正当利益;
- · 发布虚假招聘广告信息;
- · 工作时长违反劳动法规定;
- · 存在其他损害您的合法权益的行为。
- 2. 如您应聘的岗位属于涉外劳务合作/海外岗位的,请务必核实招聘方对外劳务合作资质取得情况,同时注意自身资金安全,防范招聘欺诈。
- 了解更多安全防范知识>
- 3. 本平台招聘方不向求职者提供任何收费服务。
查看全部