IT人力外包人才简历库

返回列表

AI后端开发工程师

驻场外包人员
工作年限:5年 意向城市:北京 浏览:1次 发布时间:近期

技能标签

大模型推理 分布式系统 Python开发 FastAPI vLLM SGLang Tensor并行 性能调优 异步编程 模型部署 Ray框架 BentoML OpenAI API 内存管理 批处理优化

专业技能

精通Python语言及其生态系统,具备高效开发能力。深度掌握大模型推理架构设计,熟悉vLLM、SGLang、llama.cpp等主流推理框架,精通PagedAttention内存管理、Continuous Batching连续批处理及FlashAttention加速技术。具备大规模分布式推理系统性能调优经验,熟悉Ray、BentoML等分布式框架选型。精通分布式系统设计,掌握MapReduce并行计算范式及张量并行策略。擅长构建高性能异步Web服务,熟悉OpenAI API标准设计与实现,具备模型生命周期管理到服务接口封装的全栈工程化能力。

工作履历(脱敏处理)

专注于AI后端系统架构设计与开发,主导多套大模型推理系统架构设计,实现推理延迟降低40%以上。主导分布式计算框架选型与性能调优,成功提升数据处理吞吐量300%。构建企业级异步Web服务框架,支持高并发请求处理,系统可用性达99.99%。完成多个OpenAI API兼容接口开发,实现模型服务化交付。主导技术方案设计,解决内存管理、批处理优化等关键技术难题,推动系统性能持续提升。

项目经验(脱敏处理)

Xinference企业级大模型分布式推理系统:主导设计并实现支持多模型并发推理的分布式系统,采用PagedAttention内存管理机制和Continuous Batching技术,解决大模型推理内存占用过高的问题。通过FlashAttention加速技术将推理延迟降低35%,同时利用Ray框架实现负载均衡,使系统吞吐量提升200%。设计动态资源调度算法,根据硬件环境自动优化推理参数,实现不同硬件平台的性能最大化。完成从模型部署到服务接口封装的全栈工程化,支持OpenAI API标准接口,满足企业级服务化需求。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

5年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接