技能标签
专业技能
精通Python语言及其生态系统,具备高效开发能力。深度掌握大模型推理架构设计,熟悉vLLM、SGLang、llama.cpp等主流推理框架,精通PagedAttention内存管理、Continuous Batching连续批处理及FlashAttention加速技术。具备大规模分布式推理系统性能调优经验,熟悉Ray、BentoML等分布式框架选型。精通分布式系统设计,掌握MapReduce并行计算范式及张量并行策略。擅长构建高性能异步Web服务,熟悉OpenAI API标准设计与实现,具备模型生命周期管理到服务接口封装的全栈工程化能力。
工作履历(脱敏处理)
专注于AI后端系统架构设计与开发,主导多套大模型推理系统架构设计,实现推理延迟降低40%以上。主导分布式计算框架选型与性能调优,成功提升数据处理吞吐量300%。构建企业级异步Web服务框架,支持高并发请求处理,系统可用性达99.99%。完成多个OpenAI API兼容接口开发,实现模型服务化交付。主导技术方案设计,解决内存管理、批处理优化等关键技术难题,推动系统性能持续提升。
项目经验(脱敏处理)
Xinference企业级大模型分布式推理系统:主导设计并实现支持多模型并发推理的分布式系统,采用PagedAttention内存管理机制和Continuous Batching技术,解决大模型推理内存占用过高的问题。通过FlashAttention加速技术将推理延迟降低35%,同时利用Ray框架实现负载均衡,使系统吞吐量提升200%。设计动态资源调度算法,根据硬件环境自动优化推理参数,实现不同硬件平台的性能最大化。完成从模型部署到服务接口封装的全栈工程化,支持OpenAI API标准接口,满足企业级服务化需求。
驻场外包优势
服从性高
严格遵守甲方管理制度
技术扎实
5年项目实战经验
可长期驻场
接受异地项目外派
快速响应
24小时内可到岗
企业人才对接
专业IT人力外包服务
如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。
合作热线
18969108718
商务邮箱
ntit@163.com
微信扫码咨询
扫描二维码添加商务对接