IT人力外包人才简历库

返回列表

Python爬虫开发工程师

驻场外包人员
工作年限:1年 意向城市:杭州 浏览:2次 发布时间:近期

技能标签

Python开发 Scrapy框架 分布式爬虫 数据库优化 Linux系统 网络爬虫 数据清洗 任务调度 反爬策略 异步编程 数据存储 系统监控 性能调优 API接口 日志分析

专业技能

精通Python核心数据类型(列表、元组、字典、集合等)的高效应用,熟练掌握函数式编程(匿名函数、列表推导式、装饰器)开发技巧。熟悉网络请求库(requests)、解析库(BeautifulSoup)及爬虫框架(Scrapy)的深度应用,具备分布式爬虫(Scrapy-Redis)架构设计能力。精通MySQL与MongoDB数据库的增删改查操作,熟悉连接池优化技术提升数据库访问效率。掌握Linux系统环境搭建与运维,具备Shell脚本编写及系统调优能力。

工作履历(脱敏处理)

专注于爬虫系统开发与优化,主导设计分布式爬虫架构,采用Scrapy-Redis实现任务分发与结果聚合,提升爬取效率300%。开发增量爬取机制,通过Redis存储URL状态实现断点续爬,降低重复请求量达70%。设计基于布隆过滤器的去重方案,有效解决URL重复抓取问题。优化数据库访问性能,通过连接池技术提升查询效率,降低数据库负载。开发协程爬虫框架,利用aiohttp和asyncio实现异步请求,使爬取速度提升5倍。完成B站视频数据采集项目,实现从URL解析、数据清洗到存储的完整流程。

项目经验(脱敏处理)

主导开发多场景爬虫系统,实现增量爬取、断点续爬及高效去重机制。采用Redis存储URL状态,通过任务队列管理未爬取URL,确保爬虫连续性。设计分布式爬虫架构,利用Scrapy-Redis实现多节点协同工作,提升大规模数据采集效率。开发协程爬虫框架,基于aiohttp和asyncio实现异步请求,使单机爬取速度提升5倍。完成B站视频数据采集项目,通过解析网页源码获取视频URL,使用异步请求获取数据,结合正则表达式清洗无效数据,最终实现视频信息的结构化存储。针对反爬策略,开发代理IP池和UserAgent池,模拟浏览器行为规避检测,确保爬虫稳定运行。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

1年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接