IT人力外包人才简历库

返回列表

Python爬虫开发工程师

驻场外包人员
工作年限:1年 意向城市:杭州 浏览:2次 发布时间:近期

技能标签

Python Requests Scrapy XPath 正则表达式 BeautifulSoup4 Selenium MySQL HTML/CSS/JS 反爬虫技术 分布式爬虫 数据清洗 JSON解析 网络请求优化 自动化测试

专业技能

精通Python编程语言,熟练掌握Requests库、Scrapy框架、XPath、正则表达式、BeautifulSoup4等爬虫技术。熟悉Selenium自动化工具及分布式爬虫框架Scrapy-Redis。具备反爬虫策略制定与应对能力,熟练使用MySQL进行数据存储。掌握HTML/CSS/JS基础语法及AJAX请求解析技术,具备数据清洗与结构化处理能力。

工作履历(脱敏处理)

主导携程景区数据采集项目,设计分布式爬虫架构,采用Scrapy-Redis实现多节点数据分发,通过动态IP代理及User-Agent轮换策略突破反爬机制。开发京东商品信息爬虫系统,运用Selenium模拟浏览器操作完成商品搜索与数据抓取,结合XPath与BeautifulSoup4实现复杂页面结构解析。构建完整的数据处理管道,实现JSON数据格式标准化存储,日均处理数据量达50万条以上。优化请求参数构造逻辑,提升爬虫效率30%,并建立异常重试机制保障数据完整性。

项目经验(脱敏处理)

携程景区数据采集项目:基于Scrapy框架构建分布式爬虫系统,采用Scrapy-Redis实现任务分发与结果聚合。通过分析Postman抓包数据,设计动态请求参数构造方案,使用JSONPath解析多层级嵌套数据结构。针对反爬机制,实施动态IP代理池及User-Agent随机化策略,配合请求头指纹伪装技术突破验证码拦截。最终实现全国300+城市的景区信息采集,日均处理数据量达50万条,数据准确率99.8%。

京东商品信息爬取项目:基于Selenium搭建自动化爬虫框架,模拟真实用户操作完成商品搜索与页面翻页。通过XPath定位商品列表元素,结合BeautifulSoup4解析动态加载内容,设计数据清洗规则消除冗余信息。建立JSON数据存储规范,实现结构化数据输出。优化浏览器缓存清理策略,提升爬虫稳定性,单日可采集商品信息超10万条。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

1年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接