IT人力外包人才简历库

返回列表

Python数据采集工程师

驻场外包人员
工作年限:1年 意向城市:杭州 浏览:3次 发布时间:近期

技能标签

Python开发 Selenium自动化 反爬策略 XPath解析 正则表达式 HTTP请求 异常处理 文件系统操作 模块化开发 数据清洗 浏览器自动化 网络请求优化 技术文档维护 动态页面处理 爬虫架构设计

专业技能

精通 Python 编程语言,具备高效开发能力。熟练使用 requests 库进行 HTTP 请求与会话管理,支持复杂反爬策略。掌握 XPath、lxml、正则表达式进行静态页面数据解析,可处理复杂页面结构。精通 Selenium 自动化浏览器控制,支持无头模式、图片禁用、自动化特征隐藏等高级配置。具备完善的异常处理机制,支持网络超时、解析失败、元素缺失等场景的捕获与重试。熟悉文件系统操作,支持非法字符处理、版本号追加、多路径权限检查与磁盘空间检测。具备模块化开发能力,实现数据清洗、命名规则、路径处理等通用逻辑的封装。持续维护爬虫技术文档,积累 40+ 常见问题及解决方案。

工作履历(脱敏处理)

独立开发动态招聘网站数据采集系统,实现关键词搜索、多页翻页、详情页跳转等核心功能。采用Selenium处理动态渲染页面,通过显式等待机制解决加载延迟问题。设计反爬策略包含随机延迟、无头模式配置及自动化特征隐藏,提升采集稳定性。开发豆瓣电影Top250采集工具,实现分页采集、数据结构化存储及图片下载功能。优化文件存储方案,支持非法字符处理与版本号追加,确保数据完整性。建立日志监控体系,实现采集过程可追溯与异常快速定位。

项目经验(脱敏处理)

动态招聘网站数据采集系统:基于Selenium实现浏览器自动化,处理动态渲染页面数据采集。采用显式等待机制解决元素加载延迟问题,设计随机延迟与无头模式配置应对反爬策略。实现关键词搜索、多页翻页控制及详情页跳转功能,完成职位名称、薪资、地区等字段提取。开发日志监控系统,支持采集过程调试与运行状态追踪。优化反爬策略,通过IP轮换与请求头伪装提升采集稳定性,当前系统已具备基础采集能力。

XX招聘平台职位信息采集系统:独立开发完成职位信息自动化采集与本地存储。实现关键词搜索与分页控制,采用Selenium处理动态加载内容,通过XPath与正则表达式提取结构化数据。设计文件存储方案,支持非法字符处理、版本号追加及多路径权限检查。建立异常处理机制,实现网络超时、解析失败等场景的自动重试。完成数据清洗与格式标准化,确保采集数据完整性与可用性。

XX电影平台数据采集工具:开发电影榜单信息自动抓取系统,支持Top250全分页采集。实现电影基本信息提取,包括片名、导演/演员、上映年份等字段。采用Selenium处理动态加载内容,通过显式等待确保数据完整性。开发图片下载模块,实现结构化存储与数据归档。优化采集效率,通过并发控制与请求头伪装提升数据采集稳定性。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

1年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接