设计与开发爬虫系统:负责设计、开发、维护分布式网络爬虫系统,实现对PC网站、手机APP、小程序等多平台数据的自动化抓取与分析。
数据采集与处理:定向采集指定网站或应用的海量数据(如用户信息、商品信息、评论、动态内容等),并完成数据的清洗、去重、结构化处理(如转换为JSON、CSV格式)及入库(如存储至MySQL、MongoDB等数据库)。
攻克反爬虫技术:研究并应对各类反爬虫机制,包括但不限于IP封禁、账号封禁、验证码(含滑块、点选)、JS混淆、设备指纹、动态加密、模拟登录等,确保数据采集的稳定性和效率。
系统优化与运维:持续优化爬虫架构与抓取策略,提升系统的稳定性、可扩展性和抓取速度;对爬虫系统进行7×24小时监控与维护,及时排查并解决运行中的故障。
需求对接与数据服务:与业务部门沟通,理解并评估数据需求,制定数据采集计划;参与数据层建设,为大数据分析、人工智能模型训练等提供高质量的数据支持。
关键技能要求
编程语言:精通 Python(常用框架如Scrapy、Requests、Asyncio),熟悉 Java 或 JavaScript/Node.js 者优先。
核心技术:精通HTTP/HTTPS协议、HTML/CSS、XPath、正则表达式、DOM解析;熟悉浏览器自动化工具(如Selenium、Puppeteer)及APP逆向分析技术。
工具与平台:熟练使用Linux开发环境、抓包工具(如Charles、Fiddler)、数据库(MySQL、MongoDB、Redis)及分布式系统相关技术。
软技能:具备良好的分析和解决问题能力、学习能力、团队合作意识及沟通能力。
更新于 2026-08-22