职责:
系统设计:负责设计、开发和维护分布式网络爬虫系统与数据采集模块,并能快速响应业务的变动。
数据抓取:通过网络爬虫技术、公开数据库及合法渠道采集相关数据,具体包括对品牌方自身电商数据、竞品数据、小红书数据等特定目标和定向网站的数据,以及进行大规模采集。
技术攻关:研究并应用技术应对反爬虫策略,例如设计爬虫策略和防屏蔽规则,使用IP代理池、Headers认证等,以提升网页抓取的效率和质量。
数据处理:负责对采集到的数据进行提取、清洗、结构化、入库及统计分析,确保数据的准确性与时效性。
合规与安全:在数据采集过程中,遵守数据安全与隐私保护法规,如《网络安全法》《个人信息保护法》,确保数据获取方式合法合规。
硬技能:
编程语言:熟练掌握 Python(常用)或 Java等,并能使用相关的开源爬虫框架,如 Scrapy、Selenium、BeautifulSoup等。
网络协议:了解 HTTP 等网络协议,熟悉基于Cookie的网站登录原理。
数据存储:能使用 SQL 数据库(如 MySQL/PostgreSQL)或 MongoDB,Redis 进行数据存储与管理。
系统构建:对分布式爬虫架构、JS逆向分析有一定了解,有海量代理池搭建经验者更佳。
专业背景:通常要求一本本科及以上学历,计算机相关专业背景优先。
经验与业务理解:具备企业级数据采集与处理的项目落地能力,有从事海量网络爬虫、网页去重、网页信息抽取经验。能快速理解业务需求,有特定行业(如企业工商数据、招标网站)数据采集经验者是加分项。
合规意识:这是非常重要的方面,需要熟悉相关法规,确保数据来源合法,并对数据脱敏、隐私保护有实操经验。
个人特质:工作态度踏实、认真,能承受一定工作压力,有责任心、有团队协作能力,逻辑清晰,能适应快速响应业务需求。