岗位职责
- 遵循Robots协议,采集互联网公开的信息,满足各类业务数据需求;
- 负责分布式爬虫系统的建设,优化数据调度、抓取、解析、存储全栈流程;
- 帮助团队攻克各种爬虫技术难关,提升海量数据系统的抓取效果与性能。
职位要求
- 本科及以上学历,2年以上爬虫抓取采集相关工作经验;
- 熟悉主流爬取技术及爬虫框架工具,如Selenium/Puppeteer/Scrapy/PhantomJS等;
- 熟悉Python/Java/Go/C++其中一种语言,具备扎实的编码能力;
- 熟悉常见反爬封禁策略,并具备相关的实战经验;
- 加分项:逆向、混淆、脱壳、分布式、数据分析、数据挖掘。