网站的权重东莞网站建设公司怎么做

web/2025/9/26 8:28:15/文章来源:
网站的权重,东莞网站建设公司怎么做,wordpress安装图片不显示,美工背景图素材1. 前言。1.1. 需求背景。每天抓取的是同一份商品的数据#xff0c;用来做趋势分析。要求每天都需要抓一份#xff0c;也仅限抓取一份数据。但是整个爬取数据的过程在时间上并不确定#xff0c;受本地网络#xff0c;代理速度#xff0c;抓取数据量有关#xff0c;一般情…1. 前言。1.1. 需求背景。每天抓取的是同一份商品的数据用来做趋势分析。要求每天都需要抓一份也仅限抓取一份数据。但是整个爬取数据的过程在时间上并不确定受本地网络代理速度抓取数据量有关一般情况下在20小时左右极少情况下会超过24小时。1.2. 实现功能。通过以下三步保证爬虫能自动隔天抓取数据每天凌晨0001启动监控脚本监控爬虫的运行状态一旦爬虫进入空闲状态启动爬虫。一旦爬虫执行完毕自动退出脚本结束今天的任务。一旦脚本距离启动时间超过24小时自动退出脚本等待第二天的监控脚本启动重复这三步。2. 环境。python 3.6.1系统win7IDEpycharm安装过scrapy3. 设计思路。3.1. 前提目前爬虫是通过scrapy模块自带的cmdline.execute来启动的。from scrapy import cmdlinecmdline.execute(scrapy crawl mySpider.split())3.2. 将自动执行脚本做到scrapy爬虫的外部(1)每天凌晨0001启动脚本(控制脚本的存活时间为24小时)监测爬虫的运行状态(需要用一个标记信息来表示爬虫的状态运行还是停止)。如果爬虫处于运行状态(前一天爬取数据尚未结束)进入第(2)步如果爬虫处于非运行状态(前一天的爬取任务已完成今天的尚未开始)进入第(3)步(2)脚本进入等待阶段每隔10分钟检查一下爬虫的运行状态如(1)。但是一旦发现脚本的等待时间超过了24小时则自动退出脚本因为第二天的监测脚本已经开始运行了接替了它的任务。(3)做一些爬虫启动前的准备工作(删除用来续爬的文件防止爬虫不运行了)启动爬虫爬取数据待爬虫正常结束后退出脚本完成当天的爬取任务。4. 准备工作。4.1. 标记爬虫的运行状态。通过判断文件是否存在的方式来判断爬虫是否处于运行状态在爬虫启动时创建一个isRunning.txt文件。在爬虫结束时删除这个isRunning.txt文件。那么isRunning.txt存在就说明爬虫正在运行文件不存在就说明爬虫不在运行。# 文件pipelines.py# 爬虫启动时checkFile isRunning.txtclass myPipeline:def open_spider(self, spider):self.client MongoClient(localhost:27017) # 连接Mongodbself.db self.client[mydata] # 待存储数据的数据库mydataf open(checkFile, w) # 创建一个文件代表爬虫在运行中f.close()# 文件pipelines.py# 爬虫正常结束时checkFile isRunning.txtclass myPipeline:def close_spider(self, spider):self.client.close()isFileExsit os.path.isfile(checkFile)if isFileExsit:os.remove(checkFile)4.2. 爬虫支持续爬能随时暂停方便调试。# 在scrapy项目中添加start.py文件用于启动爬虫from scrapy import cmdline# 在爬虫运行过程中会自动将状态信息存储在crawls/storeMyRequest目录下支持续爬cmdline.execute(scrapy crawl mySpider -s JOBDIRcrawls/storeMyRequest.split())# Note:若想支持续爬在ctrlc终止爬虫时只能按一次爬虫在终止时需要进行善后工作切勿连续多次按ctrlc4.3. Log按照每天的日期命名方便查看和调试设置Log等级# 文件mySpider.pyclass mySpider(CrawlSpider):name mySpiderallowed_domains [http://photo.poco.cn/]custom_settings {LOG_LEVEL:INFO, # 减少Log输出量仅保留必要的信息# ...... 在爬虫内部用custom_setting可以让这个配置信息仅对这一个爬虫生效}以日期为Log文件命名# 文件settings.pyimport datetimeBOT_NAME mySpiderROBOTSTXT_OBEY FalsestartDate datetime.datetime.now().strftime(%Y%m%d)LOG_FILEfmySpiderlog{startDate}.txt4.4. 为数据按日期存储到不同的表(mongodb的集合)中# 文件pipelines.pyimport datetimeGALANCEfgalance{datetime.datetime.now().strftime(%Y%m%d)} # 表名class myPipeline:def open_spider(self, spider):self.client MongoClient(localhost:27017) # 连接Mongodbself.db self.client[mydata] # 待存储数据的数据库mydataself.db[GALANCE].insert(dict(item))4.5. 编写批处理文件启动爬虫# 文件run.batcd /d F:/newClawer20170831/mySpidercall python main.pypause5. 实现代码5.1. 编写python脚本# 文件timerStartDaily.pyfrom scrapy import cmdlineimport datetimeimport timeimport shutilimport osrecoderDir rcrawls # 这是为了爬虫能够续爬而创建的目录存储续爬需要的数据checkFile isRunning.txt # 爬虫是否在运行的标志startTime datetime.datetime.now()print(fstartTime {startTime})i 0miniter 0while True:isRunning os.path.isfile(checkFile)if not isRunning: # 爬虫不在执行开始启动爬虫# 在爬虫启动之前处理一些事情清掉JOBDIR crawlsisExsit os.path.isdir(recoderDir) # 检查JOBDIR目录crawls是否存在print(fmySpider not running, ready to start. isExsit:{isExsit})if isExsit:removeRes shutil.rmtree(recoderDir) # 删除续爬目录crawls及目录下所有文件print(fAt time:{datetime.datetime.now()}, delete res:{removeRes})else:print(fAt time:{datetime.datetime.now()}, Dir:{recoderDir} is not exsit.)time.sleep(20)clawerTime datetime.datetime.now()waitTime clawerTime - startTimeprint(fAt time:{clawerTime}, start clawer: mySpider !!!, waitTime:{waitTime})cmdline.execute(scrapy crawl mySpider -s JOBDIRcrawls/storeMyRequest.split())break #爬虫结束之后退出脚本else:print(fAt time:{datetime.datetime.now()}, mySpider is running, sleep to wait.)i 1time.sleep(600) # 每10分钟检查一次miniter 10if miniter 1440: # 等待满24小时自动退出监控脚本break5.2. 编写bat批处理文件# 文件runTimerRunDaily.batcd /d F:/newClawer20170831/mySpidercall python timerStartDaily.pypause6. 部署。6.1. 添加计划任务。参考以下这篇博客部署windows计划任务https://www.jb51.net/article/204879.htm有关windows计划任务相关设置的详细说明如下https://technet.microsoft.com/zh-cn/library/cc722178.aspx6.2. 注意事项。(1)在添加计划任务时要按照如下图进行勾选(只在用户登录时运行)才能弹出下面的cmd任务界面方便观察和调试。(2)由于爬虫运行时间很长如果按照默认设置在凌晨运行实例时上一次启动尚未结束会导致这次启动失败所以要更改默认设置为(如果此任务已经运行并行运行新实例。保护机制在于每个启动脚本在等待24小时候会自动退出来保证不会重复启动)。(3)如果想支持续传只能按一次 ctrl c 来停止爬虫运行。因为终止爬虫时爬虫需要做一些善后工作如果连续按多次ctrl c来停止爬虫爬虫将来不及善后会导致无法续爬。 6.3. 效果展示。正常执行完成正在执行中到此这篇关于python实现scrapy爬虫每天定时抓取数据的示例代码的文章就介绍到这了,更多相关python scrapy定时抓取内容请搜索云海天教程以前的文章或继续浏览下面的相关文章希望大家以后多多支持云海天教程

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/web/82098.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

衡水提供网站制作公司哪家好如何建设一个专业的网站

Spring框架是一个开源的Java平台,它提供了非常容易,非常迅速地开发健壮的Java应用程序的全面的基础设施支持。今天就让我们一起来看看关于Spring的精华问答吧。1Q:如何在自定义端口上运行Spring Boot应用程序?A:为了在自定义端口上运行Spring…

东莞专业的网站建设网络推广小程序需要多少钱

今天看题的时候,遇到一个替换空格的题目,分析一下哈。 题目要求:把字符串中的每个空格替换成“%20”。例如输入“we are happy”,则输出“we%20are%20happy”。 解题思路:我们首先想到的是:移位思想。遇到…

网站做链接南通网站建设论坛

读取TEMP环境变量Environment.GetEnvironmentVariable("TEMP")

怎样网站优化公司深圳网站维护公司

前言 前段时间小白写了在实体机上安装FydeOS系统,发现有很多小伙伴在后台获取了FydeOS的镜像。 国内版ChromeOS?让旧机器焕发第二春的FydeOS安装教程 也有一些小伙伴看到是安装在实体机上的教程,所以就直接放弃了。其实FydeOS也可以用VM…

深圳手机建站模板好玩的网页游戏排名

匿名函数 lambda x , y : xy 1.匿名的目的就是要没有名字,给匿名函数赋给一个名字是没有意义的。 2.匿名函数的参数规则、作用域关系与有名函数是一样的。 3.匿名函数的函数体通常应该是 一个表达式,该表达式必须要有一个返回值。 flambda x,n:x ** n print(f(2,3))…

门户网站开发设计报告wordpress5 源码

前面都是点点滴滴的介绍selenium的一些api使用方法,那么selenium的api到底有多少呢?本篇就叫大家如何去查看selenium api,不求人,无需伸手找人要,在自己电脑就有。pydoc是Python自带的模块,主要用于从pytho…

vr技术在网站建设的应用清远新闻最新消息

题目描述 现有一棵由 n 个节点组成的无向树,节点编号从 0 到 n - 1 ,共有 n - 1 条边。 给你一个二维整数数组 edges ,长度为 n - 1 ,其中 edges[i] [ai, bi] 表示树中节点 ai 和 bi 之间存在一条边。另给你一个整数数组 restr…

结构设计网站推荐写作网站可以签约未成年吗

一:什么是数据? x10,10是我们要存储的数据 2 为何数据要分不同的类型 数据是用来表示状态的,不同的状态就应该用不同的类型的数据去表示 3 数据类型 数字 字符串 列表 元组 字典 集合 二:数字int #bit_length() 当十进…

郑州市二七区建设局 网站企业信用信息公示系统年报怎么填

电脑定时关机 1.右键 管理 2. 3. 4. 5. shutdown.exe/s /f /t 06.点击完成就好了 7.这里面可以 看到定时任务和启动 右键有运行 结束 禁用

建设银行官方网站下载安装机关网站建设前期准备工作

在使用 Git 作为版本控制的时候,我们可能会由于各种各样的原因提交了许多临时的 commit,而这些 commit 拼接起来才是完整的任务。那么我们为了避免太多的 commit 而造成版本控制的混乱,通常我们推荐将这些 commit 合并成一个。 1. 查看提交历…

福田深圳网站建设久久建筑网怎么免费下载

人力资源是一个组织中至关重要的一环,而员工管理是确保团队高效运转的关键因素之一。一个优秀的经理需要具备多方面的技巧和能力,以便激发员工的潜力,促进合作和增加团队的效率。在这里,我将分享一些实用的员工管理技巧&#xff0…

电脑游戏网站建设wordpress好用的博客主题

MVC 1.JSP演化历史 1. 早期只有servlet,只能使用response输出标签数据,非常麻烦 2. 后来有了jsp,简化了Servlet的开发,如果过度使用jsp,在jsp中即写大量的java代码,有写html表,造成难于维护&…

九寨沟城乡建设官方网站138ip域名查询网

随着物流产业的迅猛发展,托盘四向穿梭式自动化密集仓储系统可认为是在穿梭车货架系统基础上提出的一种新仓储概念。托盘四向穿梭式立体库因其在流通仓储体系中所具有的高效密集存储功能优势、运作成本优势与系统化智能化管理优势,已发展为仓储物流的主流…

学校网站建设方案书网站开发需要注意的

迅为iTOP-LS2K0500开发板 迅为iTOP-LS2K0500开发板采用龙芯LS2K0500处理器,基于龙芯自主指令系统(LoongArch)架构,片内集成64位LA264处理器核、32位DDR3控制器、2D GPU、DVO显示接口、两路PClE2.0、两路SATA2.0、四路USB2.0、一路…

软件下载的网站男女做那个的网站是什么

DevExpress WinForms Sunburst控件允许用户以紧凑和视觉上吸引人的方式可视化分层和扁平数据。 DevExpress WinForms有180组件和UI库,能为Windows Forms平台创建具有影响力的业务解决方案。同时能完美构建流畅、美观且易于使用的应用程序,无论是Office风…

中国电力建设集团公司官方网站辽宁省工程造价信息网官网

一、Linux固件子系统概述 固件是硬件设备自身执行的一段程序。固件一般存放在设备flash内。而出于成本和便利性的考虑,通常是先将硬件设备的运行程序打包为一个特定格式的固件文件,存储到终端系统内,通过终端系统给硬件设备进行升级。Linux内…

免费活动策划方案的网站免费网站发布怎么做的

题目描述 时间限制: 1.0s 内存限制: 512.0MB 本题总分:20 分 【问题描述】 “饱了么”外卖系统中维护着 N 家外卖店,编号 1 ∼ N。每家外卖店都有 一个优先级,初始时 (0 时刻) 优先级都为 0。 每经过 1 个时间单位,如果外卖店没有…

公司网站规划网站语言切换功能如何做

**网安圈内一年一度的HW行动来啦! ** 招募对象 不限,有HW项目经验 或持有NISP二级、CISP证书优先 HW时间 以官方正式通知为准 工作地点:全国 薪资待遇 带薪HW (根据考核成绩500-4000元/天不等) 招募流程 1.填写报名…

做交易网站存在什么风险邢台建设专业网站

1 概念 webpack是一个模块打包工具,他将各种不同类型的文件最终都打包成.js、.css、.png、.jpg4个类型的静态资源。 2 特点 模块化开发 用webpack之前,项目都是在html中引入一个个js文件来开发;而在webpack中,一切皆模块&#xf…

免费自助建站软件有哪些wordpress多域名绑定域名

先看看这个题目:test.txt中有42亿个无符号整数, 求不存在于test.txt中的最小无符号整数. 限制: 可用内存为600MB. 又是大数据。 看到42亿, 有灵感没? 要知道, 2的32次方就是42亿多一点点啊。42亿个无符号…