import web_crawler as webc """脚本运行指南""" # 整个程序的启动需点击右上角的绿色三角按钮(或使用快捷组合键Shift+F10快捷启动),注意!在启动前,请先在按钮的左侧选择“当前文件”再执行。 # 注意!!!请不要在打开公告数据导入的目标excel文件时启动该爬虫程序,程序无法对正在运行的进程文件进行修改。务必在爬虫程序启动并将数据成功导入目标excel文件后再打开并查看目标excel文件 """脚本结果读取指南""" # 这个脚本旨在爬取广西政府采购网的多个公告栏目的公告信息。 #该脚本在运行结束之后会返回以下结果:<某专栏> 新增 xxx 条公告,已保存至excel文件中,建议确认是否有新增公告后再查看excel文件 #每次爬取之后会把数据导出至指定excel表格,表格将会把数据按时间倒序的方式排列公告数据,同时会把属于今天的公告数据标红。excel文件默认为桌面的政府采购公告.xlsx('D:/Document/政府采购公告.xlsx') """脚本参数修改指南""" # 若没有创建相应的excel表格文件,无需担心,程序会先检测是否有对应的excel文件,若不存在该文件,程序便会自动生成。 # excel表格的存取路径可以在utils.py中修改。请点击左侧的"项目"(或使用快捷组合键Alt+1打开项目栏),选择utils.py并打开。可以在这个文件中修改某些参数。 # 若需要修改公告信息的筛选条件以及启动爬虫程序的代理列表,请点击左侧的"项目"(或使用快捷组合键Alt+1打开项目栏),选择utils.py并打开。可以在这个文件中修改这些参数。 # 我已经设置了一个定时器,在每天的8:40、14:40、18:00这三个时间段,定时器会启动爬虫程序开始爬取网站。如果需要修改时间段,可以在代码的下半部分修改 # 修改参数以及代码片段后请重新启动程序。 # """脚本定时启动""" # def job(): # print(f"任务执行于 {datetime.now()}") # #调用爬取函数 # webc.web_crawler() # print(f"任务完成于 {datetime.now()}") # # # 安排任务在每天的8:40、14:40、18:00执行 # # 此处可以修改时间段,只需修改括号内的时间即可,格式参照原先括号里的数即可,如需额外增加时间段,请复制代码:schedule.every().day.at("时间段").do(job)并粘贴到下方,可增加任意数量的时间段 # schedule.every().day.at("08:37").do(job) # schedule.every().day.at("11:55").do(job) # schedule.every().day.at("14:45").do(job) # schedule.every().day.at("18:00").do(job) # # print("脚本定时任务已启动...") # while True: # schedule.run_pending() # time.sleep(1) """脚本单次启动""" def main(): print("脚本单次任务已启动...") webc.web_crawler() if __name__ == "__main__": main()