44 lines
2.9 KiB
Python
Executable File
44 lines
2.9 KiB
Python
Executable File
import web_crawler as webc
|
|
|
|
"""脚本运行指南"""
|
|
# 整个程序的启动需点击右上角的绿色三角按钮(或使用快捷组合键Shift+F10快捷启动),注意!在启动前,请先在按钮的左侧选择“当前文件”再执行。
|
|
# 注意!!!请不要在打开公告数据导入的目标excel文件时启动该爬虫程序,程序无法对正在运行的进程文件进行修改。务必在爬虫程序启动并将数据成功导入目标excel文件后再打开并查看目标excel文件
|
|
|
|
"""脚本结果读取指南"""
|
|
# 这个脚本旨在爬取广西政府采购网的多个公告栏目的公告信息。
|
|
#该脚本在运行结束之后会返回以下结果:<某专栏> 新增 xxx 条公告,已保存至excel文件中,建议确认是否有新增公告后再查看excel文件
|
|
#每次爬取之后会把数据导出至指定excel表格,表格将会把数据按时间倒序的方式排列公告数据,同时会把属于今天的公告数据标红。excel文件默认为桌面的政府采购公告.xlsx('D:/Document/政府采购公告.xlsx')
|
|
|
|
"""脚本参数修改指南"""
|
|
# 若没有创建相应的excel表格文件,无需担心,程序会先检测是否有对应的excel文件,若不存在该文件,程序便会自动生成。
|
|
# excel表格的存取路径可以在utils.py中修改。请点击左侧的"项目"(或使用快捷组合键Alt+1打开项目栏),选择utils.py并打开。可以在这个文件中修改某些参数。
|
|
# 若需要修改公告信息的筛选条件以及启动爬虫程序的代理列表,请点击左侧的"项目"(或使用快捷组合键Alt+1打开项目栏),选择utils.py并打开。可以在这个文件中修改这些参数。
|
|
# 我已经设置了一个定时器,在每天的8:40、14:40、18:00这三个时间段,定时器会启动爬虫程序开始爬取网站。如果需要修改时间段,可以在代码的下半部分修改
|
|
# 修改参数以及代码片段后请重新启动程序。
|
|
|
|
# """脚本定时启动"""
|
|
# def job():
|
|
# print(f"任务执行于 {datetime.now()}")
|
|
# #调用爬取函数
|
|
# webc.web_crawler()
|
|
# print(f"任务完成于 {datetime.now()}")
|
|
#
|
|
# # 安排任务在每天的8:40、14:40、18:00执行
|
|
# # 此处可以修改时间段,只需修改括号内的时间即可,格式参照原先括号里的数即可,如需额外增加时间段,请复制代码:schedule.every().day.at("时间段").do(job)并粘贴到下方,可增加任意数量的时间段
|
|
# schedule.every().day.at("08:37").do(job)
|
|
# schedule.every().day.at("11:55").do(job)
|
|
# schedule.every().day.at("14:45").do(job)
|
|
# schedule.every().day.at("18:00").do(job)
|
|
#
|
|
# print("脚本定时任务已启动...")
|
|
# while True:
|
|
# schedule.run_pending()
|
|
# time.sleep(1)
|
|
|
|
"""脚本单次启动"""
|
|
def main():
|
|
print("脚本单次任务已启动...")
|
|
webc.web_crawler()
|
|
|
|
if __name__ == "__main__":
|
|
main() |