码迷,mamicode.com
首页 > Web开发 > 详细

网页资源下载器

时间:2015-07-28 16:03:14      阅读:132      评论:0      收藏:0      [点我收藏+]

标签:网页资源   下载器   python   

一个简单的python程序,用于下载pdf/txt/ppt等网页资源下载。

import urllib 
import urllib2 
import re 
import socket

#######################You may change here###############
baseurl = ‘##########‘  #请自行添加下载网页地址
format = ‘(pdf|txt|cc|ppt|pptx)‘ #下载格式,可自行添加
#########################################################

def downfunc(blocknum, blocksize, totalsize):
    ‘‘‘回调函数
    @blocknum:  已经下载的数据块
    @blocksize: 数据块的大小
    @totalsize: 下载文件的大小
    ‘‘‘
    percent = 100.0 * blocknum * blocksize / totalsize
    if percent > 100:
        percent = 100
        print "下载完成^^~"
    else:
        print "已下载%.2f%%......"% percent

def download(downurl, localFileName=None):
    #m = re.search(‘(\w+.pdf)‘,downurl)
    m = re.search(‘(\w+.%s)‘ % format,downurl)  
    if localFileName == None:
        localFileName = m.group(0)

    print ("正在下载" + localFileName)

    try:
        urllib.urlretrieve(downurl, localFileName,downfunc)  
    except socket.timeout:
        print "下载超时"

socket.setdefaulttimeout(30)

#打开页面
page = urllib2.urlopen(baseurl) 

# 读取包含HTML源码内容的页面信息 
page_inform = page.read() 

# 获取资源列表
#list_of_res = re.findall(r‘href=.*"(.*\.pdf)‘, page_inform)
list_of_res = re.findall(r‘href=.*"(.*\.%s)‘ % format, page_inform)

# 去除重复的资源
list_of_res = list(set(list_of_res)) 

# 根据资源列表逐个下载
for res in list_of_res:
    downurl = res[0]
    if downurl[0:4] != ‘http‘:
        downurl = baseurl+downurl
    download(downurl)

程序下载:
网页资源下载器

版权声明:本文为博主原创文章,未经博主允许不得转载。

网页资源下载器

标签:网页资源   下载器   python   

原文地址:http://blog.csdn.net/kzq_qmi/article/details/47105761

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!