当前位置: 首页 > news >正文

箱包商城网站建设WordPress一键采集插件

箱包商城网站建设,WordPress一键采集插件,设计服务网络建设方案,怎么在百度建立自己的网站简述以下的代码是使用python实现的网络爬虫#xff0c;抓取动态网页 http://hb.qq.com/baoliao/ 。此网页中的最新、精华下面的内容是由JavaScript动态生成的。审查网页元素与网页源码是不同。以上是网页源码以上是审查网页元素所以此处不能简单的使用正则表达式来获取内容。以…简述以下的代码是使用python实现的网络爬虫抓取动态网页 http://hb.qq.com/baoliao/ 。此网页中的最新、精华下面的内容是由JavaScript动态生成的。审查网页元素与网页源码是不同。以上是网页源码以上是审查网页元素所以此处不能简单的使用正则表达式来获取内容。以下是完整的获取内容并存储到数据库的思路及源码。实现思路抓取实际访问的动态页面的url – 使用正则表达式获取需要的内容 – 解析内容 – 存储内容以上部分过程文字解释抓取实际访问的动态页面的url在火狐浏览器中右键打开插件 使用**firebug审查元素** *(没有这项的要安装firebug插件)找到并打开**网络(NET)**标签页。重新加载网页获得网页的响应信息包括连接地址。每个连接地址都可以在浏览器中打开。本网站的动态网页访问地址是http://baoliao.hb.qq.com/api/report/NewIndexReportsList/cityid/18/num/20/pageno/1?callbackjQuery183019859437816181613_1440723895018_1440723895472正则表达式:正则表达式的使用有两种思路可以参考个人有关其简述python实现简单爬虫以及正则表达式简述更多的细节介绍可以参考网上资料搜索关键词 正则表达式 pythonjson参考网上有关json的介绍搜索关键词 json python存储到数据库参考网上的使用介绍搜索关键词 1mysql 2mysql python源码及注释注意使用python的版本是 2.7#!/usr/bin/python#指明编码#-*- coding: UTF-8 -*-#导入python库importurllibimporturllib2importreimportMySQLdbimportjson#定义爬虫类classcrawl1:def getHtml(self,urlNone):#代理user_agentMozilla/5.0 (Windows NT 6.1; WOW64; rv:40.0) Gecko/20100101 Firefox/40.0header{User-Agent:user_agent}requesturllib2.Request(url,headersheader)responseurllib2.urlopen(request)htmlresponse.read()returnhtmldefgetContent(self,html,reg):contentre.findall(html, reg, re.S)returncontent#连接数据库 mysqldefconnectDB(self):host192.168.85.21dbNametest1userrootpassword123456#此处添加charsetutf8是为了在数据库中显示中文此编码必须与数据库的编码一致dbMySQLdb.connect(host,user,password,dbName,charsetutf8)returndbcursorDBdb.cursor()returncursorDB#创建表SQL语言。CREATE TABLE IF NOT EXISTS 表示表createTableName不存在时就创建defcreatTable(self,createTableName):createTableSqlCREATE TABLE IF NOT EXISTS createTableName(time VARCHAR(40),title VARCHAR(100),text VARCHAR(40),clicks VARCHAR(10))DB_createself.connectDB()cursor_createDB_create.cursor()cursor_create.execute(createTableSql)DB_create.close()print creat tablecreateTableNamesuccessfullyreturncreateTableName#数据插入表中definserttable(self,insertTable,insertTime,insertTitle,insertText,insertClicks):insertContentSqlINSERT INTOinsertTable(time,title,text,clicks)VALUES(%s,%s,%s,%s)#insertContentSqlINSERT INTO insertTable(time,title,text,clicks)VALUES(insertTime , insertTitle , insertText , insertClicks)DB_insertself.connectDB()cursor_insertDB_insert.cursor()cursor_insert.execute(insertContentSql,(insertTime,insertTitle,insertText,insertClicks))DB_insert.commit()DB_insert.close()print inert contents toinsertTablesuccessfullyurlhttp://baoliao.hb.qq.com/api/report/NewIndexReportsList/cityid/18/num/20/pageno/1?callbackjQuery183019859437816181613_1440723895018_1440723895472#正则表达式获取js时间标题文本内容点击量(浏览次数)reg_jasonr.*?jQuery.*?\((.*)\)reg_timer.*?create_time:(.*?)reg_titler.*?title:(.*?).*?reg_textr.*?content:(.*?).*?reg_clicksr.*?counter_clicks:(.*?)#实例化crawl()对象crawlcrawl1()htmlcrawl.getHtml(url)html_jasonre.findall(reg_jason, html, re.S)html_needjson.loads(html_jason[0])printlen(html_need)print len(html_need[data][list])tablecrawl.creatTable(yh1)for i in range(len(html_need[data][list])):creatTimehtml_need[data][list][i][create_time]titlehtml_need[data][list][i][title]contenthtml_need[data][list][i][content]clickshtml_need[data][list][i][counter_clicks]crawl.inserttable(table,creatTime,title,content,clicks)
http://www.pierceye.com/news/486933/

相关文章:

  • 河南省住房和城乡建设部网站首页安徽建设工程信息平台
  • 网站开发工程师的要求做seo要明白网站内容
  • 如何做天猫网站医学ppt模板免费下载网站
  • 网站上的通话功能怎么做网站用不用备案
  • 信誉好的模板网站建设wordpress 伪静态设置
  • wordpress主题外贸网站wordpress检查php版本号
  • 便宜电商网站建设找平面图的网站
  • 大型网站建设制作平台东莞南城房价
  • 360免费视频网站建设mvc网站开发之美
  • 武宁县建设工程招标公告门户网站设计一个网站先做哪些构造
  • 公司网站免费建设2023设计院裁员惨烈程度
  • 别人做的网站不能用设计网站教程
  • 设计师发布作品的网站wordpress仿
  • 品牌微信网站建设柳州做网站制作的公司有哪些
  • 买域名做网站推广都是些什么网站点击后的loading是怎么做的
  • 北京网站优化技术泰州自助建站软件
  • 公司企业网站建设目的站长统计官方网站
  • 集团公司网站模板wordpress更换主题方法
  • 临沂网站建设电话建设网站审批手续
  • 国外做健康的网站专门做鞋子的网站吗
  • 手机网站支持微信支付吗北京短视频拍摄
  • 做静态网站工资多少网站前期推广
  • 做预算查价格的网站是哪个好网站开发维护多少钱
  • 个人互动网站365建筑人才网
  • 天津外贸公司网站制作淘客cms网站建设
  • 怎样做微网站网站建设pc指什么软件
  • 四川 网站建设wordpress腾讯地图插件下载
  • 宁波网站公司哪家好百度关键词搜索量排名
  • 北京国税局网站做票种核定时眉山网站优化
  • 网站备案授权书成都网站建设十强企业