当前位置: 首页 > news >正文

深圳品牌网站推广公司亚马逊跨境电商开店

深圳品牌网站推广公司,亚马逊跨境电商开店,移动端适配,软件设计文档#x1f4da;博客主页#xff1a;knighthood2001 ✨公众号#xff1a;认知up吧 #xff08;目前正在带领大家一起提升认知#xff0c;感兴趣可以来围观一下#xff09; #x1f383;知识星球#xff1a;【认知up吧|成长|副业】介绍 ❤️感谢大家点赞#x1f44d;… 博客主页knighthood2001 ✨公众号认知up吧 目前正在带领大家一起提升认知感兴趣可以来围观一下 知识星球【认知up吧|成长|副业】介绍 ❤️感谢大家点赞收藏⭐评论✍您的三连就是我持续更新的动力❤️ 笔者水平有限欢迎各位大佬指点相互学习进步 需求平时一些公众号文章封面图比较好想获取一下。因此写了这个脚本。 前言 打开一篇公众号右键查看网页源代码 其中你可以通过ctrlF进行关键字搜索。 msg_cdn_url对应的链接就是微信公众号封面图比如 cdn_url_1_1对应的链接就是没有裁剪的公众号封面图比如 可以发现cdn_url_1_1对应的链接图片资源完整一些。 因此我选择爬取这个图片也就是找cdn_url_1_1所对应的网址。 爬取思路 首先图片是以网址形式给出因此需要从网址中把图片保存为本地文件。其次我需要从网页源代码中筛选出该网址可以使用re正则表达式进行该操作。 预备知识 可以先看一下我写的这两篇文章因为代码都是逐渐往上加内容才实现最终功能的你可以理解为搭积木。 Python爬取网页源代码自用 Python下载爬取到的图片链接 Python获取当前时间戳 通过正则表达式筛选内容 除了以上内容下面代码是今天要学的其功能就是正则表达式获取公众号封面图所在的网址通过查找网页源代码cdn_url_1_1只出现了一次因此可以直接通过re模块进行筛选。 import requests import re # 定义目标网页的URL url https://mp.weixin.qq.com/s/d7DUHB-hT8DExjpxsEncQw# 发送GET请求获取网页内容 response requests.get(url)# 检查响应状态码200表示请求成功 if response.status_code 200:# 输出网页源代码print(response.text)# 定义包含目标网址的字符串source_code response.text# 使用正则表达式提取网址# url_pattern re.compile(rcdn_url_1_1\s*\s*(.*?))url_pattern re.compile(rcdn_url_1_1 (.*?))matches url_pattern.findall(source_code)# 输出提取到的网址if matches:print(matches[0])else:print(No URL found.)matches返回的是一个列表因此需要添加[0]表示取第一个。运行结果如下返回的就是公众号封面的图片网址。 https://mmbiz.qpic.cn/sz_mmbiz_jpg/n3WJwMGdIpnGSMHew0kcnsEk8Y9icBG8EBh8ib6qBBZmJR8DgkZookgGWVuibTgsUrIPiatfiafNI8N1dR4uhI086UA/0?wx_fmtjpeg本文正则表达式的解释 此外对于这个正则表达式 cdn_url_1_1\s*\s*(.*?) 可以分为几个部分来解释 cdn_url_1_1匹配字符串中的 cdn_url_1_1它是要匹配的目标字符串的一部分。\s*匹配零个或多个空白字符包括空格、制表符、换行符等。匹配一个等号字符。\s*再次匹配零个或多个空白字符。匹配一个双引号字符。双引号是开始网址的标记。(.*?)这是一个捕获组用于捕获双引号内的内容。.*? 匹配任意字符除换行符外零次或多次非贪婪模式即匹配到第一个双引号结束。再次匹配一个双引号字符。双引号是结束网址的标记。 因此整个正则表达式的作用是匹配形如 cdn_url_1_1 ... 这样的字符串并捕获其中双引号内的网址部分。 为了更加简单你也可以写成cdn_url_1_1 (.*?)。 全文代码 通过搭积木的方式将以上代码整合起来具体代码如下 import requests import re import os #TODO 使用时间戳当作文件名称 def get_time():import timetimestamp int(time.time())return timestamp #TODO 实现从网页图片保存到本地输入为图片网址和保存路径 def image_save(image_url, path):if not os.path.exists(path): # 如果文件夹不存在则创建os.makedirs(path)# 发送 GET 请求获取图片数据response requests.get(image_url)# 确保请求成功if response.status_code 200:image_name get_time()image_name {}.jpg.format(image_name)# 指定图片保存路径save_path os.path.join(path, image_name) # 这里将图片保存在名为 images 的文件夹中# 将图片数据写入文件with open(save_path, wb) as f:f.write(response.content)print(f图片已保存为: {save_path})else:print(f下载图片失败状态码: {response.status_code})# 定义目标网页的URL url https://mp.weixin.qq.com/s/d7DUHB-hT8DExjpxsEncQw# 发送GET请求获取网页内容 response requests.get(url)# 检查响应状态码200表示请求成功 if response.status_code 200:# 输出网页源代码print(response.text)# 定义包含目标网址的字符串source_code response.text# 使用正则表达式提取网址# url_pattern re.compile(rcdn_url_1_1\s*\s*(.*?))url_pattern re.compile(rcdn_url_1_1 (.*?))matches url_pattern.findall(source_code)# 输出提取到的网址if matches:print(matches[0])image_save(matches[0], images)else:print(No URL found.)else:# 如果请求失败打印错误信息print(Failed to retrieve webpage:, response.status_code)最后可以将其封装为函数方便调用。 import requests import re import os #TODO 使用时间戳当作文件名称 def get_time():import timetimestamp int(time.time())return timestamp #TODO 实现从网页图片保存到本地输入为图片网址和保存路径 def image_save(image_url, path):if not os.path.exists(path): # 如果文件夹不存在则创建os.makedirs(path)# 发送 GET 请求获取图片数据response requests.get(image_url)# 确保请求成功if response.status_code 200:image_name get_time()image_name {}.jpg.format(image_name)# 指定图片保存路径save_path os.path.join(path, image_name) # 这里将图片保存在名为 images 的文件夹中# 将图片数据写入文件with open(save_path, wb) as f:f.write(response.content)print(f图片已保存为: {save_path})else:print(f下载图片失败状态码: {response.status_code})# 定义目标网页的URL url https://mp.weixin.qq.com/s/d7DUHB-hT8DExjpxsEncQw # TODO 微信公众号获取封面并保存输入网址 def get_image(wechat_url):response requests.get(wechat_url)# 检查响应状态码200表示请求成功if response.status_code 200:# 定义包含目标网址的字符串source_code response.text# 使用正则表达式提取网址url_pattern re.compile(rcdn_url_1_1 (.*?))matches url_pattern.findall(source_code)# 输出提取到的网址if matches:print(matches[0])image_save(matches[0], images)else:print(No URL found.)else:# 如果请求失败打印错误信息print(Failed to retrieve webpage:, response.status_code)get_image(url)最后结果如下
http://www.pierceye.com/news/690032/

相关文章:

  • 邢台专业做网站报价做一门户网站价格
  • 中山企业手机网站建设设计方案翻译
  • 江苏省品牌专业群建设专题网站wordpress 返利 插件
  • 建设部网站官网设计排版网站
  • 企业网站建设应避免数据孤岛网站建设费入何科目
  • wordpress数据量大网站访问石家庄网站建设招商
  • 公司核名在哪个网站免费申请无限流量卡
  • 做网站和网页的目的和作用是什么山西2地又检出阳性
  • 自助网站建设推广优化策略wordpress中文采集插件
  • 网站开发及运营成本做网站 公司 个体
  • 永久免费建站地址苏州h5网站建设价钱
  • 室内设计网站网站建设中请稍后再访问
  • 十堰网站开发培训编程软件手机
  • 南京网站优化推广微网站缺点
  • 大连零基础网站建设培训哪里有固安县建设局网站
  • 怎么制作网站首页培训心得体会总结简短
  • 商务网站建设 模板长春高端品牌网站建设
  • 做网站比较便宜办公资源网
  • 公司怎么做网页网站遵义网站设计公司
  • 网站建设毕业设计yy直播回放
  • 响应式网站有哪些2017淮南网络推广报价
  • 兰州公司网站建设网站建设筹备方案
  • 租房网站建设做一个跨境电商网站
  • 网站设计制作过程容桂做pc端网站
  • 宜昌市上海中学官网seo文章外包
  • 加强普法网站建设的通知制作婚恋网站
  • 北大荒建设集团有限公司网站网站添加在线qq聊天
  • 网站首页被k咋办上海市企业服务云登录
  • 长安镇网站建设公司大网站制作公司
  • 衡水做网站推广找谁廊坊百度推广排名优化