本文介绍了Python BeautifulSoup - 在 iframe 中抓取 Web 内容的处理方法,对大家解决问题具有一定的参考价值
问题描述
我们有这个网址:https://www.aliexpress.com/store/feedback-score/1665279.html
所需的内容是 iframe 中的Feedback History"表:
反馈 1个月 3个月 6个月正面 154 562 1,550中性 8 19 65负 8 20 57好评率 95.1% 96.6% 96.5%
我们如何提取它?
解决方案
你只需要获取iframe
的src
属性,然后请求解析其内容即可:
导入请求从 bs4 导入 BeautifulSoups = requests.Session()r = s.get(https://www.aliexpress.com/store/feedback-score/1665279.html")汤 = BeautifulSoup(r.content, html.parser")iframe_src = soup.select_one("#detail-displayer").attrs["src"]r = s.get(f"https:{iframe_src}")汤 = BeautifulSoup(r.content, html.parser")对于soup.select(.history-tb tr")中的行:打印( ".join([e.text for e in row.select(th, td")]))
结果:
<前>反馈 1 个月 3 个月 6 个月正面(4-5 星) 154 562 1,550中性(3 星) 8 19 65负(1-2 星) 8 20 57好评率 95.1% 96.6% 96.5%
We have this URL:
https://www.aliexpress.com/store/feedback-score/1665279.html
And the needed content is the "Feedback History" table, which is inside an iframe:
Feedback 1 Month 3 Months 6 Months
Positive (4-5 Stars) 154 562 1,550
Neutral (3 Stars) 8 19 65
Negative (1-2 Stars) 8 20 57
Positive feedback rate 95.1% 96.6% 96.5%
How do we extract it?
解决方案
You just need to obtain the src
attribute of the iframe
, and then request and parse its content:
import requests
from bs4 import BeautifulSoup
s = requests.Session()
r = s.get("https://www.aliexpress.com/store/feedback-score/1665279.html")
soup = BeautifulSoup(r.content, "html.parser")
iframe_src = soup.select_one("#detail-displayer").attrs["src"]
r = s.get(f"https:{iframe_src}")
soup = BeautifulSoup(r.content, "html.parser")
for row in soup.select(".history-tb tr"):
print(" ".join([e.text for e in row.select("th, td")]))
Result:
Feedback 1 Month 3 Months 6 Months
Positive (4-5 Stars) 154 562 1,550
Neutral (3 Stars) 8 19 65
Negative (1-2 Stars) 8 20 57
Positive feedback rate 95.1% 96.6% 96.5%
这篇关于Python BeautifulSoup - 在 iframe 中抓取 Web 内容的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,WP2
do_action( "admin_action_{$_REQUEST[‘action’]}" )动作钩子::在发送“Action”请求变量时激发。Action Hook: Fires when an ‘action’ request variable is sent.目录锚点:#说明#源码说明(Description)钩子名称的动态部分$_REQUEST['action']引用从GET或POST请求派生的操作。源码(Source)更新版本源码位置使用被使用2.6.0 wp-admin/admin.php:...
日期:2020-09-02 17:44:16
浏览:1127
do_action( "admin_footer-{$GLOBALS[‘hook_suffix’]}", string $hook_suffix )操作挂钩:在默认页脚脚本之后打印脚本或数据。Action Hook: Print scripts or data after the default footer scripts.目录锚点:#说明#参数#源码说明(Description)钩子名的动态部分,$GLOBALS['hook_suffix']引用当前页的全局钩子后缀。参数(Parameters)参数类...
日期:2020-09-02 17:44:20
浏览:1032
do_action( "customize_save_{$this->id_data[‘base’]}", WP_Customize_Setting $this )动作钩子::在调用WP_Customize_Setting::save()方法时激发。Action Hook: Fires when the WP_Customize_Setting::save() method is called.目录锚点:#说明#参数#源码说明(Description)钩子名称的动态部分,$this->id_data...
日期:2020-08-15 15:47:24
浏览:775
apply_filters( "customize_value_{$this->id_data[‘base’]}", mixed $default )过滤器::过滤未作为主题模式或选项处理的自定义设置值。Filter Hook: Filter a Customize setting value not handled as a theme_mod or option.目录锚点:#说明#参数#源码说明(Description)钩子名称的动态部分,$this->id_date['base'],指的是设置...
日期:2020-08-15 15:47:24
浏览:866
过滤钩子:过滤评论作者的URL。Filter Hook: Filters the comment author’s URL.目录锚点:#源码源码(Source)更新版本源码位置使用被使用 wp-includes/comment-template.php:32610...
日期:2020-08-10 23:06:14
浏览:903
do_action( "network_admin_edit_{$_GET[‘action’]}" )操作挂钩:启动请求的处理程序操作。Action Hook: Fires the requested handler action.目录锚点:#说明#源码说明(Description)钩子名称的动态部分$u GET['action']引用请求的操作的名称。源码(Source)更新版本源码位置使用被使用3.1.0 wp-admin/network/edit.php:3600...
日期:2020-08-02 09:56:09
浏览:848
apply_filters( "network_sites_updated_message_{$_GET[‘updated’]}", string $msg )筛选器挂钩:在网络管理中筛选特定的非默认站点更新消息。Filter Hook: Filters a specific, non-default site-updated message in the Network admin.目录锚点:#说明#参数#源码说明(Description)钩子名称的动态部分$_GET['updated']引用了非默认的...
日期:2020-08-02 09:56:03
浏览:834
过滤器::过滤在访问数据库之前是否初始化站点的检查。Filter Hook: Filters the check for whether a site is initialized before the database is accessed.目录锚点:#源码源码(Source)更新版本源码位置使用被使用 wp-includes/ms-site.php:93910...
日期:2020-07-29 10:15:38
浏览:809
你想在WordPress 中添加关键字和meta 描述吗?关键字和meta 描述使你能够提高网站的SEO。在本文中,我们将向你展示如何在WordPress 中正确添加关键字和meta 描述。为什么要在WordPress 中添加关键字和Meta 描述?关键字和说明让搜寻引擎更了解您的帖子和页面的内容。关键词是人们寻找您发布的内容时,可能会搜索的重要词语或片语。而Meta Description则是对你的页面和文章的简要描述。如果你想要了解更多关于中继标签的资讯,可以参考Google的说明。Meta 关键字和描...
日期:2020-10-03 21:18:25
浏览:1620
SEO (Search Engine Optimization)中文是搜寻引擎最佳化,意思近于「关键字自然排序」、「网站排名优化」。简言之,SEO是以搜索引擎(如Google、Bing)为曝光媒体的行销手法。例如搜寻「wordpress教学」,会看到本站的「WordPress教学:12个课程…」排行Google第一:关键字:wordpress教学、wordpress课程…若搜寻「网站架设」,则会看到另一个网页排名第1:关键字:网站架设、架站…以上两个网页,每月从搜寻引擎导入自然流量,达2万4千:每月「有机搜...
日期:2020-10-30 17:23:57
浏览:1263