Python(bs4) wiki 页面抓取

阿维隆我

我只想从维基页面上刮出电影标题，请帮帮我

我的代码：

url = 'https://en.wikipedia.org/wiki/List_of_American_films_of_2020'
page = requests.get(url)
soup = BeautifulSoup(page.content,'html.parser')
movies = soup.find('table',{'class':'wikitable sortable'})
print(movies)

我只想从结构中过滤出电影标题，就像图像中的电影标题应该只是“丢失的传输”

这是 HTML 中一部电影的结构：

比斯瓦纳特

您可以进一步使用刮取的表。

table_body = movies.find('tbody') 
titles = [] 
rows = table_body.find_all('tr') 
for row in rows[1:]: # leaving the first row, seems it is a header
    title_cell = row.select("td i a") 
    titles.append(title_cell[0].contents[0]) 
print(titles)

本文收集自互联网，转载请注明来源。

如有侵权，请联系 [email protected] 删除。

编辑于 2021-08-14

我来说两句

0 条评论

登录后参与评论

上一篇：Docker - 让我的应用程序使用机密而不是 env。变量

页面设计的Wiki模板

使用 BeautifulSoup 在具有多个表格的页面上抓取单个 Wiki 表格

如何创建Ubuntu Wiki页面？

GitHub Wiki页面排序顺序？

Python(bs4) wiki 页面抓取

Python(bs4) wiki 页面抓取

Linux的官方Adobe Flash存储库是否已过时？

用日期数据透视表和日期顺序查询

应用发明者仅从列表中选择一个随机项一次

Java Eclipse中的错误13，如何解决？

在Windows 7中无法删除文件（2）

在 Python 2.7 中。如何从文件中读取特定文本并分配给变量

套接字无法检测到断开连接

带有错误“ where”条件的查询如何返回结果？

有什么解决方案可以将android设备用作Cast Receiver？

Mac OS X更新后的GRUB 2问题

ggplot：对齐多个分面图-所有大小不同的分面

验证REST API参数

如何从视图一次更新多行（ASP.NET - Core）

尝试反复更改屏幕上按钮的位置 - kotlin android studio

计算数据帧中每行的NA

检索角度选择div的当前值

离子动态工具栏背景色

UITableView的项目向下滚动后更改颜色，然后快速备份

VB.net将2条特定行导出到DataGridView

蓝屏死机没有修复解决方案

通过 Git 在运行 Jenkins 作业时获取 ClassNotFoundException