我是刮擦的新手,正在学习使用BeautifulSoup,但刮刮桌子时遇到了麻烦。对于HTML,我正在尝试解析:
<table id="ctl00_mainContent_DataList1" cellspacing="0" > style="width:80%;border-collapse:collapse;"> == $0
<tbody>
<tr><td><table width="90%" cellpadding="5" cellspacing="0">...</table></td></tr>
<tr><td><table width="90%" cellpadding="5" cellspacing="0">...</table></td></tr>
<tr><td><table width="90%" cellpadding="5" cellspacing="0">...</table></td></tr>
<tr><td><table width="90%" cellpadding="5" cellspacing="0">...</table></td></tr>
...
我的代码:
from urllib.request import urlopen
from bs4 import BeautifulSoup
quote_page = 'https://www.bcdental.org/yourdentalhealth/findadentist.aspx'
page = urlopen(quote_page)
soup = BeautifulSoup(page, 'html.parser')
table = soup.find('table', id="ctl00_mainContent_DataList1")
rows = table.findAll('tr')
我懂了AttributeError: 'NoneType' object has no attribute 'findAll'
。我正在为此使用python 3.6和jupyter笔记本。
编辑:我要解析的表数据仅在请求搜索后显示在页面上(在city
字段中,选择Burnaby
,然后单击搜索)。该表ctl00_mainContent_DataList1
是提交搜索后显示的牙医列表。
首先:我使用requests
它是因为使用Cookie,标头等更加容易。
网页是由生成ASP.net
和发送值__VIEWSTATE
,__VIEWSTATEGENERATOR
,__EVENTVALIDATION
您必须在发送POST
的请求了。
您必须使用加载页面GET
,然后才能获得这些值。
您也可以使用request.Session()
获取所需的Cookie。
接下来,您必须复制值并从表单添加参数,然后使用发送POST
。
在代码中,我只放置了始终发送的参数。
'526'
是的代码Vancouver
。您可以在<select>
标记中找到的其他代码。
如果需要其他选项,则可能必须添加其他参数。
即。ctl00$mainContent$chkUndr4Ref: on
是为了Children: 3 & Under - Diagnose & Refer
编辑:因为里面<tr>
是<table>
如此find_all('tr')
返回太多的元素(外部tr
和内部tr
)和and later
find_all('td')give the same
td many times. I changed
find_all('tr')into
find_all('table')`,它应该停止重复的数据。
import requests
from bs4 import BeautifulSoup
url = 'https://www.bcdental.org/yourdentalhealth/findadentist.aspx'
# --- session ---
s = requests.Session() # to automatically copy cookies
#s.headers.update({'User-Agent': 'Mozilla/5.0 (X11; Ubuntu; Linux x86_64; rv:57.0) Gecko/20100101 Firefox/57.0'})
# --- GET request ---
# get page to get cookies and params
response = s.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
# --- set params ---
params = {
# session - copy from GET request
#'EktronClientManager': '',
#'__VIEWSTATE': '',
#'__VIEWSTATEGENERATOR': '',
#'__EVENTVALIDATION': '',
# main options
'ctl00$terms': '',
'ctl00$mainContent$drpCity': '526',
'ctl00$mainContent$txtPostalCode': '',
'ctl00$mainContent$drpSpecialty': 'GP',
'ctl00$mainContent$drpLanguage': '0',
'ctl00$mainContent$drpSedation': '0',
'ctl00$mainContent$btnSearch': '+Search+',
# other options
#'ctl00$mainContent$chkUndr4Ref': 'on',
}
# copy from GET request
for key in ['EktronClientManager', '__VIEWSTATE', '__VIEWSTATEGENERATOR', '__EVENTVALIDATION']:
value = soup.find('input', id=key)['value']
params[key] = value
#print(key, ':', value)
# --- POST request ---
# get page with table - using params
response = s.post(url, data=params)#, headers={'Referer': url})
soup = BeautifulSoup(response.text, 'html.parser')
# --- data ---
table = soup.find('table', id='ctl00_mainContent_DataList1')
if not table:
print('no table')
#table = soup.find_all('table')
#print('count:', len(table))
#print(response.text)
else:
for row in table.find_all('table'):
for column in row.find_all('td'):
text = ', '.join(x.strip() for x in column.text.split('\n') if x.strip()).strip()
print(text)
print('-----')
结果的一部分:
Map
Dr. Kashyap Vora, 6145 Fraser Street, Vancouver V5W 2Z9
604 321 1869, www.voradental.ca
-----
Map
Dr. Niloufar Shirzad, Harbour Centre DentalL19 - 555 Hastings Street West, Vancouver V6B 4N6
604 669 1195, www.harbourcentredental.com
-----
Map
Dr. Janice Brennan, 902 - 805 Broadway West, Vancouver V5Z 1K1
604 872 2525
-----
Map
Dr. Rosemary Chang, 1240 Kingsway, Vancouver V5V 3E1
604 873 1211
-----
Map
Dr. Mersedeh Shahabaldine, 3641 Broadway West, Vancouver V6R 2B8
604 734 2114, www.westkitsdental.com
-----
本文收集自互联网,转载请注明来源。
如有侵权,请联系 [email protected] 删除。
我来说两句