Selenium webdriver selenium在一个特殊类href link下搜索项目_Selenium Webdriver_Web Scraping_Web Crawler_Scapy

Selenium webdriver selenium在一个特殊类href link下搜索项目

selenium-webdriver web-scraping web-crawler

Selenium webdriver selenium在一个特殊类href link下搜索项目,selenium-webdriver,web-scraping,web-crawler,scapy,Selenium Webdriver,Web Scraping,Web Crawler,Scapy,我正在尝试获取网站的链接，我想获取每个日期的链接 import pandas as pd from selenium import webdriver from selenium.webdriver.common.action_chains import ActionChains from selenium.webdriver.support.ui import WebDriverWait path = 'C:\Windows\chromedriver.exe' driver = webdri

我正在尝试获取网站的链接，我想获取每个日期的链接

import pandas as pd
from selenium import webdriver
from selenium.webdriver.common.action_chains import ActionChains
from selenium.webdriver.support.ui import WebDriverWait

path = 'C:\Windows\chromedriver.exe'
driver = webdriver.Chrome(path)
driver.implicitly_wait(10)
driver.get('https://web.archive.org/web/*/https://cd.lianjia.com/ ')


element =driver.find_element_by_xpath('/html/body/div[4]/div[3]/div/div[2]/span[21]')
actions = ActionChains(driver)
actions.move_to_element(element).click().perform()

  day = driver.find_elements_by_css_selector("div.calendar-day")
for a in day:
    print(a.text)

因为它已经有好几年的数据了，所以我试着将其扩展到一个特定的年份，2016年，现在我正在尝试获取每个日期的href链接

import pandas as pd
from selenium import webdriver
from selenium.webdriver.common.action_chains import ActionChains
from selenium.webdriver.support.ui import WebDriverWait

path = 'C:\Windows\chromedriver.exe'
driver = webdriver.Chrome(path)
driver.implicitly_wait(10)
driver.get('https://web.archive.org/web/*/https://cd.lianjia.com/ ')


element =driver.find_element_by_xpath('/html/body/div[4]/div[3]/div/div[2]/span[21]')
actions = ActionChains(driver)
actions.move_to_element(element).click().perform()

  day = driver.find_elements_by_css_selector("div.calendar-day")
for a in day:
    print(a.text)

但它只返回数天

然后我试着用这个代码找到链接

date = driver.find_elements_by_css_selector("a[href* = 'web']")
date = driver.find_elements_by_css_selector("a[href* = 'lianjia']")

但是它找不到链接，有人能帮我一下吗，我已经在这里停了五天了

你的方法是正确的。但需要一些调整。您将需要直接以元素为目标，并使用get attribute方法来提取HREF

days = driver.find_elements_by_css_selector("div.calendar-day > a")
for day in days:
    print(day.get_attribute('href'))

输出：

https://web.archive.org/web/20160103/https://cd.lianjia.com/
https://web.archive.org/web/20160105/https://cd.lianjia.com/
https://web.archive.org/web/20160106/https://cd.lianjia.com/
https://web.archive.org/web/20160107/https://cd.lianjia.com/
https://web.archive.org/web/20160127/https://cd.lianjia.com/
https://web.archive.org/web/20160306/https://cd.lianjia.com/
https://web.archive.org/web/20160314/https://cd.lianjia.com/
https://web.archive.org/web/20160325/https://cd.lianjia.com/
https://web.archive.org/web/20160326/https://cd.lianjia.com/
https://web.archive.org/web/20160328/https://cd.lianjia.com/
https://web.archive.org/web/20160407/https://cd.lianjia.com/
https://web.archive.org/web/20160408/https://cd.lianjia.com/
https://web.archive.org/web/20160421/https://cd.lianjia.com/
https://web.archive.org/web/20160427/https://cd.lianjia.com/
https://web.archive.org/web/20160501/https://cd.lianjia.com/
https://web.archive.org/web/20160509/https://cd.lianjia.com/
https://web.archive.org/web/20160525/https://cd.lianjia.com/
https://web.archive.org/web/20160615/https://cd.lianjia.com/
https://web.archive.org/web/20160619/https://cd.lianjia.com/
https://web.archive.org/web/20160621/https://cd.lianjia.com/
https://web.archive.org/web/20160704/https://cd.lianjia.com/
https://web.archive.org/web/20160717/https://cd.lianjia.com/
https://web.archive.org/web/20160721/https://cd.lianjia.com/
https://web.archive.org/web/20160927/https://cd.lianjia.com/
https://web.archive.org/web/20161013/https://cd.lianjia.com/
https://web.archive.org/web/20161029/https://cd.lianjia.com/
https://web.archive.org/web/20161115/https://cd.lianjia.com/
https://web.archive.org/web/20161119/https://cd.lianjia.com/
https://web.archive.org/web/20161120/https://cd.lianjia.com/
https://web.archive.org/web/20161126/https://cd.lianjia.com/
https://web.archive.org/web/20161202/https://cd.lianjia.com/
https://web.archive.org/web/20161204/https://cd.lianjia.com/

哦，非常漂亮非常好的男人，非常感谢，我在这里迷路了好几天