テーブルから要素を抽出する際の問題
Dec 02 2020
こんにちは私は私の問題に対処する方法についていくつかのアドバイスが必要です。つまり、指定されたテーブルから情報を廃棄し、それらの刺し傷を単一の要素としてリストに追加したいということです。
from bs4 import BeautifulSoup
from urllib.request import Request, urlopen
site = "http://www.voltwo.webd.pl/1-indexy/index-5-opracowania/01-maturalne-KINEMATYKA.html"
hdr = {'User-Agent': 'Mozilla/5.0'}
req = Request(site, headers=hdr)
page = urlopen(req)
soup = BeautifulSoup(page, features="html5lib")
table = soup.findAll('td')
data = [i.find('tr') for i in table if i.find('tr') and 'text']
print(data)
回答
baduker Dec 02 2020 at 23:14
pandas
これはあなたが扱っている表形式のデータなので、使ってみませんか?
例えば:
import pandas as pd
import requests
from bs4 import BeautifulSoup
url = "http://www.voltwo.webd.pl/1-indexy/index-5-opracowania/01-maturalne-KINEMATYKA.html"
soup = BeautifulSoup(requests.get(url).content, "html.parser").find("table")
df = pd.read_html(str(soup), skiprows=[0, 1, 2, 3, 4, 5])
df = pd.concat(df).drop([7, 8], axis="columns")
columns = ["Lp", "Rok", "Forma", "Poziom", "Typ zadania", "Strona", "Zadanie"]
df.to_csv("table.csv", index=False, header=columns, encoding="utf-8")
出力:
