Python - Xử lý PDF

Python có thể đọc các tệp PDF và in ra nội dung sau khi trích xuất văn bản từ nó. Để làm được điều đó, trước tiên chúng ta phải cài đặt mô-đun bắt buộcPyPDF2. Dưới đây là lệnh cài đặt mô-đun. Bạn nên cài đặt pip trong môi trường python của mình.

pip install pypdf2

Khi cài đặt thành công mô-đun này, chúng tôi có thể đọc tệp PDF bằng các phương pháp có sẵn trong mô-đun.

import PyPDF2
pdfName = 'path\Tutorialspoint.pdf'
read_pdf = PyPDF2.PdfFileReader(pdfName)
page = read_pdf.getPage(0)
page_content = page.extractText()
print page_content

Khi chúng tôi chạy chương trình trên, chúng tôi nhận được kết quả sau:

Tutorials Point originated from the idea that there exists a class of readers who respond better 
to online content and prefer to learn new skills at their own pace from the comforts of their 
drawing rooms.
 
The journey commenced with a single tutorial on HTML in 2006 and elated by the response 
it generated, we worked our way to adding fresh tutorials to our repository which now 
proudly flaunts a wealth of tutorials and allied articles on topics ranging from programming
languages to web designing to academics and much more.

Đọc nhiều trang

Để đọc một pdf với nhiều trang và in mỗi trang với số trang, chúng ta sử dụng vòng lặp với hàm getPageNumber (). Trong ví dụ dưới đây, chúng tôi là tệp PDF có hai trang. Nội dung được in dưới hai tiêu đề trang riêng biệt.

import PyPDF2
pdfName = 'Path\Tutorialspoint2.pdf'
read_pdf = PyPDF2.PdfFileReader(pdfName)
for i in xrange(read_pdf.getNumPages()):
    page = read_pdf.getPage(i)
    print 'Page No - ' + str(1+read_pdf.getPageNumber(page))
    page_content = page.extractText()
    print page_content

Khi chúng tôi chạy chương trình trên, chúng tôi nhận được kết quả sau:

Page No - 1
Tutorials Point originated from the idea that there exists a class of readers who respond better to 
online content and prefer to learn new skills at their own pace from the comforts of their drawing 
rooms. 
Page No - 2
 
The journey commenced with a single tutorial on HTML in 2006 and elated by the response it 
generated, we worked our way to adding fresh tutorials to our repository which now proudly flaunts 
a wealth of tutorials and allied articles on topics ranging from p
rogramming languages to web 
designing to academics and much more.