Python - Memproses Dokumen Word

Untuk membaca dokumen kata kami mengambil bantuan dari modul bernama docx. Kami pertama kali menginstal docx seperti yang ditunjukkan di bawah ini. Kemudian tulis program untuk menggunakan berbagai fungsi dalam modul docx untuk membaca seluruh file berdasarkan paragraf.

Kami menggunakan perintah di bawah ini untuk memasukkan modul docx ke lingkungan kami.

pip install docx

Dalam contoh di bawah ini kami membaca konten dokumen kata dengan menambahkan setiap baris ke paragraf dan akhirnya mencetak semua teks paragraf.

import docx
def readtxt(filename):
    doc = docx.Document(filename)
    fullText = []
    for para in doc.paragraphs:
        fullText.append(para.text)
    return '\n'.join(fullText)
print (readtxt('path\Tutorialspoint.docx'))

Ketika kami menjalankan program di atas, kami mendapatkan output berikut -

Tutorials Point originated from the idea that there exists a class of readers who respond 
better to online content and prefer to learn new skills at their own pace from the comforts 
of their drawing rooms. 
The journey commenced with a single tutorial on HTML in 2006 and elated by the response it generated, 
we worked our way to adding fresh tutorials to our repository which now proudly flaunts 
a wealth of tutorials and allied articles on topics ranging from programming languages 
to web designing to academics and much more.

Membaca Paragraf Individual

Kita dapat membaca paragraf tertentu dari dokumen kata menggunakan atribut paragraf. Dalam contoh di bawah ini kita hanya membaca paragraf kedua dari dokumen kata.

import docx
doc = docx.Document('path\Tutorialspoint.docx')
print len(doc.paragraphs)
print doc.paragraphs[2].text

Ketika kami menjalankan program di atas, kami mendapatkan output berikut -

The journey commenced with a single tutorial on HTML in 2006 and elated by the response 
it generated, we worked our way to adding fresh tutorials to our repository 
which now proudly flaunts a wealth of tutorials and allied articles on topics 
ranging from programming languages to web designing to academics and much more.