Python - Word-Dokument verarbeiten
Um ein Word-Dokument zu lesen, verwenden wir das Modul docx. Wir installieren zuerst docx wie unten gezeigt. Schreiben Sie dann ein Programm, um mithilfe der verschiedenen Funktionen im docx-Modul die gesamte Datei nach Absätzen zu lesen.
Wir verwenden den folgenden Befehl, um das docx-Modul in unsere Umgebung zu bringen.
pip install docx
Im folgenden Beispiel lesen wir den Inhalt eines Word-Dokuments, indem wir jede Zeile an einen Absatz anhängen und schließlich den gesamten Absatztext ausdrucken.
import docx
def readtxt(filename):
doc = docx.Document(filename)
fullText = []
for para in doc.paragraphs:
fullText.append(para.text)
return '\n'.join(fullText)
print (readtxt('path\Tutorialspoint.docx'))
Wenn wir das obige Programm ausführen, erhalten wir die folgende Ausgabe:
Tutorials Point originated from the idea that there exists a class of readers who respond
better to online content and prefer to learn new skills at their own pace from the comforts
of their drawing rooms.
The journey commenced with a single tutorial on HTML in 2006 and elated by the response it generated,
we worked our way to adding fresh tutorials to our repository which now proudly flaunts
a wealth of tutorials and allied articles on topics ranging from programming languages
to web designing to academics and much more.
Einzelne Absätze lesen
Mit dem Absatzattribut können wir einen bestimmten Absatz aus dem Word-Dokument lesen. Im folgenden Beispiel lesen wir nur den zweiten Absatz aus dem Word-Dokument.
import docx
doc = docx.Document('path\Tutorialspoint.docx')
print len(doc.paragraphs)
print doc.paragraphs[2].text
Wenn wir das obige Programm ausführen, erhalten wir die folgende Ausgabe:
The journey commenced with a single tutorial on HTML in 2006 and elated by the response
it generated, we worked our way to adding fresh tutorials to our repository
which now proudly flaunts a wealth of tutorials and allied articles on topics
ranging from programming languages to web designing to academics and much more.