Apache POI Word - Textextraktion

In diesem Kapitel wird erläutert, wie Sie mit Java einfache Textdaten aus einem Word-Dokument extrahieren. Wenn Sie Metadaten aus einem Word-Dokument extrahieren möchten, verwenden Sie Apache Tika.

Für DOCX-Dateien verwenden wir die Klasse org.apache.poi.xwpf.extractor.XPFFWordExtractor, die einfache Daten aus einer Word-Datei extrahiert und zurückgibt. Auf die gleiche Weise haben wir verschiedene Methoden, um Überschriften, Fußnoten, Tabellendaten usw. aus einer Word-Datei zu extrahieren.

Der folgende Code zeigt, wie Sie einfachen Text aus einer Word-Datei extrahieren.

import java.io.FileInputStream;
import org.apache.poi.xwpf.extractor.XWPFWordExtractor;
import org.apache.poi.xwpf.usermodel.XWPFDocument;

public class WordExtractor {

   public static void main(String[] args)throws Exception {

      XWPFDocument docx = new XWPFDocument(new FileInputStream("create_paragraph.docx"));
      
      //using XWPFWordExtractor Class
      XWPFWordExtractor we = new XWPFWordExtractor(docx);
      System.out.println(we.getText());
   }
}

Speichern Sie den obigen Code als WordExtractor.java. Kompilieren Sie es und führen Sie es an der Eingabeaufforderung wie folgt aus:

$javac WordExtractor.java
$java WordExtractor

Es wird die folgende Ausgabe generiert:

At tutorialspoint.com, we strive hard to provide quality tutorials for self-learning
purpose in the domains of Academics, Information Technology, Management and Computer
Programming Languages.