解析表格数据，Python与Tika对比-Python学习网

解析表格数据，Python与Tika对比

Python与Tika对比解析表格

2020-10-28 17:15:474117浏览 · 0收藏 · 0评论

为了证明Python确实在解析表格数据上优于其他的选择，今天我们为大家进行实例对比，具体如下：

PDF文件表格样例

Python解析结果

其他样式解析，如Tika

1、TEXT格式

  Tika tika = new Tika();
        tika.setMaxStringLength(100 * 1024 * 1024);
        try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {
            return tika.parseToString(stream);
        }

Text格式解析结果

2、XHTML格式

       ContentHandler handler = new ToXMLContentHandler();
        AutoDetectParser parser = new AutoDetectParser();
        Metadata metadata = new Metadata();
        try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {
            parser.parse(stream, handler, metadata);
            return handler.toString();
        }

XHTML格式解析结果