Apache Tika 1.24 发布,内容抽取工具集合
时间:2020-03-21 13:41 来源:linux.it.net.cn 作者:IT
Apache Tika 1.24 发布了,Tika 是一个内容抽取的工具集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。
主要更新内容如下:
-
更新 Drew Noakes 的元数据提取器
-
启用 PDF 中的结构标签的可选提取(alpha 级)
-
Tika 应用程序的 --extract 模式现在输出到 STDOUT
-
为 PDF 添加可选的 Preflight 解析器
-
改进对某些基于 zip 格式的检测
-
将元数据提取器升级到 2.13.0
-
升级到 POI 4.1.2
-
从 PSD 文件中提取 XMP
-
在 PDF 中添加了 XMLProfiler 作为可选的解析器以配置 XFA 和 XMP
-
从 PDF 提取依赖于 DCT 过滤器的内联图像
-
升级到 PDFBox 2.0.19
-
修复了 ASM 解析器配置中的错误
-
升级到 Java-libpst 0.9.3
-
修复了 ToXMLHandler 的 XLIFF12Parser 故障
更新说明: https://downloads.apache.org/tika/CHANGES-1.24.txt
(责任编辑:IT)
Apache Tika 1.24 发布了,Tika 是一个内容抽取的工具集合 (a toolkit for text extracting) 。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。 主要更新内容如下:
更新说明: https://downloads.apache.org/tika/CHANGES-1.24.txt (责任编辑:IT) |