检查xml是否是Java中pdf文档的一部分的最佳方法

Simon 发表于 Dev

西蒙

我想检查一个 pdf 文件是否包含一个长字符串，它是一个完整的 XML 文档的字符串。

我可以打开这两个文件并提取文本。我已经用以下代码做到了：

File temp = File.createTempFile("temp-pdf", ".tmp");
OutputStream out = new FileOutputStream(temp);
out.write(Base64.decodeBase64(testObject.getPdfAsDoc().getContent()));
out.close();
PDDocument document = PDDocument.load(temp);
PDFTextStripper pdfStripper = new PDFTextStripper();
String pdfText = pdfStripper.getText(document);
Integer posS =pdfText.indexOf("<?xml version");
Integer posE = pdfText.lastIndexOf("</ServiceSpecificationSchema:serviceSpecification>")+"</ServiceSpecificationSchema:serviceSpecification>".length();
pdfText =pdfText.substring( posS,posE );
String xmlText = testObject.getXmlAsDoc().getContent();

现在我遇到了问题，即两个文档的行不匹配，这是导致 pdf 文件中出现换行符等格式的原因。

XML 文件的 TXT 输出示例行：

<?xml version="1.0" encoding="UTF-8"?><ServiceSpecificationSchema:serviceSpecification xmlns:xs="  ..... >

PDF 文件的 TXT 输出示例行：

<?xml version="1.0" encoding="UTF-8"?><ServiceSpecificationSchema:serviceSpecification
xmlns:xs="  ..... >

其次，我在 PDF 的 XML 标签之间有页码。你知道删除这条线的好方法吗？

</operations>
Page 51 of 52
</consumerInterface>

检查 pdf 是否包含 XML 的最佳方法是什么？

我已经尝试从文件中删除所有换行符和空格并进行比较。但是如果我这样做，我就找不到区别的线。最后不一定是有效的 XML 文件。

西蒙

如果其他人需要，只想发布我的解决方案。

我的代码有点大，把它贴在这里。

基本上，我从 pdf 中提取文本并从中删除第 x 页和标题等字符串。之后，我删除了上面指出的所有空格。最后，我逐个字符地比较提取的字符串，以通知我的用户他们在文本中做错了什么。这种方法效果很好，即使作者不关心格式，只是复制和粘贴整个 xml 文档。

本文收集自互联网，转载请注明来源。

如有侵权，请联系 [email protected] 删除。

编辑于 2021-06-16

我来说两句

0 条评论

登录后参与评论

上一篇：从图像的右中心使用 jquery 的图像幻灯片

检查xml是否是Java中pdf文档的一部分的最佳方法

检查xml是否是Java中pdf文档的一部分的最佳方法

Linux的官方Adobe Flash存储库是否已过时？

如何使用HttpClient的在使用SSL证书，无论多么“糟糕”是

错误：“ javac”未被识别为内部或外部命令，

在 Python 2.7 中。如何从文件中读取特定文本并分配给变量

Modbus Python施耐德PM5300

为什么Object.hashCode（）不遵循Java代码约定

如何检查字符串输入的格式

检查嵌套列表中的长度是否相同

错误TS2365：运算符'！=='无法应用于类型'“（”'和'“）”'

如何自动选择正确的键盘布局？-仅具有一个键盘布局

如何正确比较 scala.xml 节点？

在令牌内联程序集错误之前预期为 ')'

如何在JavaScript中获取数组的第n个元素？

如何将sklearn.naive_bayes与（多个）分类功能一起使用？

ValueError：尝试同时迭代两个列表时，解包的值太多（预期为 2）

如何监视应用程序而不是单个进程的CPU使用率？

解决类Koin的实例时出错

ES5的代理替代

有什么解决方案可以将android设备用作Cast Receiver？

VBA 自动化错误：-2147221080 (800401a8)

套接字无法检测到断开连接