This is an automated email from the ASF dual-hosted git repository.
asf-gitbox-commits pushed a commit to branch branch_3x
in repository https://gitbox.apache.org/repos/asf/tika.git
The following commit(s) were added to refs/heads/branch_3x by this push:
new d6aa80340c TIKA-4811: Add null check (#2999)
d6aa80340c is described below
commit d6aa80340c13f8d42dafd33468644660bf79ef66
Author: L3odr0id <[email protected]>
AuthorDate: Mon Aug 10 15:26:57 2026 +0300
TIKA-4811: Add null check (#2999)
---
.../src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java | 3 ++-
1 file changed, 2 insertions(+), 1 deletion(-)
diff --git
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
index 12c7e58a90..6037756e84 100644
---
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
+++
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
@@ -540,7 +540,8 @@ class AbstractPDF2XHTML extends PDFTextStripper {
c.increment();
}
MediaType ocrImageMediaType = MediaType.image("ocr-" +
config.getOcrImageFormatName());
- if (!ocrParser.getSupportedTypes(context).contains(ocrImageMediaType))
{
+ Set<MediaType> supportedTypes = ocrParser.getSupportedTypes(context);
+ if (supportedTypes == null ||
!supportedTypes.contains(ocrImageMediaType)) {
if (ocrStrategy == OCR_ONLY || ocrStrategy ==
OCR_AND_TEXT_EXTRACTION) {
throw new TikaException(
"" + "I regret that I couldn't find an OCR parser to
handle " +