This is an automated email from the ASF dual-hosted git repository.

asf-gitbox-commits pushed a commit to branch branch_2x
in repository https://gitbox.apache.org/repos/asf/tika.git


The following commit(s) were added to refs/heads/branch_2x by this push:
     new 193f2c4aa3 TIKA-4811: Add null check (#2999)
193f2c4aa3 is described below

commit 193f2c4aa33307e5f602f16ee5418cfb39937bed
Author: L3odr0id <[email protected]>
AuthorDate: Mon Aug 10 15:26:57 2026 +0300

    TIKA-4811: Add null check (#2999)
---
 .../src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java    | 3 ++-
 1 file changed, 2 insertions(+), 1 deletion(-)

diff --git 
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
 
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
index 3b7d31380f..49c37d0d52 100644
--- 
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
+++ 
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
@@ -536,7 +536,8 @@ class AbstractPDF2XHTML extends PDFTextStripper {
             return;
         }
         MediaType ocrImageMediaType = MediaType.image("ocr-" + 
config.getOcrImageFormatName());
-        if (!ocrParser.getSupportedTypes(context).contains(ocrImageMediaType)) 
{
+        Set<MediaType> supportedTypes = ocrParser.getSupportedTypes(context);
+        if (supportedTypes == null || 
!supportedTypes.contains(ocrImageMediaType)) {
             if (ocrStrategy == OCR_ONLY || ocrStrategy == 
OCR_AND_TEXT_EXTRACTION) {
                 throw new TikaException(
                         "" + "I regret that I couldn't find an OCR parser to 
handle " +

Reply via email to