This is an automated email from the ASF dual-hosted git repository.
THausherr pushed a commit to branch main
in repository https://gitbox.apache.org/repos/asf/tika.git
The following commit(s) were added to refs/heads/main by this push:
new dc373bff18 TIKA-4811: Add null check (#2999)
dc373bff18 is described below
commit dc373bff1841d0356480c48cc2fa41e86b3b2863
Author: L3odr0id <[email protected]>
AuthorDate: Mon Aug 10 15:26:57 2026 +0300
TIKA-4811: Add null check (#2999)
---
.../src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java | 3 ++-
1 file changed, 2 insertions(+), 1 deletion(-)
diff --git
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
index ac6e3b6b9e..4bdc82526f 100644
---
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
+++
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
@@ -562,7 +562,8 @@ class AbstractPDF2XHTML extends PDFTextStripper {
return;
}
MediaType ocrImageMediaType = MediaType.image("ocr-" +
config.getOcr().getImageFormat().getFormatName());
- if (!ocrParser.getSupportedTypes(context).contains(ocrImageMediaType))
{
+ Set<MediaType> supportedTypes = ocrParser.getSupportedTypes(context);
+ if (supportedTypes == null ||
!supportedTypes.contains(ocrImageMediaType)) {
if (ocrStrategy == OCR_ONLY || ocrStrategy ==
OCR_AND_TEXT_EXTRACTION) {
throw new TikaException(
"" + "I regret that I couldn't find an OCR parser to
handle " +