[
https://issues.apache.org/jira/browse/TIKA-4883?page=com.atlassian.jira.plugin.system.issuetabpanels:comment-tabpanel&focusedCommentId=18113486#comment-18113486
]
Hudson commented on TIKA-4883:
------------------------------
SUCCESS: Integrated in Jenkins build Tika ยป tika-main-jdk17 #1624 (See
[https://ci-builds.apache.org/job/Tika/job/tika-main-jdk17/1624/])
TIKA-4883: AUTO OCR in PDFs must not discard extracted text unless OCR text
replaced it (#3145) (github:
[https://github.com/apache/tika/commit/bdc72dedd182c8457afefe782875cb4916fa8085])
* (edit)
tika-parsers/tika-parsers-ml/tika-vlm/src/main/java/org/apache/tika/parser/vlm/AbstractVLMParser.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-ocr-module/src/main/java/org/apache/tika/parser/ocr/TesseractOCRParser.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/PDF2XHTML.java
* (edit) docs/modules/ROOT/pages/configuration/index.adoc
* (add)
tika-core/src/main/java/org/apache/tika/parser/enricher/TextRecognizer.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/java/org/apache/tika/parser/pdf/PDFParserTest.java
* (edit)
tika-core/src/test/java/org/apache/tika/parser/enricher/ContentEnrichersTest.java
* (edit)
tika-parsers/tika-parsers-ml/tika-parser-tess4j-module/src/main/java/org/apache/tika/parser/ocr/tess4j/Tess4JParser.java
* (edit) CHANGES.txt
* (edit)
tika-core/src/main/java/org/apache/tika/parser/enricher/ContentEnrichers.java
> Don't dump raw text when OCR is triggered in AUTO mode in PDFs
> --------------------------------------------------------------
>
> Key: TIKA-4883
> URL: https://issues.apache.org/jira/browse/TIKA-4883
> Project: Tika
> Issue Type: Task
> Reporter: Tim Allison
> Priority: Minor
>
> In AUTO OCR mode in PDFs, if there's not enough content or if there are a lot
> of characters missing unicode mappings, we trigger OCR on that page.
> In the current implementation, we write that content to the page, and then
> make the determination. If OCR is triggered, we append the OCR content to the
> end of the page.
> It would be cleaner in AUTO mode, if we cached the page content, ran the
> score and then decided whether or not to run OCR WITHOUT including the
> original page content before making that determination.
> Or, in short, don't dump trash then concatenate OCR... go only with OCR in
> AUTO mode, when triggered.
--
This message was sent by Atlassian Jira
(v8.20.10#820010)