CDT Document Capture & Input Technologies 1 — Questions and Answers
Question 1: What does OCR stand for in document management?
- Optical Character Recognition (Correct answer)
- Optical Content Repository
- Output Control Registry
- Organized Content Retrieval
Correct answer: Optical Character Recognition
OCR stands for Optical Character Recognition, the technology that converts scanned images of text into machine-readable text.
Question 2: Which scanning resolution (in DPI) is most commonly recommended for archival capture of standard text documents?
- 72 DPI
- 150 DPI
- 300 DPI (Correct answer)
- 600 DPI
Correct answer: 300 DPI
300 DPI is the industry standard for archival text document capture, providing sufficient quality for OCR and readability without excessive file sizes.
Question 3: What is Intelligent Character Recognition (ICR) primarily used for in document capture?
- Recognizing printed barcodes on documents
- Converting handwritten text into machine-readable data (Correct answer)
- Identifying digital watermarks in PDFs
- Detecting duplicate pages in a batch
Correct answer: Converting handwritten text into machine-readable data
ICR is specifically designed to recognize and convert handwritten characters into machine-readable text, extending beyond OCR's printed text capabilities.
Question 4: In document capture, what is a 'batch' typically defined as?
- A single document page scanned at high resolution
- A group of documents processed together as a unit (Correct answer)
- The OCR accuracy rate for a scanning session
- A compressed archive of scanned images
Correct answer: A group of documents processed together as a unit
A batch in document capture refers to a collection of documents grouped together and processed as a single unit through the capture workflow.
Question 5: What technology is used to automatically extract structured data fields from varied document layouts without manual data entry?
- PDF/A conversion
- Optical Mark Recognition (OMR)
- Intelligent Document Recognition (IDR) (Correct answer)
- Digital Rights Management (DRM)
Correct answer: Intelligent Document Recognition (IDR)
Intelligent Document Recognition (IDR) combines OCR, ICR, and AI techniques to automatically identify and extract structured data fields from various document types and layouts.
Question 6: Which file format is commonly produced from document scanners for lossless archival storage of black-and-white documents?
- JPEG
- PNG
- TIFF (Correct answer)
- BMP
Correct answer: TIFF
TIFF (Tagged Image File Format) is the industry-standard format for archival document scanning due to its support for lossless compression and wide compatibility with document management systems.
Question 7: What is the primary purpose of image preprocessing in document capture?
- Encrypting scanned documents for secure transmission
- Enhancing image quality to improve OCR accuracy (Correct answer)
- Compressing files for faster network transfer
- Converting color images to PDF/A format
Correct answer: Enhancing image quality to improve OCR accuracy
Image preprocessing applies enhancements such as deskewing, despeckling, and contrast adjustment to improve image quality and increase downstream OCR accuracy rates.
What does OCR stand for in document management?