CT Transliteration Tools & Software 3 — Questions and Answers
Question 1: Which open-source Python library is widely used for transliterating text from various scripts into Latin characters using pre-built language-specific modules?
- NLTK
- transliterate (Correct answer)
- polyglot
- langdetect
Correct answer: transliterate
The Python `transliterate` library provides ready-made transliteration rules for multiple scripts and is frequently used for quick Latin-script conversion tasks.
Question 2: In SDL Trados Studio, transliteration memory entries are most effectively managed using which component?
- AutoSuggest dictionaries
- Translation Memory (TM) with language pair settings
- Termbase with transliteration metadata fields (Correct answer)
- Machine translation plugin
Correct answer: Termbase with transliteration metadata fields
A Termbase with dedicated metadata fields for transliteration variants allows structured storage and retrieval of standardized proper noun transliterations within Trados.
Question 3: When a transliteration tool outputs 'Moskva' for the Russian 'Москва', which international standard is it most likely following?
- ALA-LC Romanization
- BGN/PCGN Romanization (Correct answer)
- ISO 9 Romanization
- UNGEGN Romanization
Correct answer: BGN/PCGN Romanization
The BGN/PCGN system renders Russian 'Москва' as 'Moskva,' making it the standard most consistent with that output for geographic names used by US and UK governments.
Question 4: A transliterator working with Japanese text needs to convert kanji to romaji. Which software tool was specifically designed for Japanese romanization and is commonly used in NLP pipelines?
- MeCab with UniDic dictionary
- Kakasi (Correct answer)
- Kuromoji
- ChaSen
Correct answer: Kakasi
Kakasi is a dedicated Japanese-to-romaji converter that maps kanji and kana to Latin-script equivalents, making it a standard choice for romanization tasks.
Question 5: Which file format is most commonly used to store and exchange transliteration rule sets in ICU-based systems?
- .xlf (XLIFF)
- .txt with ICU rule syntax (Correct answer)
- .tmx (Translation Memory Exchange)
- .tbx (TermBase eXchange)
Correct answer: .txt with ICU rule syntax
ICU transliteration rules are written in plain text files using ICU's own rule syntax, which defines character mappings and contextual transformations.
Question 6: A quality assurance check flags a transliteration where 'ñ' was rendered as 'n' instead of 'ny' or 'ñ'. Which software setting most likely caused this error?
- Incorrect source language detection
- ASCII-only output mode enabled (Correct answer)
- Bidirectional text handling error
- Unicode normalization set to NFD
Correct answer: ASCII-only output mode enabled
ASCII-only output mode strips diacritics and maps 'ñ' to the closest ASCII character 'n,' losing the phonemic distinction the tilde represents.
Question 7: Which technology enables real-time transliteration suggestions on mobile keyboards, such as typing in Roman characters that convert to Devanagari as the user types?
- Optical character recognition (OCR)
- Phonetic input method editor (IME) (Correct answer)
- Neural machine translation (NMT)
- Text-to-speech synthesis (TTS)
Correct answer: Phonetic input method editor (IME)
Phonetic IMEs intercept Roman keystrokes and map them to native script characters in real time, enabling transliteration-based input for scripts like Devanagari.
Which open-source Python library is widely used for transliterating text from various scripts into Latin characters using pre-built language-specific modules?