Checkpoint current transcription pipeline state

This commit is contained in:
Adolfo Reyna
2026-03-16 21:11:51 -04:00
parent 50f58dbc22
commit ffeb996d7e
5 changed files with 68 additions and 31 deletions
+7 -3
View File
@@ -610,6 +610,7 @@ def main():
parser.add_argument("--mt-max-chars", type=int, default=250, help="Max chars per translation chunk before sentence-aware splitting (default: 250)")
parser.add_argument("--mt-max-new-tokens", type=int, default=150, help="Max new tokens per translation chunk (default: 150)")
parser.add_argument("--mt-num-beams", type=int, default=4, help="Beam size for Marian translation generation (default: 4)")
parser.add_argument("--only-translate-llm", action="store_true", help="Only translate into target languages when a refined LLM paragraph is available.")
parser.add_argument("--mt-no-repeat-ngram-size", type=int, default=3, help="No-repeat n-gram size for Marian generation (default: 3)")
parser.add_argument("--mt-length-penalty", type=float, default=1.0, help="Length penalty for Marian generation (default: 1.0)")
parser.add_argument("--mt-repetition-penalty", type=float, default=1.05, help="Repetition penalty for Marian generation (default: 1.05)")
@@ -648,6 +649,10 @@ def main():
args.post_correct = True
print("[SYSTEM]: Enabling --post-correct because --post-correct-llm was requested.")
log_session("[SYSTEM]: Enabling --post-correct because --post-correct-llm was requested.")
if args.only_translate_llm and not args.llm_paragraph:
args.llm_paragraph = True
print("[SYSTEM]: Enabling --llm-paragraph because --only-translate-llm was requested.")
log_session("[SYSTEM]: Enabling --llm-paragraph because --only-translate-llm was requested.")
file_glossary_pairs = load_glossary_file(args.glossary_file)
merged_glossary_pairs = file_glossary_pairs + args.glossary_pair
if file_glossary_pairs:
@@ -1064,9 +1069,8 @@ def main():
rolling_context = (rolling_context + " " + original_text)[-200:].strip()
# 3. Translate from English to other languages
if not args.llm_paragraph and english_for_translation and translation_engines:
english_chunks = split_text_for_translation(english_for_translation, max_chars=args.mt_max_chars)
if not args.llm_paragraph and not args.only_translate_llm and english_for_translation and translation_engines:
english_chunks = split_text_for_translation(english_for_translation, max_chars=args.mt_max_chars)
for lang_key, (model, tokenizer) in translation_engines.items():
# Skip if we already filled this (e.g. detected lang was 'es')
if lang_key in payload: