Checkpoint current transcription pipeline state
This commit is contained in:
+7
-3
@@ -610,6 +610,7 @@ def main():
|
||||
parser.add_argument("--mt-max-chars", type=int, default=250, help="Max chars per translation chunk before sentence-aware splitting (default: 250)")
|
||||
parser.add_argument("--mt-max-new-tokens", type=int, default=150, help="Max new tokens per translation chunk (default: 150)")
|
||||
parser.add_argument("--mt-num-beams", type=int, default=4, help="Beam size for Marian translation generation (default: 4)")
|
||||
parser.add_argument("--only-translate-llm", action="store_true", help="Only translate into target languages when a refined LLM paragraph is available.")
|
||||
parser.add_argument("--mt-no-repeat-ngram-size", type=int, default=3, help="No-repeat n-gram size for Marian generation (default: 3)")
|
||||
parser.add_argument("--mt-length-penalty", type=float, default=1.0, help="Length penalty for Marian generation (default: 1.0)")
|
||||
parser.add_argument("--mt-repetition-penalty", type=float, default=1.05, help="Repetition penalty for Marian generation (default: 1.05)")
|
||||
@@ -648,6 +649,10 @@ def main():
|
||||
args.post_correct = True
|
||||
print("[SYSTEM]: Enabling --post-correct because --post-correct-llm was requested.")
|
||||
log_session("[SYSTEM]: Enabling --post-correct because --post-correct-llm was requested.")
|
||||
if args.only_translate_llm and not args.llm_paragraph:
|
||||
args.llm_paragraph = True
|
||||
print("[SYSTEM]: Enabling --llm-paragraph because --only-translate-llm was requested.")
|
||||
log_session("[SYSTEM]: Enabling --llm-paragraph because --only-translate-llm was requested.")
|
||||
file_glossary_pairs = load_glossary_file(args.glossary_file)
|
||||
merged_glossary_pairs = file_glossary_pairs + args.glossary_pair
|
||||
if file_glossary_pairs:
|
||||
@@ -1064,9 +1069,8 @@ def main():
|
||||
rolling_context = (rolling_context + " " + original_text)[-200:].strip()
|
||||
|
||||
# 3. Translate from English to other languages
|
||||
if not args.llm_paragraph and english_for_translation and translation_engines:
|
||||
english_chunks = split_text_for_translation(english_for_translation, max_chars=args.mt_max_chars)
|
||||
|
||||
if not args.llm_paragraph and not args.only_translate_llm and english_for_translation and translation_engines:
|
||||
english_chunks = split_text_for_translation(english_for_translation, max_chars=args.mt_max_chars)
|
||||
for lang_key, (model, tokenizer) in translation_engines.items():
|
||||
# Skip if we already filled this (e.g. detected lang was 'es')
|
||||
if lang_key in payload:
|
||||
|
||||
Reference in New Issue
Block a user