diff --git a/config.json b/config.json index d5f10a6..f2addcf 100644 --- a/config.json +++ b/config.json @@ -17,7 +17,7 @@ "speaker_diarization": false, "post_correct": false, "post_correct_llm": false, - "post_correct_model": "qwen:2b", + "post_correct_model": "qwen3.5:0.8b", "post_correct_ollama_url": "http://127.0.0.1:11434/api/generate", "post_correct_llm_timeout": 8.0, "post_correct_keep_alive": "30m", diff --git a/engine_distribute.py b/engine_distribute.py index b55fa93..c3b3015 100644 --- a/engine_distribute.py +++ b/engine_distribute.py @@ -57,12 +57,25 @@ def run_distribution(in_queue, args): print(msg, flush=True) log_debug(msg) - # Show LLM Refinement if available - refined = payload.get('paragraph') or payload.get('corrected') - if refined and refined.strip() != payload.get('original', '').strip(): - llm_msg = f"[LLM]: {speaker_prefix}{refined}" - print(llm_msg, flush=True) - log_debug(llm_msg) + bridge_text = payload.get("en_bridge") + original_text = payload.get("original", "") + corrected_text = payload.get("corrected") + paragraph_text = payload.get("paragraph") + + if bridge_text and bridge_text.strip() != original_text.strip(): + bridge_msg = f"[EN-BRIDGE]: {speaker_prefix}{bridge_text}" + print(bridge_msg, flush=True) + log_debug(bridge_msg) + + if payload.get("used_llm_line") and corrected_text and corrected_text.strip() != bridge_text.strip(): + llm_line_msg = f"[LLM-LINE]: {speaker_prefix}{corrected_text}" + print(llm_line_msg, flush=True) + log_debug(llm_line_msg) + + if payload.get("used_llm_paragraph") and paragraph_text: + llm_paragraph_msg = f"[LLM-PARAGRAPH]: {speaker_prefix}{paragraph_text}" + print(llm_paragraph_msg, flush=True) + log_debug(llm_paragraph_msg) for lang in ["es", "fr", "ar", "en"]: if payload.get(lang): diff --git a/engine_llm.py b/engine_llm.py index 0e29f77..728fe42 100644 --- a/engine_llm.py +++ b/engine_llm.py @@ -210,6 +210,9 @@ def run_llm_processor(in_queue, out_queue, args): "raw": raw_text, "corrected": corrected_text, "paragraph": structured_paragraph, + "en_bridge": bridge_text, + "used_llm_line": bool(getattr(args, "post_correct_llm", False)), + "used_llm_paragraph": bool(args.llm_paragraph and structured_paragraph), "detected_lang": item.get("detected_lang"), "speaker": item.get("speaker"), "ts": item.get("ts", time.time()) diff --git a/engine_translate.py b/engine_translate.py index 04ca4eb..f51e6f0 100644 --- a/engine_translate.py +++ b/engine_translate.py @@ -74,6 +74,9 @@ def run_translation(in_queue, out_queue, args): "original": raw_text, "corrected": corrected_text, "paragraph": paragraph_text, + "en_bridge": item.get("en_bridge"), + "used_llm_line": item.get("used_llm_line", False), + "used_llm_paragraph": item.get("used_llm_paragraph", False), "speaker": item.get("speaker"), "ts": item.get("ts", time.time()) } diff --git a/main_v2.py b/main_v2.py index 20a1c78..0eaa38f 100644 --- a/main_v2.py +++ b/main_v2.py @@ -49,7 +49,7 @@ def main(): # LLM Args parser.add_argument("--post-correct", action="store_true", default=defaults.get("post_correct", False)) parser.add_argument("--post-correct-llm", action="store_true", default=defaults.get("post_correct_llm", False)) - parser.add_argument("--post-correct-model", type=str, default=defaults.get("post_correct_model", "qwen:2b")) + parser.add_argument("--post-correct-model", type=str, default=defaults.get("post_correct_model", "qwen3.5:0.8b")) parser.add_argument("--post-correct-ollama-url", type=str, default=defaults.get("post_correct_ollama_url", "http://127.0.0.1:11434/api/generate")) parser.add_argument("--post-correct-llm-timeout", type=float, default=defaults.get("post_correct_llm_timeout", 8.0)) parser.add_argument("--post-correct-keep-alive", type=str, default=defaults.get("post_correct_keep_alive", "30m"))