hermes-erkenntnisse/nachtplan/2026-07-23-Lipsync-MuseTalk-Pipeline.md

16 lines
1.3 KiB
Markdown

# #17 Lipsync — volle Pipeline steht (2026-07-23)
## BEWIESEN: Identitaet + Fotoreal + Ganzkoerper + Ton + Lippensync end-to-end
- MuseTalk FUNKTIONIERT (Skill-Warnung "broken/no mmpose" STALE: mmpose 1.3.2 + Modelle da).
- Kein Haenger, nur LANGSAM (~2,5s/Frame CPU-dwpose, GPU 0% taeuscht) + CACHE-FALLE: MuseTalkRun cached auf video_path-STRING nicht Datei-Inhalt -> eindeutiger Input-Dateiname pro Run erzwingt frischen Render.
- Beweis: christina_talk_musetalk_00003-audio.mp4 (selbst gate-geprueft): chrfischer-LoRA-Christina (Brille+Sommersprossen, Face-Match zu christina_approved.png) + FOTOREAL + Ganzkoerper + solo + Bewegung + Mund auf/zu synchron + deutsche aac-Tonspur.
- TTS lokal XTTS-v2 Deutsch akzentfrei. Lipsync = ComfyUI-MuseTalk via pipe_03_lipsync.py.
## Feinschliff
- A/V-Timing: RIFE-32fps-Clip kollidiert mit MuseTalk-16fps-Annahme (Halbtempo) -> MuseTalk-Input muss RAW 16fps sein (49f/3,06s).
- Ganzkoerper-Gesicht klein -> Lippensync subtil; Face-Region-Upscale als Folgeoption.
## Rezept (kombiniert, current canonical)
Bild: CyberRealisticPony_V14 + chrfischer_v1-LoRA @0.9 + "chrfischer woman, round black glasses, blue eyes, freckles" + Fotoreal + Anti-Cartoon-Negative, 768x1344.
Video: Wan2.2 Fastpath 512x896 4-step. TTS: xtts_de_gen.py. Lipsync: pipe_03_lipsync.py (RAW 16fps, eindeutiger Name).