Beschreibung
DreamTalk ist eine offizielle Implementierung eines diffusionsbasierten Frameworks zur Generierung ausdrucksstarker, audio-gesteuerter sprechender Kopf-Videos. Dieses Werkzeug wurde entwickelt, um qualitativ hochwertige sprechende Kopf-Videos zu produzieren, die verschiedene Sprechstile und Emotionen genau wiedergeben. Seine Kernfähigkeit liegt in seiner robusten Leistung über eine breite Palette von Eingaben hinweg, einschließlich Standard-Sprache, Lieder, mehrsprachiger Audioinhalte und sogar verrauschter Audiosignale. Darüber hinaus zeigt DreamTalk Widerstandsfähigkeit bei der Verarbeitung von Porträts außerhalb der Domäne, was es zu einer vielseitigen Lösung für verschiedene Anwendungen macht.
Das Framework nutzt diffusionsbasierte probabilistische Modelle, um seine ausdrucksstarke und realistische Videoerzeugung zu erreichen. Benutzer können das Projekt mit conda und pip installieren, wobei spezifische Versionsanforderungen für PyTorch, torchvision, torchaudio und andere Abhängigkeiten eingehalten werden müssen. Der Installationsprozess umfasst die Erstellung einer dedizierten conda-Umgebung und die anschließende Installation der erforderlichen Pakete aus einer Requirements-Datei.
Für Benutzer, die an den vortrainierten Checkpoints interessiert sind, wurde der öffentliche Download aufgrund von Überlegungen zum sozialen Einfluss eingestellt. Interessierte Parteien müssen Checkpoints per E-Mail anfordern und ausdrücklich zustimmen, diese ausschließlich für akademische Forschungszwecke zu verwenden. Nach Erhalt sollten die Checkpoints im dafür vorgesehenen Ordner 'checkpoints' platziert werden.
Die Inferenz mit DreamTalk beinhaltet die Ausführung eines Python-Skripts mit mehreren Schlüsselparametern. Dazu gehören Pfade zur Eingabe-Audiodatei (unterstützt verschiedene Formate wie wav, mp3, m4a und mp4), ein Referenzstil-Clip, eine Kopfhaltungssequenz und das Eingabe-Porträtbild. Zusätzliche Parameter wie 'cfg_scale' steuern die Intensität der Sprechstile, während 'max_gen_len' die maximale Dauer der Videoerzeugung festlegt. Das Ausgabevideo wird im Ordner 'output_video' gespeichert, mit Zwischenergebnissen in einem temporären Ordner.
DreamTalk bietet auch Ad-hoc-Lösungen zur Verbesserung der Videoauflösung. Es werden zwei Methoden vorgeschlagen: CodeFormer für eine Auflösung von bis zu 1024x1024, obwohl dies langsamer ist und Probleme mit zeitlicher Inkonsistenz aufweisen kann, und das Temporal Super-Resolution Model von MetaPortrait für eine Auflösung von 512x512 mit schnellerer Leistung und zeitlicher Kohärenz, obwohl es die Intensität der Gesichtsausdrücke reduzieren kann. Das Projekt würdigt und baut auf früheren Arbeiten in diesem Bereich auf, zitiert relevante Forschung und stellt einen Zitationseintrag für akademische Zwecke zur Verfügung.
DreamTalk's Kernfunktionen
Diffusionsbasierte audio-gesteuerte Generierung von sprechenden Köpfen
Hochwertige Videoausgabe mit vielfältigen Sprechstilen
Robuste Leistung mit verschiedenen Audioeingaben (Sprache, Lieder, verrauschtes Audio)
Verarbeitet Porträts außerhalb der Domäne
Unterstützt mehrere Sprachen
Bietet offizielle Implementierungscode
Enthält Inferenz-Skript für die Videoerzeugung
Bietet Ad-hoc-Lösungen zur Auflösungsverbesserung (CodeFormer, MetaPortrait)
Einstellbare Parameter für Stilintensität und Generierungsdauer
Unterstützt CPU-Inferenz
Erste Schritte mit DreamTalk
Klonen: Klonen Sie das DreamTalk-Repository von GitHub.
Abhängigkeiten installieren: Erstellen Sie eine conda-Umgebung und installieren Sie die erforderlichen Pakete mit der bereitgestellten requirements.txt.
Checkpoints herunterladen: Fordern Sie Checkpoints per E-Mail für akademische Forschungszwecke an und legen Sie sie im Ordner 'checkpoints' ab.
Eingaben vorbereiten: Sammeln Sie Eingabe-Audio, Referenzstil-Clips, Kopfhaltungssequenzen und Porträtbilder.
Inferenz konfigurieren: Geben Sie die Eingabepfade und Parameter wie cfg_scale und max_gen_len im Inferenz-Skript an.
Inferenz ausführen: Führen Sie das Inferenz-Skript aus (z. B. python inference_for_demo_video.py), um sprechende Kopf-Videos zu generieren.
Auflösung verbessern (Optional): Verwenden Sie CodeFormer oder MetaPortrait für eine verbesserte Videoauflösung.
Für Forschung nutzen: Verwenden Sie die generierten Videos für akademische Forschungszwecke.
DreamTalk's Anwendungsfälle
- Generierung ausdrucksstarker sprechender Köpfe
- Audio-Visuelle Synthese
- Forschung in KI-Animation
- Mehrsprachige sprechende Köpfe
- Stilübertragung für Gesichter
- Verarbeitung von verrauschtem Audio






