NVIDIAs Audio2Face wird Open Source: KI-Gesichtsanimation für jedermann

  • Audio2Face wird mit der Apache 2.0-Lizenz und Zugriff auf das SDK, die Modelle und das Trainingsframework Open Source.
  • Direkte Integration über offizielle Plugins für Unreal Engine 5 und Autodesk Maya.
  • Lippensynchronisation und Emotionsmodelle (Audio2Emotion) für Echtzeit- und vorab aufgezeichnete Inhalte.
  • Weit verbreitete Akzeptanz in der Branche: Studios und Anbieter wie Codemasters, Reallusion und The Farm 51 verwenden es bereits.

Audio2Face Open Source

Die Fähigkeit, einen digitalen Charakter wie eine reale Person artikulieren zu lassen, bleibt ein Dorn im Auge vieler 3D-Spiele und Apps. Mit der Eröffnung von Audio2FaceNVIDIA bietet Entwicklern und Studios einen direkten Weg, um Sprach- und Gesichtsgesten sowohl in Echtzeit als auch in der Offline-Produktion zuverlässig zu synchronisieren.

Die Neuheit liegt nicht in der Synchronisation selbst, sondern im Zugriffsmodus: Das Tool wird Open Source (Apache 2.0), sodass jeder die Komponenten ohne Lizenzbarrieren evaluieren, integrieren und anpassen kann. Dies erleichtert großen und kleinen Teams die ausdrucksstärkere Avatare ohne langwierige manuelle Animationsprozesse.

Was ist Audio2Face und welche Änderungen ergeben sich, weil es Open Source ist?

KI-Gesichtsanimationstechnologie

Audio2Face verwendet Generative KI Sprachmerkmale – Phoneme, Intonation und sogar emotionale Nuancen – zu analysieren und in Gesichtsanimationsdaten umzuwandeln. Das System Lippen, Wangen und Augenbrauen synchronisieren präzise, ​​egal ob für Live-Streams oder vorgerenderte Szenen.

Beim Öffnen des Projekts mit Apache 2.0 Lizenzermöglicht das Unternehmen den freien Zugriff auf Code, Modelle und Werkzeuge, was das Experimentieren beschleunigt, technische Audits ermöglicht und Beiträge aus der akademischen und industriellen Gemeinschaft fördert. Mit anderen Worten: weniger Reibungsverluste beim Testen, Iterieren und Bereitstellen.

Das Ziel ist klar: Hochwertige Gesichtsanimationen für mehr Videospiele, 3D-Anwendungen und digitale Erlebnisse, wodurch Kosten und Produktionszeit reduziert werden, ohne dass ausdrucksstarke Details verloren gehen.

Alles, was NVIDIA veröffentlicht hat: SDK, Modelle und Schulungen

Audio2Face-Komponenten

Das Unternehmen hat die Audio2Face SDK mit Bibliotheken und Dokumentation zum Ausführen von Animationen auf dem Gerät oder in der Cloud. Es gibt auch Referenz-Plugins, die die Pipeline für in der Branche weit verbreitete Engines und Software vereinfachen.

Das Paket enthält Modelle von Regression (v2.2) und Erfahrung im Verbreitung (v3.0) orientiert an Lippensynchronisation, zusätzlich zu den Modellen Audio2Emotion (Produktion v2.2 und experimentell v3.0) in der Lage, emotionale Zustände aus Audio abzuleiten.

Für diejenigen, die es auf ihrem Feld einsetzen müssen, ist die Trainingsrahmen (v1.0) und Beispieldaten. Dadurch können die Modelle angepasst werden Sprachen, Akzente oder Interpretationsstile spezifisch und sogar auf verschiedene «Rigs» Gesichtsbehandlungen.

Abgerundet wird das Angebot durch offizielle Plugins für Autodesk Maya (v2.0) y Unreal Engine 5 (v2.5, kompatibel mit UE 5.5 und 5.6), entwickelt, um in professionelle Arbeitsabläufe integriert zu werden, ohne das Rad neu zu erfinden.

Integration mit UE5 und Maya, Leistung und Anforderungen

Integration in 3D-Engines

NVIDIAs Ansatz ist durch fertige Plugins und Beispiele für einen schnellen Einstieg in Unreal Engine 5 und Maya, mit Testszenen und Anleitungen, die vom ersten Tag an bei der Validierung der Ergebnisse helfen.

Die Ausführung kann in Echtzeit oder in Offline-Modus, je nach Projekt. Obwohl GPU-Beschleunigung empfohlen wird, können Entwickler verschiedene Konfigurationen in Betracht ziehen und dabei je nach Anwendungsfall Qualität, Latenz oder Kosten priorisieren.

Dank des Schulungsrahmens können technische Teams das System spezialisieren, um zusätzliche Sprachen und Sprachvarianten, was entscheidend ist, wenn Sie auf der Suche nach glaubwürdiger Lippensynchronisation auf mehreren Märkten sind.

Als Teil des KI-Ökosystems der Marke – mit Lösungen wie ACE, Edify und die RTX NIMs—, Audio2Face passt in moderne Pipelines, die Generierung, Interaktion und Animation kombinieren.

Einführung und Praxisbeispiele in der Branche

Studios, die Audio2Face bereits verwenden

Die Technologie ist bereits in kommerziellen Projekten und Tools von Drittanbietern vorhanden. Die Farm 51 Er verwendet es in Chernobylite 2: Exclusion Zone und Survios hat seine Gesichts-Pipeline in Alien: Rogue Incursion Evolved Edition optimiert, um immersivere Szenen zu erzielen.

Im Bereich der Kreativsoftware Reallusion Audio2Face in iClone und Character Creator integriert und mit AccuLip und Gesichts-Puppet-Teering-Funktionen für erweiterte Bearbeitung.

Darüber hinaus gibt es Studien und Anbieter wie Codemasters, NetEase, Perfect World Games, GSC Game World, Convai, Inworld AI, Streamlabs y UneeQ Digital Humans gehören zu denen, die diese Lösung übernehmen oder integrieren.

Sein Anwendungsbereich ist nicht auf das traditionelle Glücksspiel beschränkt: Es gibt Fälle in Medien, Unterhaltung und Kundenservice, wo ausdrucksstarke Avatare und Echtzeit-Interaktion Mehrwert und Unterstützung bieten.

Alternativen, Community und nächste Schritte

Entwickler-Community und Alternativen

Audio2Face ist nicht die einzige Option auf dem Markt. Im Unreal-Ökosystem OVR Lippensynchronisation und seine Integration mit MetaHuman Creator bieten gültige Pfade, obwohl sie nicht Open Source sind und in der Regel erfordern Manuelle Einstellungen für eine optimale Passform in jedem Projekt.

Der entscheidende Unterschied liegt in der Eröffnung: mit Code, Modelle und Schulungen verfügbarDas Angebot von NVIDIA erleichtert Beiträge, Prüfungen und Anpassungen sowie eine von der Community gesteuerte Roadmap.

Das Unternehmen ermutigt Entwickler, Studenten und Forscher zur Zusammenarbeit durch die Audio2Face Discord-Server, teilen Sie Fortschritte und schlagen Sie Verbesserungen für neue Anwendungsfälle vor.

Für Teams, die noch zögern, ist der Einstiegspunkt klar: Testen Sie die UE5- und Maya-Plugins, bewerten Sie Latenz und Qualität und trainieren Sie bei Bedarf mit Ihren eigenen Daten, um die Lippensynchronisation in den für die jeweilige Produktion erforderlichen Sprachen und Stilen zu perfektionieren.

Mit dem Wechsel zu Open Source passt diese Technologie besser in knappe Budgets und ermöglicht es mehr Studios, ihre Charaktere auf ein Niveau zu bringen, Ausdruckskraft und Synchronität was zuvor mehr Ressourcen erforderte. Ein pragmatischer Schritt, der die Einführung der KI-Lippensynchronisation in allen Arten interaktiver Erlebnisse beschleunigen könnte.

wie man mit KI einen Avatar erstellt
Verwandte Artikel:
So erstellen Sie einen Avatar mit KI: Vollständige Anleitung, Schritte und Tools

Als bevorzugte Quelle hinzufügen