Nvidia ha liberado como open source los modelos y el SDK de Audio2Face, una tecnología de IA generativa diseñada para crear avatares digitales realistas con animaciones faciales de última generación. Con esta decisión, cada desarrollador de videojuegos y aplicaciones 3D podrá crear y desplegar personajes de alta fidelidad con sincronización labial y expresiones emocionales naturales.
Un marco abierto para desarrolladores
Además del SDK, Nvidia pondrá a disposición el Audio2Face Training Framework, lo que permitirá a cualquier persona ajustar y personalizar modelos preexistentes según sus necesidades. Esto abre la puerta a experiencias más inmersivas y personalizadas en entretenimiento, atención al cliente y simulaciones interactivas.
Animación facial en tiempo real
Audio2Face acelera la creación de personajes digitales realistas mediante animación facial y lip-sync en tiempo real. A partir de una entrada de audio, la tecnología analiza características como fonemas y entonación para generar un flujo de datos de animación asignado a expresiones faciales del personaje. Estos datos pueden:
- Renderizarse en modo offline para contenido pregrabado.
- Transmitirse en tiempo real para personajes interactivos.
El resultado son avatares con sincronización labial precisa y expresiones emocionales naturales que aportan realismo a videojuegos, medios y plataformas de atención al cliente.
Adopción en la industria
Numerosos estudios y empresas ya integran Audio2Face en sus flujos de trabajo. Entre los desarrolladores destacan Codemasters, GSC Games World, NetEase y Perfect World Games. Por parte de los ISVs, sobresalen Convai, Inworld AI, Reallusion, Streamlabs y UneeQ.
Paquete completo de herramientas open source
El ecosistema de Audio2Face liberado por Nvidia incluye:
- Audio2Face SDK: Bibliotecas y documentación para crear y ejecutar animaciones faciales en dispositivos o en la nube.
- Autodesk Maya plugin: Plugin (v2.0) para enviar entradas de audio y recibir animaciones en Maya.
- Unreal Engine 5 plugin: Plugin (v2.5) compatible con UE 5.5 y 5.6 para integración directa en Unreal Engine 5.
- Audio2Face Training Framework: Framework (v1.0) para crear modelos propios con datos personalizados.
- Audio2Face Training Sample Data: Conjunto de datos de ejemplo para iniciar entrenamientos.
- Audio2Face Models: Modelos de regresión (v2.2) y difusión (v3.0) para lip-sync.
- Audio2Emotion Models: Modelos (v2.2 y v3.0) que infieren emociones a partir de audio.
Innovación para experiencias digitales
Con esta liberación, Nvidia busca democratizar la animación facial impulsada por inteligencia artificial y facilitar que desarrolladores independientes, estudios y empresas de todo el mundo adopten esta tecnología. Más información sobre las herramientas está disponible en Nvidia ACE for Games.