Le géant chinois de la technologie Alibaba présente une IA capable « d’animer n’importe qui »
Nous avons parcouru un long chemin depuis Adobe Flash et les cartes électroniques animées JibJab.
Deux décennies plus tard, les personnes disposant d'un ordinateur et d'un peu de temps libre peuvent créer des animations de haute qualité (de personnes réelles et d'illustrations) en quelques clics et sans aucune connaissance en montage numérique.
C'est du moins le discours d'« Animate Anybody », un modèle d'IA introduit par l'équipe de recherche en IA d'Alibaba, une société technologique multinationale chinoise spécialisée dans le commerce électronique et la technologie de vente au détail. Et la vidéo de sa technologie à l’œuvre – prétendant pouvoir animer n’importe quelle photo avec une cohérence et un contrôle remarquables – a captivé l’imagination de millions de personnes.
Alibaba affirme qu'Animate Any peut transformer des photos en vidéos « en fonction des séquences de pose souhaitées et en obtenant une continuité temporelle », a expliqué la startup d'avatar IA MyCompanions sur Twitter. « Moins de problèmes et pas de doigts supplémentaires : plutôt cool ! »
L’équipe ajoute que cette technologie ouvre la porte à de nouveaux cas d’utilisation parmi les influenceurs : des vêtements générés par l’IA et la création d’un marché pour des vidéos produites en série mais personnalisées.
Des vidéos courtes à partir d’une seule photo ? Nous pourrons bientôt faire cela pour tous nos influenceurs !
D’après les dernières recherches de pointe du groupe Alibaba, nous y sommes presque. Pourquoi cette technologie est-elle importante ? Comment les influenceurs peuvent-ils utiliser au mieux cette technologie ?
Discussion ci-dessous 👇 pic.twitter.com/C4QCJCeEXP
– Mes Companions (@MyCompanionsAI) 3 décembre 2023
La page GitHub du modèle était inondée de demandes d'accès au code source. En réponse, l'équipe a rassuré le public sur le fait qu'elle mettrait la démo et le code à disposition à une date encore non précisée.
"Merci à tous pour votre incroyable soutien et votre intérêt pour notre projet", a déclaré l'équipe lors de la dernière mise à jour de Github du projet. "Nous voulons vous assurer que nous travaillons activement à la préparation de la démo et du code pour une diffusion publique."
La déclaration a suscité plus de 240 likes en moins d’une journée.
Si la démonstration vidéo est exacte, Animate Any peut être utilisé pour créer des résultats vidéo clairs et temporellement stables tout en conservant l'apparence du personnage de référence. Cela semble être le résultat de l'intégration de modèles de diffusion dans un nouveau cadre appelé ReferenceNet, qui peut fusionner des fonctionnalités détaillées via l'attention spatiale.
Pour ce faire, il prend l'image de référence, déplace les pièces pour suivre la pose souhaitée, puis comble les lacunes qui doivent être comblées afin de donner l'illusion d'un mouvement cohérent pour chaque image de la vidéo générée. La séquence dite openpose donne lieu à une animation presque parfaite.
Animate Any fait également des comparaisons favorables avec d'autres outils d'animation populaires tels que AnimateDiff, Warpfusion, Deforum et ebSynth. Ces outils existants ne parviennent souvent pas à générer des images cohérentes, ce qui facilite l'identification des vidéos comme étant générées par l'IA. En revanche, Animate Any produit une sortie plus raffinée, où les images sont cohérentes et l'animation est presque impossible à distinguer de la réalité.
L’équipe Animate Any n’a pas répondu à une demande de commentaire de Decrypt.
Au milieu de la frénésie, cependant, un modèle similaire nommé MagicAnimate est également apparu comme un concurrent solide. Récemment mis à disposition pour des tests locaux, MagicAnimate adopte une approche légèrement différente du processus d'animation. Bien qu’elle ne soit pas aussi populaire, sa sortie offre une alternative à ceux qui souhaitent explorer plus en profondeur le domaine de l’animation basée sur l’IA.
Contrairement à Animate Anybody, qui utilise également un modèle de diffusion mais en mettant l'accent sur une animation cohérente et contrôlable à partir d'images, le différenciateur de MagicAnimate améliore la cohérence temporelle et la préservation de l'identité. Son encodeur d'apparence unique et sa technique de fusion vidéo conduisent à des transitions plus fluides dans les longues animations vidéo et à une meilleure préservation des détails entre les images.
Bien que MagicAnimate excelle en termes de cohérence temporelle et de qualité par image, il ne semble cependant pas aussi précis que son concurrent.
Alex Carliera, ancien chercheur en Meta AI, a eu l'occasion de tester MaticAnimate, et bien qu'il l'ait qualifié de « première étape importante pour une génération vidéo cohérente à partir d'une seule image », il a noté que les générations n'étaient pas précises à 100 % par rapport à l'image de référence, ce qui déformait le corps dans certaines images.
J'ai testé le ControlNet pour la vidéo (MagicAnimate) et voici mon avis : il fonctionne très bien mais présente quelques défauts.
- l'identité de la vidéo animée s'échappe dans la vidéo résultante (et déforme la forme du corps)
- mauvaises mains et mauvais visage (sans surprise ! )
Mais une excellente première étape pour une cohérence… https://t.co/zY9tZZ6MaK pic.twitter.com/J9XELE5NGT
– Alex Carlier (@alexcarliera) 4 décembre 2023
Donc, si vous ne pouvez pas danser et que vous vous sentez exclu de la dernière chorégraphie de TikTok, Animate Anybody et MagicAnimate peuvent peut-être être votre ticket pour le succès viral.
Edité par Ryan Ozawa.
