LongCat-Video-Avatar 1.5 : licence MIT sur les poids, matériel lourd exigé
D'après Fiche officielle du modèle LongCat-Video-Avatar 1.5 (Meituan), relayé par X (@mikenevermiss)
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Ce sont les poids du modèle, c'est-à-dire le fichier contenant ce qu'il a appris, qui sont sous licence MIT. La nuance compte : l'ouverture porte sur le modèle livré, pas sur les données qui ont servi à l'entraîner, lesquelles ne sont pas publiées.
- Ce que le modèle fait : il produit une vidéo à partir d'audio et de texte, ou d'audio, de texte et d'une image, et sait aussi prolonger une vidéo existante. La version 1.5 remplace son encodeur audio par Whisper-Large, ce que l'équipe présente comme le gain principal sur le mouvement des lèvres.
- Il n'est pas neuf : la version 1.5 date du 4 juin 2026 et une première version existait dès décembre 2025. Le message viral parle d'une sortie toute récente, ce que la page officielle du modèle ne soutient pas.
- Ce que le message passe sous silence : la commande officielle lance deux processus en parallèle sur cartes graphiques. Ce n'est pas un service en ligne où l'on dépose une photo, mais un modèle à installer soi-même, avec une option de compression pour réduire la mémoire vidéo nécessaire.
- L'évaluation citée est celle du fabricant : 508 paires image-audio, 770 personnes recrutées pour noter les vidéos, 13 240 jugements. La méthode est détaillée, mais elle est menée par l'équipe qui publie le modèle, pas par un tiers indépendant.
Pourquoi ça compte
Des avatars parlants convaincants, produits à partir d'une seule photo et d'un fichier audio, deviennent accessibles à quiconque dispose du matériel voulu, sans abonnement ni autorisation. C'est utile pour de la formation, et c'est aussi, pour toute cette famille d'outils et non pour celui-ci en particulier, le socle des vidéos où l'on fait dire n'importe quoi à n'importe qui. L'équipe renvoie d'ailleurs aux développeurs la responsabilité d'évaluer sécurité et conformité avant tout usage sensible.
Chiffre-clé
13 240 jugements rendus par 770 personnes recrutées pour l'occasion, sur 508 paires image-audio, selon l'évaluation publiée par l'équipe LongCat de Meituan dans la fiche officielle de la version 1.5.
Citation
« This model has not been specifically designed or comprehensively evaluated for every possible downstream application. (Ce modèle n'a pas été spécifiquement conçu ni évalué de manière exhaustive pour tous les usages possibles qui pourraient en découler.) » Équipe LongCat de Meituan, fiche officielle du modèle
Action concrète
Avant d'espérer l'essayer : ce n'est pas un site où l'on téléverse une photo. Il faut installer l'environnement, télécharger les poids, et disposer de cartes graphiques, la commande officielle en mobilisant deux en parallèle. L'équipe recommande aussi des consignes longues et détaillées plutôt que courtes.
« SOME CHINESE DEVELOPERS JUST HUMILIATED THE ENTIRE PAID AI VIDEO INDUSTRY WITH A FREE TOOL. they released LongCat-Avatar, an open-source AI that turns a photo and audio file into a realistic talking video with synchronized lip movements. »
Fondée sur la source originale
Sources
- Fiche officielle du modèle LongCat-Video-Avatar 1.5 (Meituan) : Source primaire : capacités, licence, évaluation, avertissements du fabricant
- Modèle de fondation LongCat-Video : Modèle sur lequel la version avatar est construite
- Relais média : X (@mikenevermiss) →