Aperçu
Omni Human 1.5 transforme une simple photo fixe et un court clip audio en une vidéo parlante de niveau cinématographique, en synchronisant le mouvement des lèvres avec la parole avec une précision image par image. Il résout un problème qui exigeait autrefois une installation de production complète : mettre des mots convaincants dans la bouche d’un sujet numérique sans enregistrer de nouvelles images. Sur Picasso IA, vous fournissez l’image et l’audio, et le modèle effectue le rendu. Un prompt textuel optionnel vous donne le contrôle sur le contexte de la scène, le mouvement du corps et le comportement de la caméra, afin que le résultat s’intègre naturellement à votre projet existant.
- Téléversez une photo nette d’un visage humain, d’un personnage illustré ou d’un portrait comme image de base
- Ajoutez un fichier audio au format MP3 ou WAV, en le gardant sous 35 secondes (les clips plus longs feront échouer la génération)
- Rédigez un prompt textuel optionnel pour préciser les détails de la scène, les mouvements du corps ou de la tête, ou le cadrage de la caméra
- Choisissez d’exécuter en mode standard pour un niveau de détail complet, ou en mode rapide pour un résultat plus rapide avec une légère réduction de la fidélité des mouvements
- Téléchargez la vidéo de sortie une fois que le modèle a terminé le rendu de la séquence synchronisée sur les lèvres
Questions fréquemment posées
Ai-je besoin de compétences en programmation ou de connaissances techniques pour utiliser cela ?
Non, ouvrez simplement Omni Human 1.5 sur Picasso IA, ajustez les paramètres souhaités et cliquez sur générer.
Est-ce gratuit à essayer ?
Vous pouvez exécuter Omni Human 1.5 directement dans votre navigateur sur Picasso IA sans rien télécharger ni installer. Vérifiez le coût en crédits affiché sur la page du modèle avant de commencer.
Quelle est la limite de durée audio ?
Votre clip audio doit durer 35 secondes ou moins. Les fichiers plus longs produiront une erreur et la génération ne se terminera pas, alors coupez votre enregistrement au préalable.
Quel type d’image donne les meilleurs résultats ?
Une photo de face avec le visage du sujet clairement visible fonctionne le mieux. Le modèle gère aussi les illustrations stylisées et les personnages animés, bien que les portraits réalistes avec un bon éclairage aient tendance à produire la synchronisation labiale la plus naturelle.
Puis-je contrôler le mouvement et les détails de la scène au-delà de la synchronisation labiale ?
Oui. Le champ de prompt optionnel accepte des descriptions de la scène, des mouvements de la tête et du corps, ainsi que de la direction de la caméra. Il prend en charge l’anglais, le chinois, le japonais, le coréen, l’espagnol et l’indonésien.
Et si le résultat ne correspond pas à ce que j’avais en tête ?
Essayez de rendre votre prompt plus précis sur le mouvement ou la scène souhaités. Définissez un seed fixe pour verrouiller une exécution, puis ajustez une variable à la fois afin d’identifier ce qui doit être modifié.
Où puis-je utiliser les vidéos que je crée ?
La vidéo générée vous appartient et peut être téléchargée et utilisée dans du contenu pour les réseaux sociaux, des présentations client, des courts métrages créatifs ou tout autre projet sur lequel vous travaillez.