Aperçu
Grok Text To Speech produit un audio au son naturel à partir de n’importe quelle entrée écrite, couvrant 20 langues et cinq personnalités vocales avec des tons et styles d’interprétation différents. Si vous avez besoin d’une voix off pour une vidéo, d’une introduction de podcast ou d’un message enregistré mais que vous n’avez ni microphone ni talent vocal disponible, cela comble cette lacune. Sur Picasso IA, vous collez votre texte, choisissez une voix et recevez un fichier audio propre en quelques secondes. Le modèle accepte des scripts jusqu’à 15 000 caractères et lit directement les balises vocales intégrées comme les pauses, les rires ou les passages chuchotés dans votre texte.
- Collez ou saisissez votre texte dans le champ de saisie (jusqu’à 15 000 caractères par exécution)
- Choisissez une voix parmi cinq options : énergique et dynamique, chaleureuse et amicale, confiante et claire, douce et équilibrée, ou autoritaire et puissante
- Sélectionnez votre format de sortie (MP3 pour un usage général, WAV pour un audio sans perte, ou des codecs téléphoniques pour les systèmes téléphoniques)
- Définissez votre langue cible parmi 20 options prises en charge, ou laissez-la en détection automatique et laissez le modèle identifier la langue à partir de votre texte
- Lancez la génération et téléchargez votre fichier audio final depuis Picasso IA
Questions fréquemment posées
Ai-je besoin de compétences en programmation ou de connaissances techniques pour utiliser cela ?
Non, ouvrez simplement Grok Text To Speech sur Picasso IA, ajustez les paramètres souhaités, puis lancez la génération.
Est-ce gratuit à essayer ?
Oui, vous pouvez exécuter le modèle sans aucun paiement initial. Consultez le panneau des crédits pour voir votre solde et les détails de votre forfait.
Combien de temps faut-il pour obtenir des résultats ?
La plupart des demandes se terminent en quelques secondes. Les textes plus longs, proches de la limite de 15 000 caractères, peuvent prendre un peu plus de temps, mais l’audio final arrive généralement en moins de 20 secondes.
Quels formats de sortie sont pris en charge ?
Vous pouvez télécharger l’audio en MP3 pour un partage général, en WAV pour une qualité sans perte, en PCM pour les pipelines audio bruts, ou en formats mulaw et alaw pour les systèmes de téléphonie. Vous contrôlez également indépendamment la fréquence d’échantillonnage et, pour le MP3, le débit binaire.
Puis-je contrôler le ton, le rythme ou le style d’interprétation ?
Oui. Le modèle lit les balises vocales intégrées directement dans votre texte. Insérez un [pause] entre les phrases, ajoutez un [laugh] pour une rupture naturelle, ou enveloppez un passage dans des balises de chuchotement pour modifier la manière dont cette section est lue à voix haute.
Combien de langues prend-il en charge ?
Le modèle couvre 20 langues, dont l’anglais, le français, l’allemand, l’espagnol, le japonais, le coréen, l’arabe, l’hindi, le portugais, le chinois et d’autres. Définissez la langue manuellement avec un code BCP-47 ou utilisez la détection automatique et laissez le modèle la déterminer à partir de votre saisie.
Où puis-je utiliser les fichiers audio que je génère ?
Les fichiers sont des téléchargements propres, sans filigrane ni marque intégrée. Vous pouvez les intégrer dans des projets vidéo, des épisodes de podcast, des cours e-learning, des messages vocaux ou tout autre contexte nécessitant de l’audio parlé.