Aperçu
Realtime TTS 2 convertit du texte écrit en parole au son naturel avec la profondeur expressive que les générateurs vocaux génériques n'ont pas. Si vous avez déjà écouté une voix off et immédiatement senti qu'elle était produite par une machine, ce modèle résout directement ce problème. Il prend en charge plus de 100 langues, accepte des indications émotionnelles entre crochets dans votre texte (comme [say excitedly] ou [whisper softly]) et fournit un audio à faible latence, ce qui le rend pratique pour les applications en direct et l'itération rapide. Sur Picasso IA, vous pouvez l'exécuter directement dans votre navigateur sans rien installer.
- Tapez ou collez votre texte dans le champ de saisie, jusqu'à 2 000 caractères par requête.
- Ajoutez des instructions optionnelles intégrées entre crochets avant la phrase que vous souhaitez façonner, comme [say sadly] ou [laugh], pour guider le ton de l'interprétation et les sons non verbaux.
- Choisissez votre langue dans le menu déroulant, ou laissez le réglage sur détection automatique si votre texte est dans une seule langue reconnaissable.
- Sélectionnez une voix prédéfinie (Ashley, Dennis, Alex ou Darlene) ou saisissez un identifiant de voix personnalisé si vous en avez configuré un.
- Ajustez la vitesse de parole, la température et le format de sortie (MP3, WAV, OGG ou FLAC), puis cliquez sur générer pour recevoir votre fichier audio.
Foire aux questions
Ai-je besoin de compétences en programmation ou de connaissances techniques pour utiliser ceci ?
Non, ouvrez simplement Realtime TTS 2 sur Picasso IA, ajustez les paramètres souhaités et lancez la génération.
Est-ce gratuit à essayer ?
Oui, vous pouvez utiliser Realtime TTS 2 sur Picasso IA sans abonnement payant pour commencer. Consultez les détails du forfait actuel sur la page de tarification pour les limites de génération.
Combien de temps faut-il pour obtenir des résultats ?
Le modèle est conçu pour une latence en temps réel, donc la plupart des textes courts à moyens renvoient un audio en quelques secondes. Les entrées plus longues proches de la limite de 2 000 caractères peuvent prendre légèrement plus de temps selon la charge du serveur.
Quels formats de sortie sont pris en charge ?
Vous pouvez télécharger votre audio au format MP3, WAV, OGG Opus ou FLAC. MP3 est le format par défaut et fonctionne sur presque toutes les plateformes. FLAC est le meilleur choix si vous avez besoin d'une qualité sans perte pour un usage professionnel ou en studio.
Puis-je contrôler l'aspect de la voix ?
Oui. Utilisez des instructions entre crochets dans votre texte, comme [whisper] ou [say excitedly], pour diriger l'émotion et le style de l'interprétation. Augmenter le curseur de température ajoute davantage de variation expressive ; le diminuer conserve un ton cohérent et neutre. Le contrôle de la vitesse de parole vous permet de ralentir ou d'accélérer l'interprétation indépendamment du ton.
Quelles langues prend-il en charge ?
Le modèle gère 15 langues de production, dont l'anglais, l'espagnol, le français, l'allemand, le chinois, le japonais, le coréen, l'arabe et l'hindi, entre autres. Régler la langue sur automatique permet au modèle de la détecter tout seul, ce qui fonctionne bien pour un texte clairement rédigé dans une seule langue.
Où puis-je utiliser l'audio qu'il produit ?
Les fichiers de sortie sont propres et prêts à être intégrés dans n'importe quel projet. Les emplacements courants incluent les vidéos de réseaux sociaux, les montages de podcasts, les interfaces d'applications, les modules d'apprentissage en ligne et les démonstrations de service client. L'audio ne contient aucun filigrane intégré.