अवलोकन
Realtime TTS 2 लिखे गए टेक्स्ट को प्राकृतिक लगने वाली स्पीच में बदलता है, उस अभिव्यंजक गहराई के साथ जो सामान्य वॉयस जनरेटर में नहीं होती। अगर आपने कभी कोई वॉयसओवर सुना है और तुरंत महसूस किया है कि वह मशीन द्वारा बनाया गया था, तो यह मॉडल सीधे उस समस्या को संबोधित करता है। यह 100 से अधिक भाषाओं का समर्थन करता है, आपके टेक्स्ट के अंदर कोष्ठकों में दिए गए भावना संकेत स्वीकार करता है (जैसे [say excitedly] या [whisper softly]), और कम लेटेंसी पर ऑडियो देता है, जिससे यह लाइव अनुप्रयोगों और तेज़ इटररेशन के लिए व्यावहारिक बनता है। Picasso IA पर, आप इसे बिना कुछ इंस्टॉल किए सीधे अपने ब्राउज़र में चला सकते हैं.
यह कैसे काम करता है
- अपने टेक्स्ट को इनपुट बॉक्स में टाइप या पेस्ट करें, प्रति अनुरोध 2,000 वर्ण तक।
- उस वाक्यांश से पहले, जिसे आप आकार देना चाहते हैं, कोष्ठकों में वैकल्पिक इनलाइन निर्देश जोड़ें, जैसे [say sadly] या [laugh], ताकि प्रस्तुति का टोन और गैर-मौखिक ध्वनियाँ निर्देशित की जा सकें।
- ड्रॉपडाउन से अपनी भाषा चुनें, या यदि आपका टेक्स्ट एक ही पहचानी जा सकने वाली भाषा में है तो इसे auto-detect पर छोड़ दें।
- एक पूर्वनिर्धारित आवाज़ चुनें (Ashley, Dennis, Alex, या Darlene) या यदि आपके पास सेटअप है तो एक कस्टम वॉयस ID दर्ज करें।
- बोलने की गति, temperature, और आउटपुट फ़ॉर्मैट (MP3, WAV, OGG, या FLAC) समायोजित करें, फिर अपना ऑडियो फ़ाइल प्राप्त करने के लिए generate पर क्लिक करें।
अक्सर पूछे जाने वाले प्रश्न
क्या इसका उपयोग करने के लिए मुझे प्रोग्रामिंग कौशल या तकनीकी ज्ञान चाहिए?
नहीं, बस Picasso IA पर Realtime TTS 2 खोलें, जो सेटिंग्स आप चाहते हैं उन्हें समायोजित करें, और generate दबाएँ।
क्या इसे आज़माना मुफ़्त है?
हाँ, शुरू करने के लिए आप भुगतान वाली सदस्यता के बिना Picasso IA पर Realtime TTS 2 चला सकते हैं। जनरेशन सीमाओं के लिए pricing page पर वर्तमान plan विवरण देखें।
परिणाम पाने में कितना समय लगता है?
मॉडल रियल-टाइम latency के लिए बनाया गया है, इसलिए अधिकांश छोटे से मध्यम टेक्स्ट कुछ सेकंड के भीतर ऑडियो लौटाते हैं। 2,000-वर्ण सीमा के निकट लंबे इनपुट server load के आधार पर थोड़ा अधिक समय ले सकते हैं।
कौन से आउटपुट फ़ॉर्मैट समर्थित हैं?
आप अपना ऑडियो MP3, WAV, OGG Opus, या FLAC के रूप में डाउनलोड कर सकते हैं। MP3 डिफ़ॉल्ट है और लगभग हर प्लेटफ़ॉर्म पर काम करता है। यदि आपको पेशेवर या स्टूडियो उपयोग के लिए lossless गुणवत्ता चाहिए, तो FLAC सबसे अच्छा विकल्प है।
क्या मैं नियंत्रित कर सकता हूँ कि आवाज़ कैसी लगे?
हाँ। भावना और प्रस्तुति शैली को निर्देशित करने के लिए अपने टेक्स्ट में [whisper] या [say excitedly] जैसे कोष्ठकयुक्त निर्देशों का उपयोग करें। temperature स्लाइडर बढ़ाने से अधिक अभिव्यंजक विविधता जुड़ती है; इसे कम करने से टोन सुसंगत और तटस्थ रहता है। speaking rate नियंत्रण आपको टोन से स्वतंत्र रूप से प्रस्तुति को धीमा या तेज़ करने देता है।
यह किन भाषाओं का समर्थन करता है?
मॉडल 15 production भाषाओं को संभालता है, जिनमें English, Spanish, French, German, Chinese, Japanese, Korean, Arabic, और Hindi शामिल हैं। भाषा को auto पर सेट करने से मॉडल उसे स्वयं पहचान लेता है, जो स्पष्ट रूप से लिखे गए एकल-भाषा टेक्स्ट के लिए अच्छा काम करता है।
मैं इसके द्वारा उत्पन्न ऑडियो का उपयोग कहाँ कर सकता हूँ?
आउटपुट फ़ाइलें साफ़ होती हैं और किसी भी प्रोजेक्ट में सीधे डाली जा सकती हैं। सामान्य उपयोगों में सोशल मीडिया वीडियो, पॉडकास्ट संपादन, ऐप इंटरफ़ेस, e-learning मॉड्यूल, और ग्राहक सेवा डेमो शामिल हैं। ऑडियो में कोई अंतर्निहित watermark नहीं होता।