अवलोकन
Grok Text To Speech किसी भी लिखे हुए इनपुट से प्राकृतिक-सा ऑडियो बनाता है, जिसमें 20 भाषाएँ और पाँच वॉइस व्यक्तित्व शामिल हैं, जिनके टोन और डिलीवरी शैलियाँ अलग-अलग हैं। अगर आपको एक वीडियो, पॉडकास्ट इंट्रो, या रिकॉर्ड किए गए संदेश के लिए वॉइसओवर चाहिए लेकिन माइक्रोफ़ोन या वॉयस टैलेंट उपलब्ध नहीं है, तो यह उस अंतर को भर देता है। Picasso IA पर, आप अपना टेक्स्ट पेस्ट करते हैं, एक आवाज़ चुनते हैं, और कुछ ही सेकंड में एक साफ़ ऑडियो फ़ाइल प्राप्त करते हैं। मॉडल 15,000 वर्ण तक की स्क्रिप्ट स्वीकार करता है और विराम, हँसी, या फुसफुसाए गए अंश जैसे इनलाइन स्पीच टैग्स को सीधे आपके टेक्स्ट से पढ़ता है।
यह कैसे काम करता है
- अपना टेक्स्ट इनपुट फ़ील्ड में पेस्ट या टाइप करें (प्रति रन 15,000 वर्ण तक)
- पाँच विकल्पों में से एक आवाज़ चुनें: उत्साही और जोशीली, गर्म और मित्रवत, आत्मविश्वासी और स्पष्ट, स्मूद और संतुलित, या प्रभावशाली और मज़बूत
- अपना आउटपुट फ़ॉर्मैट चुनें (सामान्य उपयोग के लिए MP3, लॉसलेस ऑडियो के लिए WAV, या फ़ोन-आधारित सिस्टम के लिए टेलीफोनी कोडेक्स)
- 20 समर्थित विकल्पों में से अपनी लक्षित भाषा सेट करें, या इसे ऑटो-डिटेक्ट पर छोड़ दें और मॉडल को आपके टेक्स्ट से भाषा पहचानने दें
- जनरेट पर क्लिक करें और Picasso IA से अपनी तैयार ऑडियो फ़ाइल डाउनलोड करें
अक्सर पूछे जाने वाले प्रश्न
क्या इसे इस्तेमाल करने के लिए मुझे प्रोग्रामिंग कौशल या तकनीकी ज्ञान चाहिए?
नहीं, बस Picasso IA पर Grok Text To Speech खोलें, अपनी पसंद की सेटिंग्स समायोजित करें, और जनरेट पर क्लिक करें।
क्या इसे आज़माना मुफ़्त है?
हाँ, आप बिना किसी अग्रिम भुगतान के मॉडल चला सकते हैं। अपने वर्तमान बैलेंस और प्लान विवरण के लिए क्रेडिट्स पैनल देखें।
परिणाम मिलने में कितना समय लगता है?
अधिकांश अनुरोध कुछ ही सेकंड में पूरे हो जाते हैं। 15,000-वर्ण सीमा के नज़दीक लंबे टेक्स्ट में थोड़ा अधिक समय लग सकता है, लेकिन तैयार ऑडियो आम तौर पर 20 सेकंड से कम में मिल जाता है।
कौन-से आउटपुट फ़ॉर्मैट समर्थित हैं?
आप सामान्य साझा करने के लिए MP3, लॉसलेस गुणवत्ता के लिए WAV, रॉ ऑडियो पाइपलाइनों के लिए PCM, या टेलीफोनी सिस्टम्स के लिए mulaw और alaw फ़ॉर्मैट्स में ऑडियो डाउनलोड कर सकते हैं। आप सैंपल रेट और, MP3 के लिए, बिट रेट भी स्वतंत्र रूप से नियंत्रित कर सकते हैं।
क्या मैं टोन, पेसिंग, या डिलीवरी शैली नियंत्रित कर सकता हूँ?
हाँ। मॉडल आपके टेक्स्ट में सीधे लिखे गए इनलाइन स्पीच टैग्स को पढ़ता है। वाक्यों के बीच [pause] डालें, प्राकृतिक विराम के लिए [laugh] जोड़ें, या किसी अंश को whisper टैग्स में लपेटें ताकि वह हिस्सा कैसे पढ़ा जाए, इसे बदला जा सके।
यह कितनी भाषाओं का समर्थन करता है?
मॉडल अंग्रेज़ी, फ़्रेंच, जर्मन, स्पेनिश, जापानी, कोरियाई, अरबी, हिंदी, पुर्तगाली, चीनी, और अधिक सहित 20 भाषाओं को कवर करता है। भाषा को BCP-47 कोड के साथ मैन्युअल रूप से सेट करें या ऑटो-डिटेक्ट का उपयोग करें और मॉडल को आपके इनपुट से यह पहचानने दें।
मैं जो ऑडियो फ़ाइलें जनरेट करता हूँ, उनका उपयोग कहाँ कर सकता हूँ?
फ़ाइलें बिना वॉटरमार्क या एम्बेडेड ब्रांडिंग के साफ़ डाउनलोड होती हैं। आप उन्हें वीडियो प्रोजेक्ट्स, पॉडकास्ट एपिसोड्स, ई-लर्निंग कोर्सेज़, वॉइसमेल रिकॉर्डिंग्स, या किसी भी अन्य संदर्भ में उपयोग कर सकते हैं जिसे बोले गए ऑडियो की आवश्यकता हो।