अवलोकन
Realtime TTS 1.5 Max लिखे गए टेक्स्ट को 200ms से कम लेटेंसी के साथ प्राकृतिक-सा भाषण में बदल देता है, जिससे यह किसी भी ऐसे प्रोजेक्ट के लिए सही उपकरण बन जाता है जहाँ प्रतीक्षा अनुभव को खराब कर देती है। चाहे आप एक वॉइस असिस्टेंट बना रहे हों, एक छोटी फ़िल्म के लिए नैरेशन तैयार कर रहे हों, या किसी ऐप में बोला गया संवाद जोड़ रहे हों, धीमी ऑडियो रेंडरिंग प्रवाह को तोड़ देती है। Picasso IA पर, यह मॉडल बिना किसी सेटअप के चलता है: अपना टेक्स्ट पेस्ट करें, एक वॉइस चुनें, और परिणाम लगभग तुरंत सुनें। यह 15 भाषाओं को संभालता है और आपको अपने टेक्स्ट में सीधे रखे गए सरल इनलाइन टैग्स के माध्यम से भावना और गति नियंत्रित करने देता है।
यह कैसे काम करता है
- इनपुट बॉक्स में 2,000 वर्णों तक का टेक्स्ट टाइप करें या पेस्ट करें। हर पंक्ति की प्रस्तुति को आकार देने के लिए [happy] या [sad] जैसे भावना टैग इनलाइन जोड़ें।
- एक प्रीसेट वॉइस (जैसे Ashley, Dennis, या Alex) चुनें या यदि आपके पास कोई क्लोन की गई वॉइस है तो उसका कस्टम वॉइस ID दर्ज करें।
- अपना आउटपुट फ़ॉर्मैट (MP3, WAV, OGG Opus, या FLAC) चुनें और टेलीफ़ोनी से लेकर प्रसारण गुणवत्ता तक गंतव्य से मेल खाने के लिए सैंपल रेट चुनें।
- वैकल्पिक रूप से, डिलीवरी को तेज़ या धीमा करने के लिए बोलने की गति को सूक्ष्म रूप से समायोजित करें, और आवाज़ कितनी अभिव्यक्तिपूर्ण या तटस्थ लगे इसे नियंत्रित करने के लिए टेम्परेचर समायोजित करें।
- जनरेट पर क्लिक करें और 200 मिलीसेकंड से कम में अपनी ऑडियो फ़ाइल प्राप्त करें। इसे ब्राउज़र में चलाएँ या सीधे डाउनलोड करें।
अक्सर पूछे जाने वाले प्रश्न
क्या मुझे इसे इस्तेमाल करने के लिए प्रोग्रामिंग कौशल या तकनीकी ज्ञान चाहिए?
नहीं, बस Picasso IA पर Realtime TTS 1.5 Max खोलें, अपनी इच्छित सेटिंग्स समायोजित करें, और जनरेट पर क्लिक करें।
क्या इसे आज़माना मुफ़्त है?
हाँ, आप बिना किसी पेड सब्सक्रिप्शन के मॉडल चला सकते हैं। मुफ़्त जनरेशन सीमाओं की नवीनतम जानकारी के लिए मौजूदा क्रेडिट नीति देखें।
परिणाम पाने में कितना समय लगता है?
मॉडल रियल-टाइम सिंथेसिस के लिए बनाया गया है, जिसका लक्ष्य 200ms से कम लेटेंसी है। व्यवहार में, सबमिट करने के बाद आपको अपना ऑडियो एक सेकंड के अंश में वापस सुनाई देता है।
यह किन भाषाओं का समर्थन करता है?
Realtime TTS 1.5 Max 15 भाषाओं को संभालता है। मॉडल पेज पर वॉइस सेलेक्टर वॉइसों को भाषा के अनुसार समूहित करता है, इसलिए सही वॉइस ढूँढने में केवल कुछ सेकंड लगते हैं।
क्या मैं वॉइस की भावना या टोन नियंत्रित कर सकता हूँ?
हाँ। अपने टेक्स्ट में सीधे [happy], [sad], या [angry] जैसे इनलाइन मार्कअप टैग जोड़ें, और मॉडल अपनी प्रस्तुति को उसके अनुसार समायोजित करता है। आप SSML break टैग्स से समयबद्ध विराम भी जोड़ सकते हैं और समग्र अभिव्यक्तिशीलता में विविधता लाने के लिए टेम्परेचर स्लाइडर को ऊपर या नीचे कर सकते हैं।
कौन से आउटपुट फ़ॉर्मैट उपलब्ध हैं?
आप ऑडियो को MP3, WAV, OGG Opus, या FLAC के रूप में डाउनलोड कर सकते हैं। सैंपल रेट टेलीफ़ोनी के लिए 8 kHz से लेकर प्रसारण-गुणवत्ता वाले प्रोजेक्ट्स के लिए 48 kHz तक कॉन्फ़िगर किया जा सकता है।
क्या मैं जनरेट किया गया ऑडियो व्यावसायिक प्रोजेक्ट्स में उपयोग कर सकता हूँ?
एक बार जनरेट होने के बाद फ़ाइलें आपकी होती हैं। व्यावसायिक लाइसेंसिंग और पुनर्वितरण अधिकारों के विवरण के लिए Picasso IA पर सेवा की शर्तें देखें।