अवलोकन
Chatterbox Turbo एक टेक्स्ट-टू-स्पीच मॉडल है, जो उन उपयोगकर्ताओं के लिए बनाया गया है जिन्हें बिना लंबे इंतज़ार के साफ़, स्वाभाविक सुनाई देने वाला ऑडियो चाहिए। अधिकांश TTS टूल गति के बदले गुणवत्ता या इसके विपरीत समझौता करते हैं; यह वाला उस समझौते को पूरी तरह छोड़ देता है। Picasso IA पर, आप अपना टेक्स्ट टाइप करते हैं, 20 पहले से बनी आवाज़ों में से चुनते हैं, और कुछ ही सेकंड में तैयार ऑडियो क्लिप प्राप्त करते हैं। यह कंटेंट क्रिएटर्स, शिक्षकों, डेवलपर्स, और किसी भी ऐसे व्यक्ति के लिए उपयुक्त है जिसे बिना कोड की एक भी लाइन छुए, जल्दी से बोली गई ऑडियो चाहिए।
यह कैसे काम करता है
- इनपुट फ़ील्ड में 500 अक्षरों तक का टेक्स्ट टाइप या पेस्ट करें। आप विशिष्ट क्षणों पर आवाज़ कैसी सुनाई दे, इसे आकार देने के लिए टेक्स्ट में सीधे [chuckle], [sigh], या [gasp] जैसी स्वाभाविक ध्वनियाँ डाल सकते हैं।
- Aaron से लेकर Walter तक, 20 विकल्पों में से एक पहले से बनी आवाज़ चुनें, जिनमें से हर एक का अपना अलग टोन और गति है।
- वैकल्पिक रूप से, किसी विशिष्ट आवाज़ की नकल करने के लिए एक संदर्भ ऑडियो क्लिप (कम से कम 5 सेकंड) अपलोड करें, प्रीसेट का उपयोग करने के बजाय। संदर्भ ऑडियो किसी भी चयनित आवाज़ को अधिलेखित कर देता है।
- प्रस्तुति कितनी विविध और अभिव्यंजक सुनाई देती है, इसे नियंत्रित करने के लिए temperature समायोजित करें, या केंद्रित, सुसंगत परिणाम के लिए इसे डिफ़ॉल्ट पर छोड़ दें।
- generate दबाएँ, फिर अपनी क्लिप डाउनलोड करें और जहाँ भी आपको बोली गई ऑडियो चाहिए, वहाँ इसका उपयोग करें।
अक्सर पूछे जाने वाले प्रश्न
क्या इसे उपयोग करने के लिए मुझे प्रोग्रामिंग कौशल या तकनीकी ज्ञान चाहिए?
नहीं, बस Picasso IA पर Chatterbox Turbo खोलें, अपनी इच्छित सेटिंग्स समायोजित करें, और generate दबाएँ।
क्या इसे आज़माना मुफ़्त है?
हाँ। आप बिना किसी अग्रिम प्रतिबद्धता के मॉडल चला सकते हैं। वर्तमान क्रेडिट विवरण और उपयोग सीमाओं के लिए अपना खाता पृष्ठ देखें।
परिणाम पाने में कितना समय लगता है?
अधिकांश छोटी क्लिप्स के लिए, कुछ सेकंड ही पर्याप्त होते हैं। लंबे टेक्स्ट या आवाज़ की नकल के अनुरोध में थोड़ा अधिक समय लग सकता है, लेकिन turbo डिज़ाइन सभी मामलों में प्रतीक्षा को छोटा रखता है।
क्या मैं अपनी आवाज़ की नकल कर सकता हूँ?
हाँ। कम से कम 5 सेकंड की एक संदर्भ ऑडियो फ़ाइल अपलोड करें और मॉडल उस आवाज़ में बोली गई सामग्री संश्लेषित करेगा। लंबी, साफ़ रिकॉर्डिंग अधिक सटीक मिलान देती है।
टेक्स्ट इनपुट में वे कोष्ठक वाले टैग क्या हैं?
वे पारीभाषिक मार्कर हैं। अपने टेक्स्ट के किसी विशिष्ट बिंदु पर [chuckle], [sigh], [cough], या इसी तरह के टैग रखने से मॉडल को वहाँ वह ध्वनि डालने का निर्देश मिलता है। ये यथार्थवाद की एक परत जोड़ते हैं जिसकी साधारण TTS में आमतौर पर कमी होती है।
मैं मॉडल कितनी बार चला सकता हूँ?
अपने उपलब्ध क्रेडिट के भीतर जितनी बार चाहें उतनी बार। अगर कोई परिणाम ठीक न लगे, तो आवाज़ बदलें, temperature समायोजित करें, और फिर से generate करें जब तक वह सही न लगे।
मैं आउटपुट का उपयोग कहाँ कर सकता हूँ?
आपके द्वारा जनरेट की गई ऑडियो फ़ाइलें आपकी हैं। इन्हें YouTube वीडियो, पॉडकास्ट, ई-लर्निंग पाठ्यक्रम, ऐप प्रोटोटाइप, प्रस्तुतियों, या जहाँ भी बोली गई ऑडियो की ज़रूरत हो, वहाँ उपयोग करें।