"अपने बचपन के खुद को गले लगाना" ट्रेंड इसलिए फैला क्योंकि यह वह करता है जो कोई फ़िल्टर कभी नहीं कर सकता: यह दो ऐसे पलों को जोड़ता है जो कभी छुए ही नहीं, बचपन की एक फ़ोटो और बड़े होने पर ली गई एक फ़ोटो, या दो लोग जो कभी एक कमरे में साथ नहीं रहे, और उन्हें कुछ सेकंड के लिए गले मिलने देता है। Picasso IA इसे किसी बने-बनाए टेम्पलेट से नहीं दिखाता। यह वही इमेज-टू-वीडियो मॉडल चलाता है जो प्रोडक्ट फ़ोटो और फ़िल्म प्रीविज़ के लिए बनाए गए हैं, बस एक निजी फ़ोटो पर लगाए जाते हैं, तो गले मिलना उस तरह हिलता-डुलता है जैसे मॉडल असल में गति को समझता है, किसी प्रीसेट के तय किए तरीके से नहीं।
इसका आकर्षण असल में वीडियो की क्वालिटी में नहीं है, बल्कि उस खास खालीपन में है जिसे यह क्लिप भरती है। आपकी बचपन की एक फ़ोटो, किसी गुज़र चुके माता-पिता की तस्वीर, दूर जा चुके किसी दोस्त की फ़ोटो, ये सब पल एक दूरी पर जमे हुए हैं। इनमें से किसी एक को तीन सेकंड की गति में बदलना, जहां दोनों आकृतियां पास आकर गले मिलती हैं, स्थिर तस्वीर को एक तरह का पूर्णता का एहसास देता है जो कोई स्थिर फ़ोटो नहीं दे सकती, और यही भावनात्मक वज़न वजह है कि यह फ़ॉर्मैट हर सोशल प्लेटफ़ॉर्म पर बार-बार लौटता है, बजाय किसी आम फ़िल्टर ट्रेंड की तरह गायब होने के।
साथ ही यह ठीक वहीं फिट बैठता है जहां आज के AI वीडियो मॉडल सबसे मज़बूत हैं। इमेज-टू-वीडियो जनरेशन एक छोटी क्लिप में विश्वसनीय इंसानी गति दिखाने में अच्छा है, और गले मिलना एक सरल, साफ़-साफ़ परिभाषित गति है: दो आकृतियां दूरी घटाती हैं और उनकी बाहें एक-दूसरे को लपेट लेती हैं। यह किसी नाच की कोरियोग्राफ़ी या जटिल एक्शन सीन से कहीं आसान है, और यही एक वजह है कि नतीजे अक्सर पहली या दूसरी कोशिश में ही ठीक-ठाक दिखते हैं, दर्जनों बार कोशिश करने की ज़रूरत नहीं पड़ती।
एक ही नतीजे तक पहुंचने के कई रास्ते हैं, और आपके लिए कौन-सा सही है यह इस पर निर्भर करता है कि आप कहां से शुरू कर रहे हैं: एक ऐसी फ़ोटो जिसमें दोनों लोग पहले से साथ हैं, दो अलग फ़ोटो जिन्हें पहले एक सीन में बदलना होगा, या एक फ़ोटो के साथ कोई खास मूवमेंट जिसे आप ठीक वैसे ही कॉपी करना चाहते हैं।
| शुरुआती बिंदु | इस्तेमाल करने वाला मॉडल | आप क्या अपलोड करते हैं | किसके लिए बेहतर |
|---|
| एक फ़ोटो, दोनों लोग पहले से फ़्रेम में | wan-2.7-i2v या hailuo-02 | अकेली फ़ोटो, साथ में गले मिलने का वर्णन करता प्रॉम्प्ट | सबसे आसान मामला, आज़माने में सबसे तेज़ |
| दो अलग फ़ोटो, अलग समय या जगह की | qwen-image-edit-plus या nano-banana-2-lite, फिर एक वीडियो मॉडल | दोनों फ़ोटो, पहले एक ही कंपोज़िट में मिलाई गईं | बचपन का खुद, मिलन, पालतू जानवर और उनके मालिक |
| एक खास हग मूवमेंट जिसे कॉपी करना है | kling-v2.6-motion-control | आपकी फ़ोटो साथ में गले मिलने का छोटा रेफ़रेंस वीडियो | किसी खास इशारे या समय को मिलाना |
| बिना रेफ़रेंस वीडियो के तेज़ टेस्ट | kling-v2.1 या kling-v2.6 | फ़ोटो और एक सीधा टेक्स्ट विवरण | लंबी क्लिप में जाने से पहले तेज़ी से आज़माना |
अगर आपके इनपुट इजाज़त दें तो पहली पंक्ति से शुरू करें। दूसरी पंक्ति वाला दो-चरण रास्ता ज़्यादा समय लेता है क्योंकि इसमें दो अलग जनरेशन चलते हैं, लेकिन यह इकलौता रास्ता है जब वीडियो के दोनों लोग कभी एक ही फ़ोटो में साथ नहीं आए।
ज़्यादातर "बचपन के खुद को गले लगाना" वीडियो एक फ़ोटो से नहीं, बल्कि दो से बनते हैं, जो किसी भी हरकत से पहले एक ही सीन में मिलाई जाती हैं। यही वह चरण है जिसे लोग तब छोड़ देते हैं जब नतीजे से उन्हें निराशा होती है: दो अलग फ़ोटो सीधे किसी वीडियो मॉडल को दे देना अक्सर उलझा हुआ नतीजा देता है, क्योंकि मॉडल के पास यह जानने का कोई निर्देश नहीं होता कि दोनों फ़ोटो जगह में कैसे जुड़ी हैं।
इसका हल है पहले ठीक इसी काम के लिए बने इमेज एडिटिंग मॉडल से मिलाना। qwen-image-edit-plus और nano-banana-2-lite दोनों कई रेफ़रेंस इमेज और सादी भाषा में निर्देश स्वीकार करते हैं, और दोनों एक फ़ोटो के व्यक्ति को दूसरी फ़ोटो के सीन में रख सकते हैं, उसका चेहरा और नाप-जोख पहचानने लायक बनाए रखते हुए। एक प्रॉम्प्ट जैसे इमेज एक के व्यक्ति को इमेज दो के व्यक्ति के बगल में रखो, दोनों खड़े, आमने-सामने, गर्म घरेलू रोशनी में एक ऐसी कंपोज़िट फ़ोटो बनाता है जिसमें दोनों आख़िरकार एक ही फ़्रेम साझा करते हैं।
वही कंपोज़िट फिर आप वीडियो मॉडल को देते हैं। चूंकि दोनों लोग पहले से रोशनी, स्केल और एक विश्वसनीय पोज़ साझा करते हैं, वीडियो मॉडल का काम आसान हो जाता है: बीच बची छोटी दूरी को बंद करना, बजाय एक साझा सीन को शून्य से गढ़ने के। यह क्रम, पहले मिलाना, फिर एनिमेट करना, सबसे बड़ा कारक है कि आख़िरी क्लिप बनावटी दिखेगी या असली।
यह आपके फ़ोन की दो फ़ोटो से एक छोटे वीडियो तक का पूरा रास्ता है, जो एक-फ़ोटो और दो-फ़ोटो दोनों मामलों को कवर करता है, तो जो चरण आप पर लागू नहीं होता उसे छोड़ दें।
- अपनी फ़ोटो चुनें। हर व्यक्ति की एक साफ़, अच्छी रोशनी वाली फ़ोटो, चेहरा दिखता और बिना रुकावट के, एक-फ़ोटो या दो-फ़ोटो दोनों रास्तों के लिए काफ़ी है।
- अगर दो फ़ोटो से शुरू कर रहे हैं तो मिलाएं। टूलकिट में qwen-image-edit-plus या nano-banana-2-lite जैसा मल्टी-इमेज एडिटर खोलें, दोनों फ़ोटो अपलोड करें, और बताएं कि दोनों लोगों को साथ में कैसे रखा जाना चाहिए।
- एक वीडियो मॉडल चुनें और मूवमेंट बताएं। सीधे गले मिलने के लिए wan-2.7-i2v या hailuo-02 अच्छे रहते हैं; किसी खास इशारे के लिए kling-v2.6-motion-control उसे एक छोटे रेफ़रेंस क्लिप से कॉपी कर सकता है।
- पहले छोटी अवधि के साथ जनरेट करें। लंबी क्लिप पर क्रेडिट खर्च करने से पहले पांच या छह सेकंड की क्लिप चलाएं, और जांचें कि बाहें, चेहरे और नाप-जोख पूरी हरकत में ठीक बने रहते हैं।
- ज़रूरत हो तो और सटीक प्रॉम्प्ट के साथ फिर से जनरेट करें। गति, कैमरा फ़्रेमिंग, या हाथ कहां टिकेंगे इसके बारे में और जानकारी जोड़ें, और फिर चलाएं; ज़्यादातर लोग दो या तीन कोशिशों में पसंद आने वाला वर्ज़न पा लेते हैं।
एक हग वीडियो के छूने वाला दिखने और अजीब दिखने के बीच का फ़र्क लगभग हमेशा टाइमिंग और फ़्रेमिंग पर टिका होता है, नीचे के मॉडल पर नहीं। एक प्रॉम्प्ट जो सिर्फ़ इतना कहे कि दो लोग गले मिलते हैं वह अक्सर कुछ अचानक-सा दिखाता है: बाहें एकदम से जगह पर आ जाती हैं, गले मिलना उसी सेकंड में शुरू और खत्म हो जाता है, और हरकत गर्मजोशी की बजाय मशीनी लगती है।
मूवमेंट को चरणों में बताना इसमें से ज़्यादातर ठीक कर देता है। गले मिलने को उसके पलों में तोड़ें: वे एक-दूसरे की ओर चलते हैं, थोड़ा रुकते हैं, बाहें खोलते हैं, और धीरे से गले मिलते हैं, एक पल के लिए थामे रहते हैं। रुकने वाले पल का नाम लेना किसी भी और शब्द से ज़्यादा मायने रखता है, क्योंकि यही वह हिस्सा है जिसे जल्दबाज़ी में लिखा प्रॉम्प्ट सबसे पहले छोड़ देता है, और यही वह हिस्सा है जो कोरियोग्राफ़ी की बजाय भावना जैसा लगता है। कैमरा को ज़्यादातर स्थिर रखना, किसी बड़े सिनेमाई मूवमेंट की मांग करने के बजाय, भी मदद करता है, क्योंकि एक स्थिर शॉट दर्शक को गले मिलने पर ध्यान देने देता है।
अगर जनरेट किए हाथ या बाहें छूने वाली जगह पर अजीब दिखें, तो पूरी क्लिप को बिना सोचे-समझे बार-बार जनरेट न करते रहें। पहले छोटी अवधि आज़माएं, क्योंकि छूने वाले बिंदु अक्सर वही जगह होते हैं जहां वीडियो मॉडल सबसे कम भरोसेमंद होता है, और पांच सेकंड की क्लिप उसे शुरुआत में हुई किसी गलती से भटकने के लिए कम समय देती है।
दोनों सोर्स फ़ोटो के बीच रोशनी की एकरूपता भी लोगों की उम्मीद से ज़्यादा मायने रखती है। एक मिली हुई फ़ोटो जिसमें एक व्यक्ति गर्म घरेलू रोशनी में है और दूसरा ठंडी दिन की रोशनी में, यह असंतुलन अक्सर वीडियो में भी चला जाता है, क्योंकि मॉडल इसे सीन का हिस्सा मानता है, ठीक करने वाली चीज़ नहीं।
यह फ़ॉर्मैट सच में छू लेने वाला होता है जब यह काम करता है, और इसीलिए यह ईमानदार बताना ज़रूरी है कि यह कब काम नहीं करता।
- छूने की जगह पर हाथ: वह पल जहां उंगलियां कंधे या पीठ पर दबती हैं, किसी भी गले मिलने में रेंडर करने का सबसे मुश्किल हिस्सा है, और यहीं ज़्यादातर अतिरिक्त उंगलियां या धुंधली पकड़ दिखती है।
- बहुत अलग दौर की फ़ोटो: 1980 के दशक की फीकी पड़ी प्रिंट को एक साफ़, आधुनिक फ़ोन फ़ोटो के साथ मिलाने से दाने, रंग और शार्पनेस में साफ़ फ़र्क दिख सकता है जिसे मिलाने का चरण पूरी तरह छिपा नहीं पाता।
- अजीब कोणों पर चेहरे: गले मिलना स्वाभाविक रूप से दोनों चेहरों को कुछ हद तक कैमरे से दूर घुमा देता है, और प्रोफ़ाइल या तीन-चौथाई कोण इन मॉडलों के लिए सीधे सामने वाले पोर्ट्रेट से ज़्यादा मुश्किल होते हैं स्थिर बनाए रखना।
- लंबी क्लिप: छह से दस सेकंड से आगे जाने पर भटकाव की संभावना बढ़ जाती है, जहां गले मिलने के बीच में कोई चेहरा या नाप-जोख धीरे-धीरे बदल जाता है।
- वे लोग जो सोर्स फ़ोटो में एक-दूसरे से बिल्कुल अलग दिखते हैं: अगर दोनों तस्वीरें रोशनी, रिज़ॉल्यूशन या कोण में बहुत अलग हैं, तो मिलाने के चरण को उससे कहीं ज़्यादा अंदाज़ा लगाना पड़ता है जितना वह भरोसे से भर सकता है, और कभी-कभी जोड़ दिख जाता है।
इसमें से कुछ भी यह नहीं कहता कि यह फ़ॉर्मैट काम नहीं करता। इसका मतलब है दो या तीन कोशिशों का बजट रखना, बजाय यह उम्मीद करने के कि पहला जनरेशन ही रखने लायक होगा, जो कि ज़्यादातर AI वीडियो जनरेशन में सच है।
क्या मैं सिर्फ़ एक फ़ोटो से हग वीडियो बना सकता हूं?
हां, अगर दोनों लोग उस एक फ़ोटो में पहले से साथ हैं। इसे wan-2.7-i2v या hailuo-02 जैसे इमेज-टू-वीडियो मॉडल में अपलोड करें और वह गले मिलना बताएं जो आप चाहते हैं; मॉडल मौजूद सीन को एनिमेट करता है, कुछ मिलाने की ज़रूरत नहीं। दो-फ़ोटो मिलाने का चरण तभी मायने रखता है जब आपके विषय अलग तस्वीरों से आते हैं जो कभी साथ नहीं ली गईं।
मैं अलग-अलग लोगों की दो फ़ोटो को एक हग सीन में कैसे मिलाऊं?
एक मल्टी-इमेज एडिटिंग मॉडल इस्तेमाल करें, qwen-image-edit-plus या nano-banana-2-lite, दोनों टूलकिट में उपलब्ध हैं। दोनों फ़ोटो अपलोड करें और एक सादा निर्देश लिखें जो बताए कि दोनों लोगों को साथ में कैसे रखा जाना चाहिए, खड़े, पास, आमने-सामने, एक जैसी रोशनी में। नतीजा एक कंपोज़िट फ़ोटो है, जिसे आप बाद में अलग चरण में वीडियो मॉडल से एनिमेट करते हैं।
सबसे असली हग मूवमेंट कौन-सा मॉडल देता है?
कोई एक सबसे अच्छा विकल्प नहीं है, क्योंकि सही चुनाव आपके शुरुआती बिंदु पर निर्भर करता है। wan-2.7-i2v और hailuo-02 दोनों एक फ़ोटो और टेक्स्ट प्रॉम्प्ट से भौतिकी जैसी स्वाभाविक हरकत देते हैं। kling-v2.6-motion-control सबसे मज़बूत विकल्प है जब आपके पास उस सटीक गले मिलने का रेफ़रेंस वीडियो हो जिसे कॉपी करना है, क्योंकि यह उस खास मूवमेंट को स्थानांतरित करता है, किसी विवरण से एक गढ़ने के बजाय।
मेरे जनरेट किए वीडियो में हाथ या बाहें अजीब क्यों दिखते हैं?
वह जगह जहां हाथ कंधे या पीठ पर दबते हैं, किसी भी मौजूदा वीडियो मॉडल के लिए किसी भी गले मिलने का सबसे मुश्किल हिस्सा है, क्योंकि उंगलियों में फ़्रेम के एक छोटे, तेज़ी से हिलते हिस्से में बारीक डिटेल शामिल होती है। छोटी क्लिप आमतौर पर लंबी क्लिप से बेहतर टिकती हैं, और हाथ कहां टिकने चाहिए इस पर एक ज़्यादा सटीक प्रॉम्प्ट अक्सर वही अनुरोध फिर से जनरेट करने से ज़्यादा मदद करता है।
क्या मैं अपनी वह फ़ोटो एनिमेट कर सकता हूं जिसमें मैं किसी गुज़र चुके रिश्तेदार को गले लगा रहा हूं?
हां, और यह इस फ़ॉर्मैट के सबसे आम इस्तेमालों में से एक है। अपनी एक साफ़ फ़ोटो और उस व्यक्ति की एक साफ़ फ़ोटो अपलोड करें जिसे आप शामिल करना चाहते हैं, उन्हें एक एडिटिंग मॉडल से एक सीन में मिलाएं और नतीजे को एनिमेट करें। नतीजे को एक कोमल दृश्य श्रद्धांजलि की तरह देखें, क्योंकि मॉडल एक संभावित गले मिलना बना रहा है, किसी असली हुए पल को दोबारा नहीं बना रहा।
AI हग वीडियो कितना लंबा हो सकता है?
Picasso IA पर मौजूदा इमेज-टू-वीडियो मॉडल छोटी क्लिप बनाते हैं, मॉडल के हिसाब से आमतौर पर पांच से दस सेकंड। यह लंबाई फ़ॉर्मैट के लिए ठीक बैठती है, क्योंकि गले मिलना वैसे भी एक छोटी हरकत है, और दस सेकंड से आगे जाने पर यह संभावना बढ़ जाती है कि क्लिप के बीच में कोई चेहरा या नाप-जोख भटक जाए, बिना कुछ ऐसा जोड़े जिसकी इस ट्रेंड को ज़रूरत हो।
क्या वीडियो में दोनों लोगों को कैमरे की ओर देखना ज़रूरी है?
ज़रूरी नहीं, लेकिन सोर्स फ़ोटो में ज़्यादातर सामने या तीन-चौथाई कोण मॉडल को काम करने के लिए सबसे साफ़ जानकारी देता है। गले मिलना स्वाभाविक रूप से दोनों चेहरों को कुछ हद तक कैमरे से दूर घुमा देता है जैसे-जैसे यह होता है, जो इन मॉडलों के लिए पहले से ही सीधे पोर्ट्रेट से मुश्किल कोण है, तो एक साफ़, अच्छी रोशनी वाली सामने की फ़ोटो से शुरू करना जनरेशन को सबसे अच्छा आधार देता है।
क्या मैं इंसान की जगह किसी पालतू जानवर की फ़ोटो इस्तेमाल कर सकता हूं?
हां, वही दो-चरण वाला तरीका किसी इंसान के पालतू जानवर को गले लगाने, या यहां तक कि दो जानवरों के लिए भी काम करता है, बशर्ते सोर्स फ़ोटो साफ़ हों। अगर वे अलग फ़ोटो से आते हैं तो पहले दोनों को एक सीन में मिलाएं, फिर इंसानों के लिए इस्तेमाल होने वाले उन्हीं वीडियो मॉडलों से गले मिलना एनिमेट करें। फ़र और पंजे हाथों से अलग तरह से व्यवहार करते हैं, और छूने वाली जगह पर आमतौर पर थोड़ा ज़्यादा माफ़ करने वाला रेंडर देते हैं।
अगर दोनों सोर्स फ़ोटो की रोशनी बहुत अलग हो तो क्या होता है?
यह असंतुलन आमतौर पर आख़िरी वीडियो में भी चला जाता है, क्योंकि मिलाने का चरण दोनों फ़ोटो को एक ही मनचाहे सीन का हिस्सा मानता है, न कि यह ठीक करता है कि वे कितनी अलग रोशनी में ली गई थीं। जहां मुमकिन हो, मिलाने वाले प्रॉम्प्ट में वह रोशनी बताएं जो आप चाहते हैं, गर्म घरेलू रोशनी या नरम दिन की रोशनी, ताकि एडिटिंग मॉडल वीडियो मॉडल के कंपोज़िट देखने से पहले ही फ़र्क को बराबर कर दे।
हग वीडियो बनाने में कितना खर्च आता है?
मिलाने और वीडियो जनरेशन दोनों चरणों में क्रेडिट खर्च होते हैं, और कुल राशि आपके चुने मॉडल और सेटिंग्स पर निर्भर करती है, क्योंकि एक लंबा या ज़्यादा रिज़ॉल्यूशन वाला वीडियो एक छोटे, कम रिज़ॉल्यूशन वाले वीडियो से ज़्यादा खर्च करता है। नए अकाउंट मुफ़्त क्रेडिट के साथ शुरू होते हैं, जो कुछ और खर्च करने से पहले दो-चरण वाला तरीका आज़माने के लिए काफ़ी है, और मौजूदा प्लान की कीमतें प्राइसिंग पेज पर हैं, जो सटीक आंकड़ों के लिए इकलौती भरोसेमंद जगह है।
इसे आज़माने के लिए बस दो फ़ोटो और कुछ मिनट चाहिए। टूलकिट खोलें, ज़रूरत हो तो अपनी फ़ोटो मिलाएं, और देखें कि गले मिलना हरकत में कैसा दिखता है।