अभी इस वक्त आपकी फीड पर कहीं, किसी दोस्त का चेहरा एक विंडो वाले प्लास्टिक बॉक्स से झांक रहा है, साथ में एक छोटा स्टैंड, एक प्रिंटेड लोगो और कुछ एक्सेसरी ब्लिस्टर, बिल्कुल टॉय शेल्फ के किसी खिलौने जैसा स्टाइल। यही है एक्शन फिगर ट्रेंड, और यह हर बार एक ही आइडिया पर चलता है: चेहरा असली रखो, और उसके चारों ओर बॉक्स, स्कल्प्ट और पैकेजिंग का टेक्स्ट गढ़ लो। एक AI इमेज एडिटर यह काम एक सेल्फी से एक मिनट से भी कम समय में कर सकता है।
यह फॉर्मेट इसलिए फैला क्योंकि यह तुरंत समझ आ जाता है। कोई दोस्त, कोई सहकर्मी, किसी का पालतू कुत्ता, एक बॉक्स्ड कलेक्टिबल में बदल जाता है, साथ में एक कार्ड जिस पर उसकी सिग्नेचर मूव या उसका पसंदीदा कॉफी ऑर्डर लिखा होता है, यह आधे सेकंड में मज़ाक की तरह समझ आता है और उसी वजह से शेयर होता है जिस वजह से कोई अच्छा मीम टेम्पलेट फैलता है: कोई भी उसमें अपना चेहरा डाल सकता है। इसे तकनीकी रूप से मुमकिन बनाने वाली चीज़ एक खास तरह का मॉडल है, जो टेक्स्ट डिस्क्रिप्शन से किसी अजनबी को जनरेट करने की बजाय एक असली फोटो को एडिट करने के लिए बना है।
Picasso IA एक ही इंटरफेस के पीछे 488 मॉडल चलाता है, जिनमें कई ठीक इसी काम के लिए बने हैं: चेहरे को वैसा ही रखते हुए बाकी सब कुछ नए स्टाइल में ढालना। पूरा कैटलॉग देखा जा सकता है कि और क्या मौजूद है, और नए अकाउंट फ्री क्रेडिट्स के साथ शुरू होते हैं, जो कुछ भी खर्च करने से पहले एक बॉक्स स्टाइल आज़माने के लिए काफी हैं।
एक सामान्य टेक्स्ट-टू-इमेज मॉडल से "एक आदमी का एक्शन फिगर" मांगने पर वह एक जेनेरिक चेहरा गढ़ देता है, क्योंकि उसने आपका चेहरा कभी देखा ही नहीं। यह ट्रेंड इसकी बजाय इमेज एडिटिंग मॉडल पर टिका है, ऐसे मॉडल जो एक रेफरेंस फोटो को एंकर की तरह लेते हैं और प्रॉम्प्ट को इस बारे में निर्देश मानते हैं कि उसके चारों ओर क्या बनाना है, न कि शुरू से क्या गढ़ना है।
Google का nano-banana-2 14 रेफरेंस इमेज तक स्वीकार करता है और बातचीत जैसे एडिट को अच्छे से फॉलो करता है, इसलिए यह कई राउंड के "अब एक केप जोड़ो" या "बॉक्स नीला कर दो" जैसे बदलावों में भी चेहरा एक जैसा ही रखता है और किसी अलग चेहरे की तरफ नहीं भटकता। ByteDance का Seedream 4.5 4K तक रेंडर करता है और एक साथ कई रेफरेंस संभालता है, जो तब काम आता है जब बॉक्स आर्ट या एक्सेसरीज़ किसी अलग रेफरेंस इमेज से आते हैं। Black Forest Labs का FLUX Kontext Pro सटीक टेक्स्ट-आधारित एडिट के लिए बना है, जो सिर्फ कार्ड का टेक्स्ट या ब्लिस्टर का रंग बदलने जैसी रिक्वेस्ट के लिए सही बैठता है, जबकि फिगर वैसी ही रहती है। Qwen Image Edit Plus एक से ज़्यादा फोटो के एलिमेंट्स को एक ही सीन में जोड़ता है, जो तब मायने रखता है जब पोज़ का रेफरेंस और चेहरे का रेफरेंस दो अलग-अलग इमेज हों। इनमें से किसी को भी कुछ ट्रेन करने की ज़रूरत नहीं; बस अपलोड करें, प्रॉम्प्ट लिखें और जनरेट करें।
इस प्रॉम्प्ट में पैकेजिंग की शब्दावली किसी भी और चीज़ से ज़्यादा काम करती है। सिर्फ "action figure" लिखने से आपको एक प्लास्टिक जैसी दिखने वाली आकृति मिलती है; बॉक्स का खास फॉर्मेट नाम लेना ही रिज़ल्ट को ऐसा कुछ बना देता है जिसे कलेक्टर की शेल्फ पहचान ले।
| स्टाइल | उसे बनाने वाले प्रॉम्प्ट शब्द | किसके लिए सबसे अच्छा |
|---|
| क्लासिक ब्लिस्टर पैक | थर्मोफॉर्म्ड क्लियर प्लास्टिक ब्लिस्टर, कार्डबोर्ड बैकर कार्ड, हैंगिंग टैब | एक क्लासिक सोलो हीरो शॉट, वही फॉर्मेट जिसे ज़्यादातर लोग "action figure" कहकर समझते हैं |
| विंडो बॉक्स | प्रिंटेड विंडो बॉक्स, फॉइल लोगो, साइड पैनल पर कैरेक्टर आर्टवर्क | एक प्रीमियम कलेक्टिबल लुक, फुल-बॉडी पोज़ और प्रॉप्स के साथ अच्छा |
| विनाइल डेस्क टॉय | चिबी अनुपात, विनाइल फिगर, छोटा चौकोर बॉक्स | असली सी स्कल्प्ट की बजाय एक क्यूट, बढ़ा-चढ़ाकर दिखाया गया रूप |
| डायोरामा बेस | गोल डिस्प्ले बेस पर पोज़ में, म्यूज़ियम-स्टाइल एक्रिलिक केस, बिना पैकेजिंग | "फिगर" को पहले से अनबॉक्स्ड और डिस्प्ले में दिखाना |
| ब्लाइंड बॉक्स मिनी | छोटा पेस्टल बॉक्स, मिस्ट्री फिगर लाइन, मिनिमल इलस्ट्रेटेड आर्ट | एक हीरो बॉक्स की बजाय पूरी कलेक्टिबल लाइन जैसी लुक |
दो आदतें पैकेजिंग को खुद पढ़ने लायक बनाए रखती हैं। पहली, बॉक्स के पीछे साफ स्टूडियो बैकग्राउंड मांगें, ठीक वैसे ही जैसे असली प्रोडक्ट फोटोग्राफी में लाइट की जाती है, ताकि मॉडल एक भरे-पूरे सीन और साफ लेबल टेक्स्ट दोनों को एक साथ बनाने में खुद से ही न उलझे। दूसरी, हर प्रॉम्प्ट पर तीन-चार वेरिएंट जनरेट करें; कार्ड का टेक्स्ट और छोटे एक्सेसरीज़ ही वे डिटेल हैं जो हर बार सबसे ज़्यादा बदलते हैं, और एक छोटा बैच ऐसा वर्ज़न ढूंढने का सबसे तेज़ तरीका है जो साफ दिखे।
यह वर्कफ़्लो Picasso IA टूलकिट के अंदर चलता है और शुरू से आखिर तक सिर्फ एक फोटो से करीब दस मिनट लेता है।
- एक साफ रेफरेंस फोटो चुनें। एक सीधे सामने से ली गई, समान रोशनी वाली और बिना गड़बड़ बैकग्राउंड वाली फोटो एडिटिंग मॉडल को सबसे साफ चेहरा देती है जिसे वह संभालकर रख सके; आधा चेहरा छाया में हो तो वह टॉय वर्ज़न में भी वैसा ही कॉपी हो जाता है।
- बॉक्स और एक्सेसरी की लिस्ट लिखें। पैकेजिंग स्टाइल का नाम लें और फिर दो-तीन एक्सेसरीज़ को ऐसे गिनाएं जैसे असली टॉय कॉपी लिख रहे हों: एक छोटा मग, एक मिनी लैपटॉप, एक नेमप्लेट। साफ नाम वाली चीज़ें अस्पष्ट शब्दों से ज़्यादा भरोसे के साथ रेंडर होती हैं।
- आइडेंटिटी-प्रिज़र्विंग एडिटर से जनरेट करें। फोटो को रेफरेंस इमेज की तरह अटैच करके nano-banana-2 या Seedream 4.5 में प्रॉम्प्ट चलाएं, और एक ही रिज़ल्ट की बजाय एक छोटा बैच जनरेट करें।
- एक बार में एक डिटेल सुधारें। सबसे अच्छे रिज़ल्ट को FLUX Kontext Pro या Qwen Image Edit Plus में वापस डालें और हर पास में सिर्फ एक चीज़ बदलें: कार्ड का टेक्स्ट, ब्लिस्टर का रंग, कोई एक्सेसरी जो गलत आई हो।
- अपस्केल करें और एक्सपोर्ट करें। अगर प्रिंटेड टेक्स्ट धुंधला लगे तो जीतने वाले वर्ज़न को अपस्केलिंग मॉडल से गुज़ारें, फिर पोस्ट करने या प्रिंट करने के लिए पूरी रेज़ॉल्यूशन वाली फाइल डाउनलोड करें।
कुछ आदतें ही एक विश्वसनीय बॉक्स शॉट को साफ तौर पर AI-जनरेटेड धुंधली तस्वीर से अलग करती हैं, और इनमें से ज़्यादातर मॉडल से ज़्यादा प्रॉम्प्ट से जुड़ी हैं।
- भरे-पूरे बैकग्राउंड: बॉक्स के पीछे भीड़भाड़ वाला सीन प्लास्टिक विंडो और लेबल टेक्स्ट दोनों से टकराता है, इसलिए दोनों ज़रूरत से ज़्यादा धुंधले आते हैं; इसकी बजाय एक साफ या हल्के ग्रेडिएंट बैकग्राउंड की मांग करें।
- अस्पष्ट एक्सेसरी लिस्ट: "कुछ एक्सेसरीज़" एक बिना समझ आने वाली आकृति में रेंडर होता है; दो-तीन साफ चीज़ों का नाम लेना मॉडल को कुछ ठोस देता है जिसे वह बना सके।
- एक जनरेशन में एक से ज़्यादा चेहरे: ग्रुप फोटो मॉडल को उलझा देते हैं कि उसे किस चेहरे पर एंकर करना है, इसलिए हर बॉक्स के लिए एक ही व्यक्ति चलाएं और ज़रूरत पड़ने पर बाद में रिज़ल्ट्स को जोड़ लें।
- रेफरेंस फोटो छोड़ देना: फोटो अपलोड करने की बजाय खुद का टेक्स्ट में वर्णन लिखना एक जेनेरिक अजनबी बनाता है, आपको नहीं; रेफरेंस इमेज ही इस पूरे वर्कफ़्लो का मकसद है।
- किसी असली टॉय ब्रांड का लोगो या ट्रेडमार्क मांगना: किसी नामी फ्रैंचाइज़ी की पैकेजिंग डिज़ाइन मांगने से बिगड़ा हुआ या अस्वीकृत रिज़ल्ट मिलने की संभावना रहती है, और वैसे भी उसे पब्लिश करना ठीक नहीं; इसकी बजाय एक जेनेरिक कलेक्टिबल बॉक्स का वर्णन करें।
टिप: रेफरेंस फोटो को अपलोड करने से पहले कंधों से ऊपर तक क्रॉप कर लें। एक टाइट क्रॉप मॉडल का ध्यान चेहरे पर बनाए रखता है, जो कि इस पूरे ट्रेंड की सबसे ज़रूरी चीज़ है, बजाय इसके कि वह किसी आउटफिट या बैकग्राउंड को मैच करने में मेहनत खर्च करे जिसे बॉक्स फॉर्मेट वैसे भी ढक देगा।
यह कोई परफेक्ट नयापन नहीं है, और इनका पूरा सेट बनाने से पहले यह जानना ज़रूरी है कि यह कहां चूक जाता है।
प्रिंटेड टेक्स्ट सबसे लगातार कमज़ोर पहलू है। कार्ड के नाम, टैगलाइन और बॉक्स पर कोई भी छोटा लेबल अक्सर किसी गलत अक्षर या हल्के बिगड़े हुए शब्द के साथ आता है, इसलिए पब्लिश करने से पहले हर चीज़ को ध्यान से जांच लें, सिर्फ एक नज़र पर भरोसा न करें। अजीब कोणों पर पकड़े हाथ और छोटे एक्सेसरीज़ दूसरी आम कमज़ोरी हैं, यह मौजूदा इमेज मॉडल्स की आम कमज़ोरी है, इस ट्रेंड की खास बात नहीं; कोई छोटा प्रॉप पकड़ी हुई फिगर कभी-कभी उस चीज़ को हाथ के साथ अजीब तरह से जुड़ा हुआ दिखा देती है। साइड और थ्री-क्वार्टर एंगल सामने वाले चेहरे जितनी भरोसेमंद तरह से पहचान नहीं रखते, क्योंकि मॉडल के पास एंकर करने के लिए ओरिजिनल फोटो का उतना हिस्सा नहीं होता। और यह वर्कफ़्लो एक फ्लैट इमेज बनाता है, कोई फिज़िकल ऑब्जेक्ट या 3D फाइल नहीं; अगर असली मकसद कुछ 3D प्रिंट करना है, तो इमेज को 3D में बदलना उसके लिए बना अलग वर्कफ़्लो है। इनमें से कुछ भी यह नहीं कहता कि इस फॉर्मेट को आज़माना बेकार है। इसका मतलब बस इतना है कि पहले रिज़ल्ट को एक ड्राफ्ट की तरह लें और पहली ही कोशिश में परफेक्ट इमेज की उम्मीद रखने की बजाय एक छोटा बैच जनरेट करें।
क्या AI एक्शन फिगर फोटो बनाने का कोई फ्री तरीका है?
Picasso IA नए अकाउंट को फ्री क्रेडिट्स देता है, और एक एडिट की गई इमेज वीडियो या 3D जनरेशन से कम में बन जाती है, इसलिए यह कुछ भी खर्च करने से पहले एक-दो बॉक्स स्टाइल टेस्ट करने के लिए काफी है। पेड प्लान प्राइसिंग पेज पर दिए गए हैं, और चूंकि वे समय के साथ बदलते रहते हैं, यहां बताए किसी भी नंबर से ज़्यादा वही पेज मौजूदा आंकड़ों के लिए भरोसे लायक जगह है।
एक्शन फिगर ट्रेंड के लिए कौन सा मॉडल सबसे अच्छा है?
कोई एक सबसे अच्छा मॉडल नहीं है, और यही वजह है कि एक से ज़्यादा को आज़माना समझदारी है। nano-banana-2 लगातार होने वाले बातचीत जैसे एडिट को अच्छे से संभालता है और कई राउंड के बदलावों में भी चेहरा वैसा रखता है, Seedream 4.5 ज़्यादा रेज़ॉल्यूशन में रेंडर करता है और एक साथ कई रेफरेंस इमेज स्वीकार करता है, और FLUX Kontext Pro किसी एक डिटेल की सटीक एडिटिंग में सबसे मज़बूत है, जैसे कार्ड का टेक्स्ट ठीक करना। एक समझदार सेशन में एक ही रेफरेंस फोटो और प्रॉम्प्ट को इनमें से दो मॉडल में चलाया जाता है और जो रिज़ल्ट सबसे साफ आए उसे रखा जाता है।
क्या यह सच में मुझ जैसा दिखेगा, या एक जेनेरिक टॉय चेहरा होगा?
इनपुट इमेज के तौर पर एक साफ, अच्छी रोशनी वाली रेफरेंस फोटो अपलोड करने पर, मौजूदा एडिटिंग मॉडल सामने से ली गई पोज़ के लिए विश्वसनीय तरीके से पहचान बनाए रखते हैं। यह पिक्सेल-परफेक्ट नहीं है: कोई खास गहना या एक्ज़ैक्ट हेयरस्टाइल जैसी बारीक डिटेल कभी-कभी थोड़ी बदल जाती है, और साइड एंगल सामने वाली फोटो जितनी भरोसेमंद तरह से पहचान नहीं रखते। टेक्स्ट में खुद का वर्णन लिखने की बजाय फोटो अपलोड करना ही "आप जैसा दिखता है" और "किसी अजनबी जैसा दिखता है" के बीच का फर्क बनाता है।
क्या मैं इंसान की बजाय अपने पालतू जानवर की फोटो से यह कर सकता हूं?
हां, और यह उसी तरह काम करता है: जानवर की एक साफ फोटो अपलोड करें और उसके चारों ओर बॉक्स और एक्सेसरीज़ का वर्णन लिखें। इंसान का चेहरा वैसा रखने वाली आइडेंटिटी-प्रिज़र्विंग प्रक्रिया कुत्ते या बिल्ली के चेहरे के लिए भी उसी तरह काम करती है, क्योंकि मॉडल शुरू से जानवर गढ़ने की बजाय रेफरेंस इमेज पर एंकर करता है।
क्या इसे बनाने के लिए डिज़ाइन या Photoshop की स्किल चाहिए?
नहीं। पूरा वर्कफ़्लो बस एक फोटो अपलोड करना और एक विवरण लिखना है; मॉडल खुद प्लास्टिक विंडो, कार्डबोर्ड बैकर और प्रिंटेड टेक्स्ट बना देता है। अगर कोई खास डिटेल गलत आए, तो उसका हल FLUX Kontext Pro जैसे एडिटर को दिया गया एक फॉलो-अप टेक्स्ट निर्देश है, कोई मैनुअल रीटच नहीं।
क्या मैं एक ही पैकेजिंग स्टाइल के साथ पूरी सीरीज़ बना सकता हूं?
हां। जो बॉक्स स्टाइल पसंद आया उसे बनाने वाला प्रॉम्प्ट सेव कर लें, पैकेजिंग की शब्दावली को फिक्स रखें, और हर जनरेशन के बीच सिर्फ रेफरेंस फोटो और एक्सेसरी लिस्ट बदलें। चूंकि पैकेजिंग के निर्देश एक जैसे ही रहते हैं, नतीजे कई असंबंधित इमेज की बजाय एक सुसंगत प्रोडक्ट लाइन जैसे दिखते हैं, यही तकनीक इमेज के एक सेट में किसी कैरेक्टर का लुक एक जैसा बनाए रखने के लिए भी इस्तेमाल होती है।
छोटे एक्सेसरीज़ कभी-कभी गलत क्यों दिखते हैं?
एक हाथ में पकड़ी छोटी चीज़ें, खासकर किसी कोण पर, मौजूदा इमेज मॉडल्स की एक जानी-पहचानी आम कमज़ोरी हैं, यह इस वर्कफ़्लो की खास बात नहीं है। प्रॉम्प्ट में एक्सेसरी को अस्पष्ट छोड़ने की बजाय साफ नाम देना यह होना कम कर देता है, और पहला रिज़ल्ट स्वीकार करने की बजाय एक छोटा बैच जनरेट करने से आमतौर पर कम से कम एक साफ वर्ज़न मिल जाता है।
क्या मैं इस इमेज को असली 3D प्रिंटेड फिगर में बदल सकता हूं?
इस वर्कफ़्लो से सीधे नहीं; जनरेट की गई एक्शन फिगर फोटो एक फ्लैट इमेज है, कोई 3D मॉडल नहीं। अगर असली मकसद एक फिज़िकल ऑब्जेक्ट है, तो एक अलग इमेज-टू-3D कन्वर्ज़न वर्कफ़्लो मौजूद है जो एक स्टिल इमेज को प्रिंट करने लायक मेश में बदलता है, हालांकि वह रास्ता यहां बताए गए पैकेजिंग-फोटो ट्रेंड से अलग प्रोसेस है।
यह किसी सामान्य AI फोटो फिल्टर से कैसे अलग है?
एक सामान्य फिल्टर पूरी फोटो पर एक ही फिक्स लुक लगा देता है। यह ट्रेंड खासतौर पर एक ऐसे एडिटिंग मॉडल पर निर्भर करता है जो आपकी अपलोड की गई फोटो को सुरक्षित रखने लायक रेफरेंस मानता है, और फिर उसके चारों ओर नया कंटेंट, बॉक्स, एक्सेसरीज़, पैकेजिंग टेक्स्ट, बनाता है। यह किसी फिल्टर से कहीं ज़्यादा Picasso IA की Nano Banana से एक अकेले टूल के तौर पर तुलना जैसा है, क्योंकि इसके पीछे की प्रक्रिया इंस्ट्रक्शन-आधारित एडिटिंग है, कोई फिक्स स्टाइल ट्रांसफॉर्म नहीं।
इनमें से एक इमेज बनाने में कितना खर्च आता है?
लागत क्रेडिट्स में चुकाई जाती है और चुने गए मॉडल और सेटिंग्स के हिसाब से बदलती है, इसलिए यहां लिखा कोई भी सटीक नंबर कुछ महीनों में गलत हो जाएगा। वीडियो या 3D जनरेशन की तुलना में एक एडिट की गई इमेज कैटलॉग में सबसे सस्ते सिरे पर आती है, और नए अकाउंट इसे टेस्ट करने के लिए फ्री क्रेडिट्स के साथ शुरू होते हैं। मौजूदा प्लान प्राइसिंग प्राइसिंग पेज पर रहती है, जो इस लेख में लिखे किसी नंबर से कहीं ज़्यादा सटीक बनी रहती है।
आपका चेहरा पहले से ही सबसे दिलचस्प हिस्सा है। Picasso IA टूलकिट खोलें, एक साफ फोटो अपलोड करें, और देखें कि बॉक्स के अंदर क्या नज़र आता है।