अवलोकन
Granite Vision 3.3 2B एक संक्षिप्त विज़न-लैंग्वेज मॉडल है, जिसे दृश्य दस्तावेज़ों से संरचित जानकारी पढ़ने और निकालने के लिए बनाया गया है, और यह उस समस्या का समाधान करता है जिसे मानक पाठ उपकरण नहीं कर सकते: तालिकाओं, चार्टों, इन्फोग्राफिक्स, प्लॉटों और आरेखों को उपयोगी डेटा के रूप में समझना। कल्पना करें कि कोई वित्तीय विश्लेषक स्कैन की गई रिपोर्ट से तिमाही आँकड़े निकाल रहा है, या कोई शोधकर्ता बिना एक भी सेल हाथ से दोबारा टाइप किए किसी कार्यविधि आरेख का ट्रांसक्रिप्शन कर रहा है। Picasso IA पर, आप एक छवि अपलोड करते हैं और एक सरल भाषा वाला प्रश्न लिखते हैं, और मॉडल कुछ ही सेकंड में एक केंद्रित, पढ़ने योग्य उत्तर देता है। 2 बिलियन parameters पर, यह उस सटीकता से समझौता किए बिना तेज़ रहता है जिसकी दस्तावेज़ निष्कर्षण कार्यों को आवश्यकता होती है।
यह कैसे काम करता है
- एक या अधिक दस्तावेज़ छवियाँ अपलोड करें: स्कैन किए गए पृष्ठ, चार्ट स्क्रीनशॉट, प्रेज़ेंटेशन स्लाइड्स, या आरेख निर्यात
- ठीक वही वर्णन करते हुए एक prompt लिखें जिसकी आपको आवश्यकता है, जैसे "इस बार चार्ट में डेटा का सारांश दें" या "इस पृष्ठ की तालिका से सभी पंक्ति मान निकालें"
- प्रतिक्रिया संरचना को नियंत्रित करने के लिए वैकल्पिक रूप से एक system prompt जोड़ें, उदाहरण के लिए JSON output, क्रमांकित सूची, या markdown तालिका का अनुरोध करें
- यदि आपको अधिक सटीक तथ्यात्मक उत्तर या लंबी स्वरूपित प्रतिक्रियाएँ चाहिए, तो temperature और max tokens समायोजित करें
- जमा करें और निकाली गई सामग्री या संरचित उत्तर कुछ ही सेकंड में output panel में प्राप्त करें
अक्सर पूछे जाने वाले प्रश्न
क्या इसे उपयोग करने के लिए मुझे प्रोग्रामिंग कौशल या तकनीकी ज्ञान की आवश्यकता है?
नहीं, बस Picasso IA पर Granite Vision 3.3 2B खोलें, अपनी इच्छित settings समायोजित करें, और generate पर क्लिक करें।
क्या इसे आज़माना निःशुल्क है?
हाँ, आप बिना किसी अग्रिम लागत के Granite Vision 3.3 2B चला सकते हैं। generation credits कैसे काम करते हैं, इसके विवरण के लिए Picasso IA पर pricing अनुभाग देखें।
परिणाम पाने में कितना समय लगता है?
अधिकांश अनुरोध कुछ ही सेकंड में वापस आ जाते हैं। processing time छवि की जटिलता और आपके द्वारा अनुरोधित output की लंबाई पर निर्भर करता है, लेकिन 2B parameter size बड़े vision models की तुलना में चीज़ों को तेज़ बनाए रखता है।
यह किस प्रकार की छवियों के लिए सबसे अच्छा काम करता है?
यह तालिकाओं, bar charts, pie charts, इन्फोग्राफिक्स, तकनीकी आरेखों, scatter plots, और text-heavy slides पर अच्छा प्रदर्शन करता है। यह साफ़ डिजिटल छवियों और मध्यम रूप से संपीड़ित स्कैन दोनों के साथ काम करता है।
मैं किन output formats को प्राप्त कर सकता हूँ?
मॉडल डिफ़ॉल्ट रूप से सादा पाठ लौटाता है। आप अपने prompt के माध्यम से स्वरूप तय कर सकते हैं: markdown table, JSON object, क्रमांकित सूची, या छोटा पैराग्राफ माँगें, और यह आपके वर्णन की गई संरचना से मेल खाएगा।
क्या मैं एक अनुरोध में कई छवियाँ भेज सकता हूँ?
हाँ। मॉडल image inputs की एक array स्वीकार करता है, इसलिए आप एक साथ कई दस्तावेज़ पृष्ठ डाल सकते हैं और एक ही generation में उन पर आधारित प्रश्न पूछ सकते हैं।
यदि output में कोई विवरण छूट जाए या कुछ गलत हो जाए तो क्या होगा?
अपने prompt को अधिक विशिष्ट बनाने के लिए उसे फिर से लिखने की कोशिश करें कि आपको क्या निकालना है। temperature setting को 0 के करीब कम करने से आमतौर पर संरचित डेटा के साथ काम करते समय अधिक सटीक, तथ्य-केंद्रित उत्तर मिलते हैं।