अवलोकन
Granite Vision 4.1 4B एक विज़न-भाषा मॉडल है, जिसे बिना किसी मैन्युअल कॉपीिंग या पुनःस्वरूपण के जटिल दस्तावेज़ों से संरचित डेटा निकालने के लिए बनाया गया है। यदि आपने कभी PDF से तालिकाएँ दोबारा टाइप करने, संख्याएँ पढ़ने के लिए चार्ट अक्षों को ध्यान से देखने, या स्कैन की गई इनवॉइस से key-value युग्मों को जोड़ने में समय बिताया है, तो यह मॉडल वह काम सेकंडों में संभाल लेता है। Picasso IA पर, प्रक्रिया तीन चरणों में होती है: दस्तावेज़ छवि अपलोड करें, अपनी आवश्यकता बताएं, और परिणाम पढ़ें। 4 billion parameters पर, यह उन दस्तावेज़ प्रकारों पर अपनी सटीकता बनाए रखते हुए तेज़ी से उत्तर देने के लिए पर्याप्त कॉम्पैक्ट है, जिनके लिए इसे विशेष रूप से बनाया गया था, जिसमें चार्ट, तालिकाएँ, और संरचित फ़ॉर्म शामिल हैं।
यह कैसे काम करता है
- एक या अधिक दस्तावेज़ छवियाँ अपलोड करें, जैसे PDF पृष्ठ का स्क्रीनशॉट, मुद्रित तालिका की तस्वीर, या स्लाइड डेक से निर्यात किया गया चार्ट
- अपने इच्छित डेटा का वर्णन करने वाला prompt लिखें, उदाहरण के लिए "राजस्व तालिका से सभी पंक्तियाँ निकालें" या "इस इनवॉइस के प्रत्येक फ़ील्ड से key और value लौटाएँ"
- वैकल्पिक रूप से आउटपुट फ़ॉर्मैट परिभाषित करने के लिए system prompt लिखें, जैसे JSON, कॉमा से अलग किए गए मान, या लेबलयुक्त सादा पाठ
- मॉडल छवि पढ़ता है और आपकी माँग के अनुसार संरचित पाठ प्रतिक्रिया लौटाता है
- परिणाम कॉपी करें और उसे सीधे अपनी स्प्रेडशीट, डेटाबेस, या रिपोर्ट में पेस्ट करें
अक्सर पूछे जाने वाले प्रश्न
क्या इसका उपयोग करने के लिए मुझे प्रोग्रामिंग कौशल या तकनीकी ज्ञान चाहिए?
नहीं, बस Picasso IA पर Granite Vision 4.1 4B खोलें, अपनी इच्छित सेटिंग्स समायोजित करें, और generate दबाएँ।
क्या इसे आज़माना निःशुल्क है?
हाँ, आप अपने दस्तावेज़ों पर पहले परीक्षण करने के लिए Picasso IA पर बिना paid subscription के मॉडल चला सकते हैं।
परिणाम प्राप्त करने में कितना समय लगता है?
अधिकांश निष्कर्षण कुछ सेकंडों में पूरे हो जाते हैं। 4 billion parameter आकार को आंशिक रूप से गति के लिए चुना गया था, इसलिए विस्तृत दस्तावेज़ों पर भी आपको लंबा इंतज़ार नहीं करना पड़ता।
यह किन प्रकार के दस्तावेज़ों पर अच्छी तरह काम करता है?
यह मुद्रित डेटा तालिकाओं, वित्तीय चार्टों, इनवॉइस, संरचित फ़ॉर्मों, और किसी भी ऐसी छवि पर भरोसेमंद रूप से काम करता है जहाँ जानकारी एक सुसंगत लेआउट में व्यवस्थित हो। अत्यधिक क्षतिग्रस्त स्कैन या बहुत घनी हस्तलिखित पृष्ठ सटीकता कम कर सकते हैं।
क्या मैं आउटपुट किस फ़ॉर्मैट में आए, इसे नियंत्रित कर सकता हूँ?
हाँ। फ़ॉर्मैट को अपने system prompt में या prompt के भीतर निर्दिष्ट करें। JSON, क्रमांकित पंक्तियाँ, लेबलयुक्त सादा पाठ, या किसी अन्य संरचना के लिए कहें, और मॉडल उन निर्देशों का निरंतर पालन करेगा।
मैं मॉडल को कितनी बार चला सकता हूँ?
आप जितने निष्कर्षण चाहते हैं, उतने चला सकते हैं। प्रत्येक अनुरोध स्वतंत्र रूप से संसाधित होता है, इसलिए आप उसी दस्तावेज़ पर अलग-अलग prompt आज़मा सकते हैं जब तक कि आउटपुट आपकी अपेक्षा के अनुसार न हो जाए।
मॉडल जो लौटाता है, उसे मैं कहाँ उपयोग कर सकता हूँ?
पाठ आउटपुट सादा है और किसी भी टूल में पेस्ट करने के लिए तैयार है, स्प्रेडशीट से लेकर प्रोजेक्ट प्रबंधन ऐप तक। मॉडल जो उत्पन्न करता है, उस पर कोई watermark या फ़ॉर्मैट प्रतिबंध नहीं हैं।