टेढ़े-मेढ़े स्कैन भी समझेगा एआई: Sarvam ने लॉन्च किया Vision 2.1, उलझे कागजात से सेकंड्स में कैसे निकालेगा डेटा?


 भारतीय एआई स्टार्टअप Sarvam AI ने अपने विजन-लैंग्वेज मॉडल का नया वर्जन Sarvam Vision 2.1 लॉन्च किया है। कंपनी के मुताबिक, यह मॉडल डॉक्यूमेंट पढ़ने और उनसे जरूरी जानकारी निकालने की क्षमता को बेहतर बनाता है। खास तौर पर अव्यवस्थित स्कैन, जटिल फॉर्म, टेबल और भारतीय भाषाओं में लिखे हाथ से लिखे टेक्स्ट को डिजिटल और स्ट्रक्चर्ड डेटा में बदलने पर जोर दिया गया है।

Vision 2.1 को ऐसे समय पेश किया गया है, जब सरकारी संस्थानों से लेकर बैंक, बीमा कंपनियां और बड़े कारोबार बड़ी संख्या में कागजी दस्तावेजों को डिजिटल करने की कोशिश कर रहे हैं। पुराने रिकॉर्ड में कई बार स्कैन की गुणवत्ता खराब होती है, फॉर्म का लेआउट जटिल होता है या जानकारी अलग-अलग जगहों पर बिखरी होती है। ऐसे दस्तावेजों को मैन्युअली पढ़कर डेटा तैयार करने में काफी समय और मेहनत लग सकती है।

टेढ़े-मेढ़े स्कैन को कैसे समझेगा AI?

Sarvam Vision 2.1 सिर्फ तस्वीर में मौजूद अक्षरों को पढ़ने तक सीमित नहीं है। इसका उद्देश्य दस्तावेज की संरचना को समझना भी है। यानी किसी फॉर्म में कौन-सा टेक्स्ट किस खाने से जुड़ा है, टेबल में कौन-सी जानकारी किस कॉलम में है और दस्तावेज में कंटेंट किस क्रम में रखा गया है—मॉडल इन चीजों को समझकर डेटा निकालने में मदद करता है।

कंपनी के मुताबिक, नया मॉडल अनस्ट्रक्चर्ड स्कैन को साफ और उपयोगी स्ट्रक्चर्ड डेटा में बदलने के लिए तैयार किया गया है। इससे कंपनियां निकाली गई जानकारी को अपने डिजिटल वर्कफ्लो में सीधे इस्तेमाल कर सकती हैं।

हाथ से लिखे भारतीय भाषाओं के नोट्स भी पढ़ेगा

Vision 2.1 के प्रमुख अपग्रेड में Indic handwritten recognition शामिल है। इसका मतलब है कि भारतीय भाषाओं में हाथ से लिखी गई जानकारी को पहचानने की क्षमता को बेहतर किया गया है। यह सुविधा ऐसे दस्तावेजों के लिए उपयोगी हो सकती है, जिनमें मशीन से टाइप किया हुआ टेक्स्ट नहीं बल्कि हाथ से भरी गई जानकारी मौजूद हो।

Sarvam Vision की मौजूदा डॉक्यूमेंट डिजिटाइजेशन क्षमता 22 भारतीय भाषाओं और अंग्रेजी सहित कुल 23 भाषाओं तक उपलब्ध है।

टेबल और फॉर्म से डेटा निकालना आसान

नए मॉडल में जटिल टेबल और स्ट्रक्चर्ड फॉर्म को समझने की क्षमता पर भी काम किया गया है। उदाहरण के लिए किसी आवेदन फॉर्म में नाम, पता, मोबाइल नंबर और अन्य विवरण अलग-अलग बॉक्स में दिए गए हों तो AI उन्हें पहचानकर व्यवस्थित डेटा के रूप में प्रस्तुत करने में मदद कर सकता है।

इसका इस्तेमाल बैंकिंग, बीमा, सरकारी दस्तावेज, आवेदन फॉर्म और पुराने रिकॉर्ड को डिजिटल करने जैसे कामों में किया जा सकता है।

पुराने वर्जन से कितना बेहतर?

Sarvam के अनुसार Vision 2.1 को पिछले वर्जन से मिले फीडबैक के आधार पर तैयार किया गया है। कंपनी ने मॉडल की क्षमताओं के साथ उसकी inference speed और usability को भी बेहतर करने पर काम किया है। कंपनी ने इसे डॉक्यूमेंट इंटेलिजेंस के लिए नए बेंचमार्क पर बेहतर प्रदर्शन करने वाला मॉडल बताया है।

हालांकि, AI से निकाले गए डेटा में भी गलती की संभावना पूरी तरह खत्म नहीं होती। खासकर बेहद खराब स्कैन, अस्पष्ट लिखावट या क्षतिग्रस्त दस्तावेजों में मानव सत्यापन की जरूरत बनी रह सकती है। इसके बावजूद Vision 2.1 भारतीय भाषाओं और जटिल दस्तावेजों को डिजिटल डेटा में बदलने की प्रक्रिया को तेज करने की दिशा में एक महत्वपूर्ण तकनीकी अपडेट है।

एक टिप्पणी भेजें

0 टिप्पणियाँ