आँकड़ों और विज्ञापन के लिए कुकीज़
हम आँकड़ों और विज्ञापन के लिए कुकीज़ इस्तेमाल करते हैं, दोनों Google को जाती हैं। मना करने से आपको दिखने वाली किसी चीज़ में कोई फ़र्क़ नहीं पड़ता।निजता पेज पढ़ें
यहाँ आप HEIF को TXT में बदलते हैं, मुफ़्त और बिना खाते के: फ़ाइल ऊपर छोड़िए और कुछ ही सेकंड में नतीजा डाउनलोड के लिए तैयार मिलेगा। कन्वर्ज़न आपके अपने ब्राउज़र के भीतर होता है, इसलिए फ़ाइल कभी अपलोड नहीं होती। यह Windows, macOS और Linux पर वैसे ही चलता है जैसे iPhone और Android पर, और कनेक्शन काट देने पर भी चलता रहता है।
एक बार में 100 फ़ाइलें। फ़ॉर्मेट अलग-अलग हों तो भी चलेगा।
ये एक के बाद एक बदलती हैं और साथ में एक ZIP बनकर उतरती हैं।
HEIF से TXT
यह पेज एक desktop स्थिति के लिए लिखा गया है। तस्वीरें पहले से कंप्यूटर पर हैं — फ़ोन से कॉपी की गई, gallery से export की गई — और वे दृश्य नहीं, दस्तावेज़ हैं — invoice, meter reading, हाथ से लिखा नोट।
फ़ोन पर, operating system अक्सर तस्वीर में टेक्स्ट चुनने का विकल्प देता है और किसी वेबसाइट से तेज़ होता है। Desktop पर, इस फ़ॉर्मेट में, आम तौर पर कुछ नहीं होता — system thumbnail तक नहीं दिखा सकता।
Recognition engine जो फ़ाइल दी जाए वही पढ़ता है, बिना पहले कुछ डिकोड किए। यह जान-बूझकर है — तस्वीर को canvas से पहले गुज़ारना transparency को काला कर देता — इसका मतलब है सिर्फ़ छह image reader काम में हैं — BMP, JPEG, PNG, PBM, WebP और non-animated GIF।
तो काम एक की बजाय दो रूपांतरण का है। इस साइट पर HEIF को PNG में बदलिए, फिर उस PNG से टेक्स्ट पढ़िए। पहला चरण संभालने वाला decoder recognition engine से अलग सॉफ़्टवेयर है और यह सचमुच HEIF पढ़ता है।
इस साइट पर हर दूसरी जोड़ी या काम करती है या ज़ोर से विफल होती है। तस्वीर दूसरी तस्वीर बनती है, और अगर encoder नहीं कर पाता तो error मिलता है। Recognition अलग तरह का है — यह ऐसा टेक्स्ट लौटाता है जो टेक्स्ट जैसा ही दिखता है चाहे उसने पेज पर लिखा हुआ पकड़ा हो या नहीं।
तो आउटपुट एक पढ़ाई है, transcript नहीं, और इसे मूल के मुक़ाबले जाँचना ज़रूरी है। यह छोड़ने लायक़ disclaimer नहीं — यह इस जोड़ी का सबसे अहम operational तथ्य है।
चार मॉडल उपलब्ध हैं — English, German, French, Spanish। हर एक उस भाषा के letterforms और शब्दावली पर प्रशिक्षित है, और recognition सख़्ती से आपके चुने के भीतर ही काम करता है।
ग़लत चुनाव error नहीं देता। यह उस सेट में सबसे नज़दीकी मेल देता है जिसमें सही जवाब है ही नहीं, इसलिए टेक्स्ट सहज दिखने वाला और ग़लत होता है।
Recognition इस साइट पर सबसे धीमी चीज़ है, और पहली फ़ाइल पर ज़्यादातर इंतज़ार पढ़ने का नहीं — कई megabytes WebAssembly डाउनलोड और compile करने का है।
यह क़ीमत हर भाषा के लिए एक बार चुकती है और session भर के लिए बनी रहती है, और model आपके ब्राउज़र में बाद में cache हो जाता है।
Resolution शायद ही कभी समस्या है — बारह मेगापिक्सेल किसी अक्षर के लिए काफ़ी पिक्सेल देता है। ज्यामिति और रौशनी असली समस्याएँ हैं।
पेज को सपाट फ़ोटो खींचिए, कुर्सी से नहीं, सीधे ऊपर से, और रौशनी बग़ल से आने दीजिए ताकि आपकी अपनी परछाईं टेक्स्ट पर न पड़े। ये तीनों चीज़ें इस पेज की किसी भी सेटिंग से ज़्यादा नतीजा बदलती हैं।
आउटपुट सादा टेक्स्ट है — शब्द, पढ़ने के क्रम में, लाइन breaks के साथ। कोई कॉलम नहीं, कोई table cell नहीं, कोई headings नहीं, क्योंकि एक text file में इनके लिए जगह नहीं।
कोई letter या receipt इससे अच्छी तरह गुज़रता है। दो-कॉलम वाला पेज आपस में मिल जाता है, क्योंकि पहचानने वाला किसी भी लाइन जैसी दिखने वाली चीज़ के आर-पार पढ़ता है।
गद्य माफ़ करता है। किसी वाक्य में ग़लत पढ़ा अक्षर आम तौर पर स्पष्ट रूप से ग़लत लगता है। संख्याओं में यह redundancy नहीं है — किसी राशि, account reference या तारीख़ में ग़लत अंक बिल्कुल सही जैसा दिखता है।
चूँकि जिन दस्तावेज़ों की तस्वीर खींची जाती है वे अक्सर numeric तरह के होते हैं — invoices, receipts — उपयोगी आदत है टेक्स्ट को draft मानना और हर आँकड़े को तस्वीर के मुक़ाबले जाँचना।
तस्वीर कभी अपलोड नहीं होती। जान-बूझकर किए काम से यह भी सच है — recognition library अपना worker script, WebAssembly core और भाषा model किसी third-party CDN से मँगाती है जब तक हर path override न हो।
यह फ़र्क़ इससे ज़्यादा मायने रखता है जितना पहली नज़र में लगता है। तस्वीर वैसे भी कभी नहीं जाती, पर किसी payslip पढ़ने वाले को यह किसी content network को घोषित नहीं होना चाहिए।
Text file एक derivative है और कभी-कभी ग़लत हो सकती है, इसलिए मूल HEIF ही रिकॉर्ड है। यह यहाँ अपरिवर्तनीय भी है — यह साइट फ़ॉर्मेट पढ़ सकती है, लिख नहीं सकती।
अगर दस्तावेज़ मायने रखता है, दोनों रखिए, और तस्वीर को PDF में भी बदलने पर विचार कीजिए ताकि साथ में एक पढ़ने लायक़ पेज हो।
| HEIF | TXT | |
|---|---|---|
| पूरा नाम | High Efficiency Image File Format | सादा पाठ |
| फ़ाइल एक्सटेंशन | .heif | .txt, .text, .log |
| मीडिया टाइप | image/heif | text/plain |
| कंप्रेशन | नुक़सान के साथ — छोटा आकार गुणवत्ता देकर ख़रीदा जाता है | — |
| पहली बार प्रकाशित | 2015 | 1963 |
| प्रकाशक | MPEG | — |
| विनिर्देश | ISO/IEC 23008-12 | Unicode |
| लाइसेंस | प्रकाशित, मानकीकृत नहीं | खुला मानक |
| आज की स्थिति | मौजूदा | मौजूदा |
| बिट डेप्थ | 10 | — |
| रंग जो यह दर्ज कर सकता है | YCbCr, वाइड गैमट | — |
| ब्राउज़र में खुलता है | कुछ ब्राउज़र | हर ब्राउज़र |
| इसकी जगह विचारणीय | JPG, AVIF | MD, RTF |
TXT काम करने का फ़ॉर्मेट है और HEIF बनकर तैयार फ़ॉर्मेट। जो लौटता है वह पन्ने की तस्वीर नहीं बल्कि बदली जा सकने वाली लिखावट है — आम तौर पर यही इस कन्वर्ज़न की वजह होती है, और यही इसकी सीमा भी।
TXT को हर मौजूदा ब्राउज़र खोल लेता है। HEIF को इतने भी नहीं। अगर फ़ाइल किसी वेब पेज या किसी फ़ॉर्म तक जा रही है, तो आम तौर पर इस कन्वर्ज़न की पूरी वजह यही है।
नतीजा असली से बड़ा होगा और बेहतर नहीं। HEIF पहले ही बारीक़ी फेंक चुका है और TXT बचे हुए को बिना और फेंके सँभालता है: यह आगे का नुक़सान रोकता है, पहले वाला लौटाता नहीं।
दोनों का निशाना अलग काम है: HEIF का फ़ोन और फ़ोटोग्राफ़ी पर, TXT का प्रोग्रामों के बीच डेटा ले जाना और सहेजना पर। इस पर सोचना बनता है, क्योंकि जिस वजह से एक मौजूद है, आम तौर पर उसी वजह से दूसरा असुविधाजनक होता है।
HEIF MPEG का फ़ॉर्मेट है, जो 2015 में आया। यह हर चैनल पर 10 बिट में दर्ज करता है।
TXT 1963 से चला आ रहा है, और Unicode में तय किया गया है। Notepad, TextEdit और Visual Studio Code इस फ़ॉर्मेट को पढ़ लेते है।
TXT 1963 में आया और HEIF 2015 में। किसी को सौंपने के लिए आम तौर पर पुराना वाला ज़्यादा सुरक्षित रहता है; नया वाला वही काम कम बाइट में कर देता है।
नहीं। यह कन्वर्ज़न पूरी तरह आपके ब्राउज़र में होता है, इसलिए फ़ाइल आपके डिवाइस से बाहर नहीं जाती। आप ख़ुद जाँच सकते हैं: डेवलपर टूल्स का नेटवर्क टैब खोलिए और कुछ बदल कर देखिए। आपको पेज ख़ुद दिखेगा और आँकड़ों तथा विज्ञापन के वे अनुरोध दिखेंगे जिनसे इस सेवा का ख़र्च निकलता है — और एक भी ऐसा अनुरोध नहीं जो आपकी फ़ाइल साथ ले जा रहा हो। इस जोड़ी के पीछे libheif है, Apple के HEIC का संदर्भ डिकोडर; आपका ब्राउज़र इसे एक बार उतारता है और फिर सहेज कर रखता है।
हाँ। न खाता, न वॉटरमार्क, और न कोई रोज़ का कोटा जो ख़त्म हो: यह आपकी अपनी मशीन पर चलता है, इसलिए आप जितनी बार चाहें लौट सकते हैं। ब्राउज़र 100 MB तक की फ़ाइलें सँभालता है, एक बार में 100। libheif आपकी अपनी मशीन पर उतरता है और वहीं चलता है — इसीलिए उस पर कोई गिनती नहीं है।
HEIF और TXT सामग्री का वर्णन बुनियादी तौर पर अलग-अलग तरीक़ों से करते हैं। इसलिए यह कन्वर्ज़न नक़ल नहीं, पुनर्निर्माण है: ईमानदार, पर बाइट-दर-बाइट एक जैसा नहीं। लिखावट पैटर्न पहचान से पढ़ी जाती है, इसलिए यह सोच-समझकर लगाया अंदाज़ा है, नक़ल नहीं। साफ़, सीधी, ठीक रोशनी वाली छपाई अगर ठीक-ठाक रिज़ॉल्यूशन में हो तो लगभग सटीक निकलती है; टेढ़ी खींची फ़ोटो, धुँधला फ़ैक्स, अनोखा टाइपफ़ेस या हाथ की लिखावट ग़लतियाँ देंगे। भरोसा करने से पहले नतीजे को हमेशा असली के साथ मिलाकर पढ़िए। भाषा की सेटिंग मायने रखती है — ग़लत भाषा से पढ़ी गई लिखावट ग़लती के रूप में नहीं, आत्मविश्वास से भरी बकवास के रूप में लौटती है।
नतीजा असली से बड़ा होगा और बेहतर नहीं। HEIF पहले ही बारीक़ी फेंक चुका है और TXT बचे हुए को बिना और फेंके सँभालता है: यह आगे का नुक़सान रोकता है, पहले वाला लौटाता नहीं।
TXT काम करने का फ़ॉर्मेट है और HEIF बनकर तैयार फ़ॉर्मेट। जो लौटता है वह पन्ने की तस्वीर नहीं बल्कि बदली जा सकने वाली लिखावट है — आम तौर पर यही इस कन्वर्ज़न की वजह होती है, और यही इसकी सीमा भी।