आँकड़ों और विज्ञापन के लिए कुकीज़
हम आँकड़ों और विज्ञापन के लिए कुकीज़ इस्तेमाल करते हैं, दोनों Google को जाती हैं। मना करने से आपको दिखने वाली किसी चीज़ में कोई फ़र्क़ नहीं पड़ता।निजता पेज पढ़ें
यहाँ आप Parquet को CSV में बदलते हैं, मुफ़्त और बिना खाते के: फ़ाइल ऊपर छोड़िए और कुछ ही सेकंड में नतीजा डाउनलोड के लिए तैयार मिलेगा। कन्वर्ज़न आपके अपने ब्राउज़र के भीतर होता है, इसलिए फ़ाइल कभी अपलोड नहीं होती। यह Windows, macOS और Linux पर वैसे ही चलता है जैसे iPhone और Android पर, और कनेक्शन काट देने पर भी चलता रहता है।
एक बार में 100 फ़ाइलें। फ़ॉर्मेट अलग-अलग हों तो भी चलेगा।
ये एक के बाद एक बदलती हैं और साथ में एक ZIP बनकर उतरती हैं।
Parquet से CSV
Parquet डेटा-इंजीनियरिंग पाइपलाइन का फ़ॉर्मेट है — कॉलम-आधारित, संपीड़ित, बड़े डेटासेट के लिए बना। CSV वह फ़ॉर्मेट है जो कोई भी स्प्रेडशीट, कोई भी टेक्स्ट-एडिटर खोल सकता है। यह बदलाव डेटा को उस अंतिम, सबसे आसानी से पढ़े जाने वाले रूप में लाता है।
यह उन एनालिस्ट या मैनेजर के लिए काम आता है जिन्हें डेटा-इंजीनियर की Parquet फ़ाइल Excel में खोलनी है, बिना किसी अलग टूल के।
Parquet पढ़ते वक़्त हर कॉलम का टाइप सामान्यीकृत किया जाता है — INT64 संख्या बन जाता है, या 2^53 से बड़ा हो तो टेक्स्ट स्ट्रिंग; Date एक ISO टेक्स्ट बनता है; बाइनरी डेटा लोअरकेस हेक्स में आता है; नेस्टेड डेटा JSON टेक्स्ट बनकर आता है।
यानी Parquet का असली स्कीमा CSV में सीधे नहीं दोहराया जाता — जो निकलता है वह डेटा का एक सामान्यीकृत, टेक्स्ट-आधारित रूप है।
जावास्क्रिप्ट का सुरक्षित पूर्णांक-दायरा 2^53 पर ख़त्म होता है — इससे बड़ा कोई INT64 मान संख्या के बजाय टेक्स्ट स्ट्रिंग के तौर पर आता है, ताकि सटीकता खोए बिना उसे दिखाया जा सके।
बड़े ID या 64-बिट काउंटर वाले डेटासेट के लिए यह जान लेना ज़रूरी है — CSV खोलने पर वे मान टेक्स्ट जैसे दिख सकते हैं, संख्या जैसे नहीं, ख़ासकर अगर स्प्रेडशीट सॉफ़्टवेयर उन्हें दोबारा टाइप करने की कोशिश करे।
अगर Parquet के किसी कॉलम में नेस्टेड ऑब्जेक्ट या ऐरे हो, तो वह CSV सेल में JSON टेक्स्ट के तौर पर आता है — CSV ख़ुद नेस्टेड ढाँचा रख ही नहीं सकता, इसलिए यह सबसे व्यावहारिक तरीक़ा है।
ऐसे कॉलम को Excel में सीधे पढ़ना मुश्किल हो सकता है — अगर नेस्टेड डेटा को अलग कॉलम में तोड़ना है, तो JSON-से-CSV वाला अलग बदलाव इस्तेमाल करना बेहतर रहेगा।
Parquet का Date टाइप CSV में हमेशा ISO फ़ॉर्मेट टेक्स्ट के तौर पर लिखा जाता है — जैसे 2026-03-15। यह ज़्यादातर स्प्रेडशीट सॉफ़्टवेयर तुरंत तारीख़ के तौर पर पहचान लेते हैं, पर कुछ मामलों में हाथ से कॉलम-फ़ॉर्मेट सेट करना पड़ सकता है।
समय-क्षेत्र की जानकारी अगर Parquet में मौजूद थी, तो वह ISO स्ट्रिंग के हिस्से के तौर पर बरक़रार रहती है।
CSV में कॉलम उसी क्रम में आते हैं जिस क्रम में Parquet की स्कीमा में थे, और पंक्तियाँ मूल क्रम में रहती हैं — कुछ भी वर्णानुक्रम में नहीं सजाया जाता।
हेडर पंक्ति में कॉलम के नाम वही रहते हैं जो Parquet फ़ाइल में दर्ज थे।
पूरा बदलाव ब्राउज़र में होता है — फ़ाइल कहीं भेजी नहीं जाती, नेटवर्क टैब खोलकर यह जाँचा भी जा सकता है। एक साथ 100 फ़ाइलें तक बदली जा सकती हैं, हर फ़ाइल पर 100 मेगाबाइट की सीमा है।
बड़े डेटासेट के लिए भी यही सीमा लागू होती है, क्योंकि यह पूरी तरह क्लाइंट-साइड कन्वर्ज़न है।
| Parquet | CSV | |
|---|---|---|
| पूरा नाम | Apache Parquet | Comma-Separated Values |
| फ़ाइल एक्सटेंशन | .parquet | .csv |
| मीडिया टाइप | application/vnd.apache.parquet | text/csv |
| कंप्रेशन | बिना नुक़सान — कुछ छोड़ा नहीं जाता | — |
| पहली बार प्रकाशित | 2013 | 1972 |
| प्रकाशक | Apache Software Foundation | — |
| विनिर्देश | — | RFC 4180 |
| लाइसेंस | खुला मानक | खुला मानक |
| आज की स्थिति | मौजूदा | मौजूदा |
| ब्राउज़र में खुलता है | कोई ब्राउज़र नहीं | कोई ब्राउज़र नहीं |
| इसकी जगह विचारणीय | JSON | XLSX, JSON |
कुछ नहीं खोता। Parquet और CSV — दोनों अपनी सामग्री बिना नुक़सान सँभालते हैं: यह कन्वर्ज़न पैकिंग बदलता है, गुणवत्ता नहीं, और आप इसे दोहरा सकते हैं बिना इस डर के कि नुक़सान जमा होता जाएगा।
CSV काम करने का फ़ॉर्मेट है और Parquet बनकर तैयार फ़ॉर्मेट। जो लौटता है वह पन्ने की तस्वीर नहीं बल्कि बदली जा सकने वाली लिखावट है — आम तौर पर यही इस कन्वर्ज़न की वजह होती है, और यही इसकी सीमा भी।
pandas Parquet और CSV — दोनों पढ़ लेता है, इसलिए आप नतीजे को असली फ़ाइल के बग़ल में रखकर देख सकते हैं, बिना दूसरा प्रोग्राम खोले।
CSV 1972 से चला आ रहा है, और RFC 4180 में तय किया गया है। Microsoft Excel, LibreOffice Calc और pandas इस फ़ॉर्मेट को पढ़ लेते है।
CSV 1972 में आया और Parquet 2013 में। किसी को सौंपने के लिए आम तौर पर पुराना वाला ज़्यादा सुरक्षित रहता है; नया वाला वही काम कम बाइट में कर देता है।
नहीं। यह कन्वर्ज़न पूरी तरह आपके ब्राउज़र में होता है, इसलिए फ़ाइल आपके डिवाइस से बाहर नहीं जाती। आप ख़ुद जाँच सकते हैं: डेवलपर टूल्स का नेटवर्क टैब खोलिए और कुछ बदल कर देखिए। आपको पेज ख़ुद दिखेगा और आँकड़ों तथा विज्ञापन के वे अनुरोध दिखेंगे जिनसे इस सेवा का ख़र्च निकलता है — और एक भी ऐसा अनुरोध नहीं जो आपकी फ़ाइल साथ ले जा रहा हो। इस जोड़ी के पीछे parquet-wasm है, Apache Arrow के पाठक का एक WebAssembly संस्करण; आपका ब्राउज़र इसे एक बार उतारता है और फिर सहेज कर रखता है।
हाँ। न खाता, न वॉटरमार्क, और न कोई रोज़ का कोटा जो ख़त्म हो: यह आपकी अपनी मशीन पर चलता है, इसलिए आप जितनी बार चाहें लौट सकते हैं। ब्राउज़र 100 MB तक की फ़ाइलें सँभालता है, एक बार में 100। parquet-wasm आपकी अपनी मशीन पर उतरता है और वहीं चलता है — इसीलिए उस पर कोई गिनती नहीं है।
नहीं। CSV वही सामग्री बिना कुछ फेंके सँभालता है: नतीजा गुणवत्ता में असली फ़ाइल जैसा ही होता है।
कुछ नहीं खोता। Parquet और CSV — दोनों अपनी सामग्री बिना नुक़सान सँभालते हैं: यह कन्वर्ज़न पैकिंग बदलता है, गुणवत्ता नहीं, और आप इसे दोहरा सकते हैं बिना इस डर के कि नुक़सान जमा होता जाएगा।
CSV काम करने का फ़ॉर्मेट है और Parquet बनकर तैयार फ़ॉर्मेट। जो लौटता है वह पन्ने की तस्वीर नहीं बल्कि बदली जा सकने वाली लिखावट है — आम तौर पर यही इस कन्वर्ज़न की वजह होती है, और यही इसकी सीमा भी।