Convertir Parquet en XLSX

Vous pouvez convertir Parquet en XLSX gratuitement et sans compte : déposez le fichier ci-dessus et, une ou deux secondes plus tard, le résultat est prêt à télécharger. La conversion se fait dans votre propre navigateur : le fichier n’est donc jamais téléversé. Cela marche sous Windows, macOS et Linux comme sur iPhone et Android, et continue de marcher si vous coupez le réseau.

  • Où cela s’exécute Dans votre navigateur. Le fichier n’est pas téléversé.
  • Sans perte Rien ne se perd. XLSX contient exactement ce que contenait Parquet.
  • Limite de taille Jusqu’à 100 Mo par fichier, gratuitement et sans compte.

Jusqu’à 100 fichiers à la fois. Les formats mélangés ne posent pas de problème.

Le fichier envoyé par l’équipe données qui ne s’ouvre pas

Un fichier .parquet qui arrive dans une boîte de réception est un petit échec de traduction. C’est le format standard à l’intérieur d’une plateforme de données — compact, typé, rapide à requêter — et ce n’est pas un format qu’une application bureautique traite comme le sien. Il n’y a pas de route Fichier, Ouvrir pour lui dans Excel, et ce que le connecteur Power Query accepte dépend de la version et de la licence que vous avez sous la main.

Demander un export différent est souvent la bonne réponse et n’est pas toujours disponible : la personne qui l’a envoyé est peut-être dans un autre fuseau, le pipeline n’écrit peut-être que du Parquet, ou le fichier est l’artefact d’un job déjà terminé. Le convertir vous-même prend un instant et n’exige rien d’installé.

Ce qu’un classeur garde et qu’un CSV aurait jeté

C’est la raison de convertir en XLSX plutôt qu’en CSV, et c’est une vraie différence plutôt qu’une préférence. Un fichier Parquet enregistre le type de chaque colonne. Un CSV n’enregistre rien, donc chaque valeur devient du texte et Excel applique sa propre interprétation à l’importation — c’est là que les identifiants deviennent des nombres et les codes deviennent des dates.

Une cellule de classeur porte son type. Les colonnes numériques arrivent en cellules numériques et les colonnes booléennes en cellules booléennes, donc une somme marche au premier clic, un filtre propose une plage numérique plutôt qu’une liste de chaînes, et un tableau croisé dynamique traite la colonne de montant comme un montant. Rien n’a été ré-inféré depuis des caractères, parce que les valeurs ne sont jamais devenues des caractères en chemin.

Les dates arrivent en texte ISO, et les transformer en dates

Les horodatages sont l’exception. Une colonne d’horodatage est écrite comme une chaîne ISO 8601 — `2024-03-11T09:30:00.000Z` — et arrive dans une cellule texte, donc elle triera correctement en texte mais ne répondra pas à l’arithmétique de date et n’alimentera pas un filtre de date dans un tableau croisé dynamique.

La transformer est une opération connue et prend environ dix secondes par colonne : sélectionnez la colonne, Données, Convertir, Suivant, Suivant, et à l’étape finale choisissez Date avec AMJ comme ordre. Excel parse alors la valeur en une vraie date. La raison pour laquelle la conversion ne le fait pas pour vous est que le fuseau horaire et le format d’affichage sont des décisions de présentation, et les prendre dans Excel — où vous voyez le résultat — est mieux que les prendre silencieusement dans un fichier.

Le plafond du million de lignes, et quoi faire quand vous l’atteignez

Une feuille de calcul contient 1 048 576 lignes en incluant l’en-tête, et 16 384 colonnes. C’est une limite du format tableur lui-même, donc aucun convertisseur ne peut l’excéder et aucune version d’Excel ne vous montrera les lignes au-delà.

Les fichiers Parquet en contiennent régulièrement davantage, parce que le format existe pour des tables qu’un tableur ne peut pas contenir. Quand l’extrait dépasse la limite, la réponse honnête est qu’il faut le filtrer ou l’agréger d’abord, et la personne qui l’a produit peut le faire bien plus économiquement que vous. Demandez les lignes d’un mois, ou les totaux par catégorie, plutôt qu’un fichier plus gros — une question posée en amont transforme souvent un million de lignes en quelques milliers qui y répondent mieux.

Les identifiants longs arrivent en texte, délibérément

Parquet a un type entier 64 bits, et un tableur contient environ quinze chiffres significatifs. Une valeur au-delà de ce qui peut être représenté exactement est écrite dans la cellule comme du texte plutôt que comme un nombre qui a été arrondi.

C’est la bonne approche même si cela paraît incohérent à côté des autres colonnes numériques. Une référence de commande ou un identifiant de transaction qui a été arrondi ressemble encore à un identifiant valide, ne correspond à rien, et est très difficile à remonter jusqu’à la source ; la même valeur dans une cellule texte alignée à gauche est manifestement du texte et correcte. Si une colonne de grands nombres apparaît alignée à gauche dans le classeur, c’est ce que cela signifie, et elle devrait rester en texte plutôt que d’être convertie en nombre pour faire joli.

Les colonnes de liste et de structure atterrissent en JSON dans une cellule

Parquet peut contenir une liste, une structure ou une map dans une seule colonne. Une cellule de tableur contient une valeur, donc ces colonnes sont écrites en texte JSON : une liste apparaît comme `["a","b"]` dans une cellule et une structure comme un objet avec les noms de ses membres.

C’est lisible et c’est inexploitable. Il n’y a pas de formule qui la traitera comme des données sans une bonne dose de manipulation de texte, et un tableau croisé dynamique y voit une longue chaîne. Si ces colonnes comptent pour l’analyse, la correction appartient à la source : demandez à les voir aplaties en colonnes séparées dans l’export, ce qui est un changement d’une ligne dans la requête qui a produit le fichier et transforme une cellule inutilisable en trois utilisables.

Une feuille, nommée d’après le fichier Parquet

Un fichier Parquet contient exactement une table avec un schéma, donc le classeur a une feuille. Elle tire son nom du fichier sans l’extension, ramené aux trente et un caractères qu’un nom de feuille autorise, ce qui veut dire qu’un long nom généré est tronqué plutôt que refusé.

Les noms de colonnes arrivent tels que le pied de page les avait enregistrés, y compris les soulignements, préfixes ou segments en forme de chemin qu’un pipeline de données leur a donnés. Ce ne sont souvent pas les noms que quiconque choisirait pour un rapport, et les renommer dans la première ligne est la première étape normale. Le faire dans le classeur est plus sûr que de demander un export renommé, parce que les noms d’origine sont ceux que l’équipe données utilisera quand vous reviendrez avec une question.

Combien le classeur est plus gros que l’extrait

Considérablement. Parquet stocke les valeurs en binaire, compresse chaque colonne séparément, et garde une valeur répétée une seule fois avec de petites références vers elle ; un tableur stocke une cellule par valeur avec ses propres type et style, à l’intérieur d’un ZIP de XML.

Un fichier Parquet modeste produit donc un classeur plusieurs fois plus gros, parfois bien plus quand les colonnes sont très répétitives — celles qui se compressaient le mieux en entrée sont celles qui se déploient le plus en sortie. Cela vaut la peine de vérifier le nombre de lignes avant de convertir un fichier que vous n’avez pas regardé, parce que la table déployée est gardée en mémoire pendant que le classeur est construit et le plafond arrive plus vite que la taille sur disque ne le suggère.

Rien n’est téléversé pour l’ouvrir

Le lecteur Parquet et l’écriture tableur sont tous deux des bibliothèques chargées à la demande par cette page, et la conversion y tourne. Aucune requête ne transporte le fichier, donc un extrait qui n’a pas encore été agrégé ou masqué ne devient pas une copie sur le serveur d’un tiers parce que quelqu’un avait besoin de le regarder dans Excel.

C’est généralement la contrainte qui décide si un convertisseur en ligne peut être utilisé pour cette paire. Un fichier Parquet issu d’une plateforme de données est normalement plus proche de la table brute que d’un rapport, et en téléverser un est précisément ce qu’une politique de traitement des données existe pour empêcher.

Quand demander un autre export à la place

Si l’analyse doit être répétée chaque semaine, demandez au pipeline d’écrire directement un XLSX ou un CSV. Convertir à la main à chaque fois est une étape qui finira par être oubliée, et un export planifié est un changement de deux lignes à l’autre bout.

Si la question est un seul nombre — un total, un compte, une comparaison entre deux mois — demander la réponse est plus rapide que demander les données, et la personne qui a le moteur de requête peut la produire en quelques secondes. Convertissez le fichier quand vous avez vraiment besoin des lignes devant vous : pour vérifier un échantillon, pour construire un modèle par-dessus, ou parce que la prochaine chose qui doit se passer est un tableur de toute façon.

Comment convertir Parquet en XLSX

  1. Déposez votre fichier Parquet sur cette page, ou cliquez pour en choisir un.
  2. Choisissez XLSX comme destination. La conversion se fait dans votre navigateur et le fichier n’est pas téléversé.
  3. Téléchargez le fichier XLSX terminé.

Parquet et XLSX : ce qui change

Parquet face à XLSX
ParquetXLSX
Nom completApache ParquetClasseur Excel
Extension de fichier.parquet.xlsx
Type de médiaapplication/vnd.apache.parquetapplication/vnd.openxmlformats-officedocument.spreadsheetml.sheet
CompressionSans perte — rien n’est écarté
Première publication20132007
Publié parApache Software FoundationMicrosoft
SpécificationECMA-376
LicenceStandard ouvertStandard ouvert
Situation actuelleActuelActuel
S’ouvre dans un navigateurAucun navigateurAucun navigateur
Envisagé à la placeCSV, JSONCSV, ODS

Ce que le format cible apporte

XLSX est un format de travail, Parquet un format fini. Ce qui revient est du texte modifiable plutôt qu’une image de la page — c’est en général la raison de la conversion, et aussi sa limite.

Ouvrir le résultat

Les logiciels habituels ne se recoupent pas : Parquet s’ouvre dans pandas, Apache Spark et DuckDB, XLSX dans Microsoft Excel, LibreOffice Calc et Google Sheets — celui qui reçoit le résultat a donc besoin d’un logiciel de la seconde liste.

À quoi sert chaque format

Les deux visent des usages différents : Parquet l’archivage et l’échange entre programmes, XLSX la retouche. Cela mérite d’être pesé avant, car ce qui justifie l’un est souvent ce qui rend l’autre malcommode.

XLSX vient de Microsoft et date de 2007, décrit par ECMA-376. Microsoft Excel, LibreOffice Calc et Google Sheets le lisent.

De Parquet à XLSX : questions fréquentes

Mon fichier Parquet est-il téléversé quelque part ?

Non. Cette conversion se fait entièrement dans votre navigateur : le fichier ne quitte donc pas votre appareil. Vous pouvez le vérifier vous-même — ouvrez l’onglet réseau des outils de développement et convertissez quelque chose. Vous verrez la page elle-même et les requêtes de statistiques et de publicité qui financent ce service, et pas une seule qui transporte votre fichier. Le moteur de cette paire précise est parquet-wasm, une version WebAssembly du lecteur Apache Arrow ; votre navigateur le télécharge une fois puis le garde en cache.

Convertir Parquet en XLSX est-il gratuit ?

Oui. Pas de compte, pas de filigrane et pas de quota journalier à dépenser : cela tourne sur votre propre machine, vous pouvez donc revenir autant de fois que vous voulez. Le navigateur traite des fichiers jusqu’à 100 Mo, 100 à la fois. parquet-wasm est téléchargé sur votre machine et s’y exécute, et c’est pourquoi rien n’est compté.

Y a-t-il une perte de qualité en convertissant Parquet en XLSX ?

Non. XLSX enregistre le même contenu sans rien jeter : le résultat est identique en qualité à l’original.

Le fichier XLSX est-il modifiable ensuite ?

XLSX est un format de travail, Parquet un format fini. Ce qui revient est du texte modifiable plutôt qu’une image de la page — c’est en général la raison de la conversion, et aussi sa limite.

En savoir plus sur ces formats