DT Data Tools

Visualizzatore Parquet — Apri file Parquet online, in privato

Visualizza file Apache Parquet nel browser: schema, tipi di colonna, numero di righe e righe paginate. Esporta Parquet in CSV o JSON senza caricare nulla.

🔒 Funziona interamente nel tuo browser — nulla viene caricato

Drop a .parquet file here or click to browse

Opened locally with DuckDB-wasm. Nothing is uploaded.

The DuckDB engine (about 35 MB) downloads from this site on first use, then runs offline in your browser.

Advertisement

Un modo rapido per guardare dentro i file Parquet

Apache Parquet è il formato di archiviazione predefinito per data lake, job Spark, export di pandas e molte pipeline di analisi. È compatto e veloce, ma è un formato binario colonnare, quindi non puoi aprirlo in un editor di testo o in un foglio di calcolo. Questo Visualizzatore Parquet apre un file .parquet direttamente nel browser e mostra cosa contiene: i nomi e i tipi delle colonne, il numero totale di righe, il numero di row group, la libreria che ha scritto il file e una tabella paginata con i dati effettivi.

Dietro le quinte lo strumento usa DuckDB compilato in WebAssembly. DuckDB legge Parquet in modo nativo, inclusa la compressione Snappy, Gzip e Zstd, liste e struct annidate, date, timestamp e decimali. Il numero di righe proviene dai metadati del file e ogni pagina viene recuperata con una piccola query LIMIT/OFFSET, così la navigazione resta reattiva anche quando il file contiene milioni di righe.

Converti Parquet in CSV o JSON

Spesso ti servono semplicemente i dati in un formato più comodo. I pulsanti di esportazione convertono l'intero file, non solo la pagina visibile. L'esportazione CSV scrive una riga di intestazione seguita da ogni record, pronta per Excel, Google Sheets o l'importazione in un database. L'esportazione JSON scrive un unico array di oggetti, comodo per script, fixture di test e API. Le colonne annidate restano JSON annidato, mentre nel CSV compaiono come testo. I timestamp sono scritti in formato ISO, così si ordinano e si analizzano correttamente.

Ispezione privata e adatta all'uso offline

I file Parquet contengono spesso dati di produzione: record di utenti, transazioni o telemetria. Caricarli su un sito sconosciuto solo per dare un'occhiata allo schema è rischioso. Qui il file viene letto nella memoria del browser e non viene mai inviato da nessuna parte. Il motore DuckDB (circa 35 MB) viene scaricato da una CDN la prima volta che apri un file e può poi essere memorizzato nella cache del browser. Poiché l'intero file è tenuto in memoria, i file molto grandi dipendono dalla RAM disponibile per la scheda del browser. Per analisi più approfondite, come filtri, aggregazioni o join con altri file, apri lo stesso file nello strumento SQL on CSV.

Come usare

  1. Apri un file ParquetTrascina un file .parquet nell'area di rilascio o fai clic per sceglierne uno dal tuo computer.
  2. Esamina lo schemaControlla nomi delle colonne, tipi DuckDB, valori nulli ammessi, numero di righe e metadati del file.
  3. Scorri le righeScegli la dimensione della pagina e spostati tra le pagine oppure salta a un numero di pagina.
  4. EsportaScarica tutte le righe come CSV per i fogli di calcolo o come array JSON per il codice.

Domande frequenti

Il mio file Parquet viene caricato?
No. Il file viene aperto nel browser con DuckDB compilato in WebAssembly. Il motore viene scaricato da una CDN e i tuoi dati restano sul tuo dispositivo.
Quali funzionalità di Parquet sono supportate?
DuckDB legge le compressioni comuni come Snappy, Gzip e Zstd, i tipi annidati come liste e struct, date, timestamp e decimali.
Posso esportare l'intero file e non solo la pagina corrente?
Sì. L'esportazione in CSV o JSON scrive sempre tutte le righe del file, indipendentemente dalla pagina che stai visualizzando.
Perché le colonne annidate sono mostrate come testo JSON?
Liste e struct non possono stare in una singola cella di una tabella piatta, quindi il visualizzatore le mostra come JSON compatto. L'esportazione JSON le mantiene annidate.
Advertisement