DT Data Tools

Visualizador de Parquet — Abra arquivos Parquet online, com privacidade

Visualize arquivos Apache Parquet no navegador: esquema, tipos de coluna, número de linhas e linhas paginadas. Exporte Parquet para CSV ou JSON sem enviar nada.

🔒 Executa completamente no seu navegador — nada é enviado

Drop a .parquet file here or click to browse

Opened locally with DuckDB-wasm. Nothing is uploaded.

The DuckDB engine (about 35 MB) downloads from this site on first use, then runs offline in your browser.

Advertisement

Uma forma rápida de ver o interior de arquivos Parquet

O Apache Parquet é o formato de armazenamento padrão para data lakes, jobs do Spark, exportações do pandas e muitos pipelines de análise. É compacto e rápido, mas é um formato binário colunar, por isso não é possível abri-lo num editor de texto ou numa planilha. Este Visualizador de Parquet abre um arquivo .parquet diretamente no seu navegador e mostra o que há dentro: os nomes e tipos das colunas, o número total de linhas, o número de grupos de linhas, a biblioteca que gravou o arquivo e uma tabela paginada com os dados reais.

Por baixo dos panos, a ferramenta usa o DuckDB compilado para WebAssembly. O DuckDB lê Parquet de forma nativa, incluindo compressão Snappy, Gzip e Zstd, listas e structs aninhados, datas, carimbos de data/hora e decimais. O número de linhas vem dos metadados do arquivo e cada página é obtida com uma pequena consulta LIMIT/OFFSET, de modo que a navegação continua ágil mesmo quando o arquivo tem milhões de linhas.

Converta Parquet para CSV ou JSON

Muitas vezes você só precisa dos dados num formato mais prático. Os botões de exportação convertem o arquivo inteiro, não apenas a página visível. A exportação para CSV grava uma linha de cabeçalho seguida de todos os registros, pronta para Excel, Google Sheets ou importação num banco de dados. A exportação para JSON grava um único array de objetos, conveniente para scripts, dados de teste e APIs. As colunas aninhadas são mantidas como JSON aninhado, enquanto no CSV aparecem como texto. Os carimbos de data/hora são gravados no formato ISO para que sejam ordenados e interpretados corretamente.

Inspeção privada e compatível com uso offline

Arquivos Parquet frequentemente contêm dados de produção: registros de usuários, transações ou telemetria. Enviá-los para um site desconhecido só para dar uma olhada no esquema é arriscado. Aqui, o arquivo é lido para a memória do seu navegador e nunca é enviado a lugar nenhum. O mecanismo DuckDB (cerca de 35 MB) é baixado de uma CDN na primeira vez que você abre um arquivo e pode então ser armazenado em cache pelo navegador. Como o arquivo inteiro fica na memória, arquivos muito grandes dependem da RAM disponível para a aba do navegador. Para análises mais aprofundadas, como filtros, agregações ou junções com outros arquivos, abra o mesmo arquivo na ferramenta SQL on CSV.

Como usar

  1. Abra um arquivo ParquetArraste um arquivo .parquet para a área de soltar ou clique para escolher um no seu computador.
  2. Examine o esquemaConfira nomes de colunas, tipos do DuckDB, anulabilidade, número de linhas e metadados do arquivo.
  3. Navegue pelas linhasEscolha um tamanho de página e avance entre as páginas ou salte para um número de página.
  4. ExporteBaixe todas as linhas como CSV para planilhas ou como array JSON para código.

Perguntas frequentes

Meu arquivo Parquet é enviado para algum servidor?
Não. O arquivo é aberto no seu navegador com o DuckDB compilado para WebAssembly. O mecanismo é baixado de uma CDN e seus dados permanecem no seu dispositivo.
Quais recursos do Parquet são suportados?
O DuckDB consegue ler compressões comuns como Snappy, Gzip e Zstd, tipos aninhados como listas e structs, datas, carimbos de data/hora e decimais.
Posso exportar o arquivo inteiro, e não só a página atual?
Sim. A exportação para CSV ou JSON sempre grava todas as linhas do arquivo, independentemente da página que você está visualizando.
Por que as colunas aninhadas aparecem como texto JSON?
Listas e structs não cabem numa única célula de uma tabela plana, por isso o visualizador os mostra como JSON compacto. A exportação para JSON os mantém aninhados.
Advertisement