Przeglądarka Parquet — Otwieraj pliki Parquet online, prywatnie
Przeglądaj pliki Apache Parquet w przeglądarce: schemat, typy kolumn, liczba wierszy i wiersze podzielone na strony. Eksportuj Parquet do CSV lub JSON bez wysyłania czegokolwiek.
🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłaneSzybki sposób, by zajrzeć do plików Parquet
Apache Parquet to domyślny format przechowywania danych w data lake'ach, zadaniach Spark, eksportach z pandas i wielu potokach analitycznych. Jest zwarty i szybki, ale to binarny format kolumnowy, więc nie da się go otworzyć w edytorze tekstu ani w arkuszu kalkulacyjnym. Ta Przeglądarka Parquet otwiera plik .parquet bezpośrednio w przeglądarce i pokazuje, co jest w środku: nazwy i typy kolumn, łączną liczbę wierszy, liczbę grup wierszy, bibliotekę, która zapisała plik, oraz tabelę z rzeczywistymi danymi podzieloną na strony.
Pod spodem narzędzie korzysta z DuckDB skompilowanego do WebAssembly. DuckDB natywnie odczytuje Parquet, w tym kompresję Snappy, Gzip i Zstd, zagnieżdżone listy i struktury, daty, znaczniki czasu i liczby dziesiętne. Liczba wierszy pochodzi z metadanych pliku, a każda strona jest pobierana niewielkim zapytaniem LIMIT/OFFSET, dzięki czemu przeglądanie pozostaje płynne nawet wtedy, gdy plik ma miliony wierszy.
Konwersja Parquet do CSV lub JSON
Często po prostu potrzebujesz danych w wygodniejszym formacie. Przyciski eksportu konwertują cały plik, a nie tylko widoczną stronę. Eksport do CSV zapisuje wiersz nagłówka, a po nim wszystkie rekordy – gotowe do Excela, Google Sheets lub importu do bazy danych. Eksport do JSON zapisuje jedną tablicę obiektów, co jest wygodne w skryptach, danych testowych i API. Zagnieżdżone kolumny pozostają zagnieżdżonym JSON-em, a w CSV pojawiają się jako tekst. Znaczniki czasu są zapisywane w formacie ISO, aby poprawnie się sortowały i parsowały.
Prywatna analiza, przyjazna pracy offline
Pliki Parquet często zawierają dane produkcyjne: rekordy użytkowników, transakcje lub telemetrię. Wysyłanie ich na nieznaną stronę tylko po to, by zerknąć na schemat, jest ryzykowne. Tutaj plik jest wczytywany do pamięci przeglądarki i nigdy nigdzie nie trafia. Silnik DuckDB (około 35 MB) jest pobierany z sieci CDN przy pierwszym otwarciu pliku, a następnie może zostać zapisany w pamięci podręcznej przeglądarki. Ponieważ cały plik jest przechowywany w pamięci, obsługa bardzo dużych plików zależy od ilości RAM dostępnej dla karty przeglądarki. Do głębszej analizy, takiej jak filtry, agregacje czy złączenia z innymi plikami, otwórz ten sam plik w narzędziu SQL on CSV.
Jak używać
- Otwórz plik ParquetUpuść plik .parquet w obszarze upuszczania lub kliknij, aby wybrać go z komputera.
- Sprawdź schematPrzejrzyj nazwy kolumn, typy DuckDB, dopuszczalność wartości null, liczbę wierszy i metadane pliku.
- Przeglądaj wierszeWybierz rozmiar strony i przechodź między stronami lub przejdź od razu do wybranego numeru strony.
- EksportujPobierz wszystkie wiersze jako CSV do arkuszy kalkulacyjnych lub jako tablicę JSON do kodu.