大容量 CSV/TSV エクスプローラー

非常に大きな CSV または TSV ファイルをローカルで開き、フィルター、確認、エクスポートできます。増分解析と仮想化テーブルを使用します。

サーバーへのデータ送信はありません

CSV または TSV ファイルをここにドロップ

CSV または TSV ファイルをここにドロップ

CSV、TSV、または区切りテキストに対応しています。ファイルはこのデバイス内に保持されます。

処理は Web Worker 内でローカルに実行されます。ファイルの内容、フィルター、検出された列がアップロードまたは保存されることはありません。

インポート設定

エクスプローラー

CSV または TSV ファイルを選択すると、ローカルインデックスが作成され、レコードを閲覧できます。

このページの内容

大容量 CSV/TSV エクスプローラーは、区切りファイルをブラウザー内だけで開きます。Web Worker でレコードを増分インデックス化し、小さな仮想ウィンドウだけを表示するため、データをアップロードせずに、通常の HTML テーブルでは扱えないほど大きなファイルを確認、絞り込み、必要な列だけに整理できます。

詳細な機能

このエクスプローラーはカンマ、セミコロン、タブ、パイプの区切り文字を認識し、明示的に選択することもできます。RFC 4180 形式の引用符付きフィールド、二重引用符、埋め込み改行、UTF-8、BOM 付きの UTF-16 リトルエンディアンおよびビッグエンディアンのテキスト、明示的な Latin-1/Windows-1252 モードに対応しています。チャンクの境界でマルチバイト文字、CRLF の組、または引用符で囲まれた複数行フィールドが分割されても、解析結果の値は変わりません。

保持されるのは、まばらなレコードチェックポイントと上限付きの行データだけです。フィルター処理では選択した列のすべてのレコードを走査し、部分文字列、完全一致のテキスト、厳密な数値比較を使用できます。列の表示設定は、エクスポート対象の列も決定します。CSV と JSONL のダウンロードでは、表示中の行だけでなく、フィルター後の結果全体を再スキャンします。スプレッドシートの数式保護は既定で有効です。先頭の数式文字をそのまま保持する必要がある場合にのみ無効にしてください。すべての処理はこのデバイス上で行われます。

実用例

ヘッダー付きカンマ区切り CSV: name,amount の次に Ada,12.50 が続くファイルを開き、区切り文字の自動検出とヘッダーオプションを有効のままにします。

ヘッダーなし TSV: タブを選択し、ヘッダーオプションを無効にします。エクスプローラーは Column 1 のような一意に定まる名前を割り当てます。

引用符で囲まれた複数行の値: `1,"first line

second line" は 1 つのレコード、1 つのセルとして保持されます。"He said ""hello""" のような二重引用符は He said "hello"` になります。

安全なスプレッドシートへのエクスポート: =SUM(A1:A2) で始まる値には、既定で先頭にアポストロフィが付けられ、数式の実行を防ぎます。JSONL では常に元の文字列が保持されます。

このツールの使い方

  1. インポート設定を選ぶ

    通常の UTF-8 CSV ファイルでは区切り文字とエンコーディングの自動検出を使用し、必要に応じてセミコロン、タブ、パイプ、UTF-16、Latin-1 を明示的に選択します。最初のレコードに列名が含まれるかどうかも指定します。

  2. ファイルを開く

    ローカルファイルを 1 つドロップするか選択します。インデックス化済みのバイト数、経過時間、処理速度を確認できます。キャンセルすると途中のセッションは破棄され、ファイルを選び直すと新しいインデックス作成が始まります。

  3. 閲覧して絞り込む

    仮想テーブルをスクロールし、表示する列を選び、行を選択して長い値を確認します。値、演算子、検索対象の列を入力すると、ファイル全体がスキャンされます。

  4. エクスポートする

    CSV または JSONL、ヘッダー、BOM の各オプションを選択し、元の CSV 値が不可欠な場合を除いてスプレッドシートの数式保護を有効にしておきます。ダウンロードには、現在の表示範囲だけでなく、一致するすべての行と選択した列が含まれます。

ヒントとベストプラクティス

  • UTF-16 の自動検出にはバイトオーダーマークが必要です。BOM がないファイルでは UTF-16 リトルエンディアンまたはビッグエンディアンを明示的に選択してください。
  • 数値フィルターは曖昧さのない小数または指数表記のテキストを受け付け、ロケール固有の数値変換は行いません。数値でないセルは数値比較に一致しません。
  • 空のヘッダーは Column N になり、重複したヘッダーには一意に定まる数値の接尾辞が付きます。元のデータセルの名前変更や変換は行われません。
  • CSV 出力を Excel、LibreOffice、その他の表計算ソフトで開く前は、数式保護を有効にしておいてください。JSONL 出力は文字列を保持し、スプレッドシートの数式形式ではありません。
  • 解析上限は、フィールドごとに 2 MiB、レコードごとに 8 MiB、512 列、1 億レコード、生成出力 512 MiB です。
  • ブラウザーのファイルとメモリの上限も適用されます。フィルターとエクスポートの再スキャンには上限がありますが、完成したダウンロードデータはブラウザーのメモリに収まる必要があります。