ChatDiagram
13 templates · Flowchart

データパイプラインのフローチャート

データパイプラインのフローチャートは、データエンジニア、プロダクトマネージャー、データ利用者など、すべての関係者が、生データがソースシステムから変換・検証を経て、ウェアハウス、データレイク、サービング層の最終送信先に至る流れを共有するためのモデルです。

Standard Sugiyama layered DAG + orthogonal routingEngine schematex-flowchartExport SVG · PNG · PDF
How to

How to use a flowchart template.

  1. 01ソースと送信先を特定する

    データソース(Postgres、S3、Kafka、API)と対象システム(Snowflake、BigQuery、Redshift、データレイク)を列挙します。これらが開始ノードと終了ノードになります。

  2. 02変換ステージを説明する

    抽出、デコード、クレンジング/重複排除、結合、集計、エンリッチメントなど、各処理ステップを列挙します。ChatDiagramが各ステージを処理用の長方形として作成します。

  3. 03検証と品質ゲートを追加する

    行数照合、スキーマ検証、NULL率のしきい値、参照整合性などのチェックを指定します。ChatDiagramが合格/不合格の分岐を持つ判断のひし形を追加します。

  4. 04エラー処理と再試行を定義する

    失敗時の動作(デッドレターキュー、アラート、バックオフ付き再試行、中止)を説明します。ChatDiagramが適切な注記付きのエラー経路分岐を追加します。

  5. 05文書用にエクスポートする

    PNGまたはPDFとしてダウンロードし、データカタログ、運用手順書、アーキテクチャ決定記録(ADR)に埋め込みます。

FAQ

Questions about flowchart templates

パイプラインのフローチャートにおけるETLとELTの違いは?

ETL(Extract-Transform-Load)では、変換処理が抽出とロードの間に入り、データウェアハウスに届く前に処理されます。ELT(Extract-Load-Transform)では、先に生データをロードし、SQL(dbt、Spark SQL)を使ってウェアハウス内で変換します。フローチャートでは、TransformとLoadの長方形の順序が、採用しているパターンを表します。

レコード種別ごとに異なる経路を通る分岐パイプラインはどう表現しますか?

ルーティング条件(例:'Record type = event?')を記した判断のひし形を使います。各分岐をそれぞれの変換・ロード処理へつなぎ、その後の段階で合流させるか、別々の送信先へ進めます。各分岐には、yes/noまたは具体的な種別名を明確に付けます。

ストリーミングパイプラインとバッチパイプラインはフローチャートでどう表しますか?

ストリーミングでは、処理・出力ノードの後から取り込みステップへ戻るループ矢印を使い、継続的な処理であることを示します。「per message」や「per micro-batch」などのトリガーも注記します。バッチでは、開始ノードに「Daily 02:00 UTC」などのスケジュールトリガーを置き、最後に完了・成功通知を追加します。

オンコール用の運用手順書に使うデータパイプラインフローチャートには何を含めるべきですか?

運用手順書向けのフローチャートには、障害の検知地点(監視アラートまたはパイプラインタスクの失敗)、障害を分類する判断ツリー(ソース停止、変換エラー、ロード拒否)、分類ごとの対処(スキップ、再試行、再処理)、自動対処に失敗した場合のエスカレーション経路を明確に示します。