データは取り込みレイヤーを通じてデータレイクに流れ込みます。このレイヤーはデータベース、API、イベントストリーム、フラットファイルといったソースシステムからデータを収集し、内容を変更することなく生ストレージゾーンに格納します。ソースシステムのスキーマエラーもそのまま保存されるため、上流での障害発生時のデータ損失を防ぐことができます。例えば、CRMベンダーが一晩でフィールド名を変更した場合でも、データレイクはレコードを確実に取り込みます。エンジニアはデータを失うことなく、クレンジングのステップで変更内容を整合させることができます。
データが格納されると、一連の処理ゾーンを経て段階的に処理が進みます。rawゾーンにはソースから取り込んだ未加工データが、クレンジングゾーンには検証・重複排除済みのレコードが、キュレーションゾーンにはビジネスですぐに活用できるデータセットが保存されます。この3ゾーン構成により、アナリストが誤って未クリーンなデータをクエリするリスクを防ぎながら、再処理のために元データを保持することができます。よくある失敗の原因は、ゾーン分離を省略してしまうことです。その結果、アナリストがクレンジング前のデータでダッシュボードを構築し、レポートが経営幹部に共有された後にエラーが発覚するという事態につながりかねません。
コンピュートレイヤーはストレージレイヤーから独立しています。SQLエンジン、MLフレームワーク、ストリーム処理ツールはいずれも同じファイルから読み込みます。例えば、同一のお客様イベントログを使って、データをコピーすることなく、不正検知モデルとマーケティングアトリビューションレポートの両方を同時に実行することができます。この分離構造により、負荷の高い処理タスクに対してコンピュートリソースを拡張する際も、ストレージを追加する必要はなく、逆もまた同様です。
メタデータカタログはストレージレイヤーの上位に位置し、どのデータが存在するか、どこに保存されているか、誰がアクセスできるか、そのデータがどれだけ最新かを一元的に把握します。カタログがなければ、ファイルが際限なく蓄積するだけで、検索も管理もガバナンスも効かない「データの沼」へと変わりかねません。カタログの導入を先送りにした組織では、6か月以内に、データエンジニアがデータセットを分析する時間よりも検索に費やす時間の方が長くなるのが一般的です。
データ出力はデータレイクと後続システムを接続します。BIダッシュボード、AIおよびMLパイプライン、カスタマーエクスペリエンスプラットフォーム、運用データベースはいずれも、それぞれで個別のコピーを管理するのではなく、キュレーションゾーンからデータを取得します。この単一出力パターンにより、サイロ化されたデータストアを抱える組織が直面する売上合計の数値が3種類存在する という問題の解消に役立ちます。