メインコンテンツまでスキップ

ビッグデータ.

05 — ビッグデータに関する記事

01

Dinky

Dinky はオープンソースの Flink ジョブ管理・開発プラットフォームで、Flink SQL のオンライン作成・デバッグ、データベース丸ごと同期、データリネージ分析をサポートします。私が理解した内容と使用シナリオを記録します。

02

Canal コンポーネント

Canal は Alibaba がオープンソースで公開している、MySQL Binlog ベースの増分購読・消費コンポーネントです。本記事では、その動作原理、よくある CDC コンポーネントとの比較、そしてクラスターによる高可用デプロイでの注意点を整理します。

03

Flink CDC コンポーネント

Flink CDC の基本概念と組み込みコンポーネントを紹介します。変更ログキャプチャの原理から始めて、Source、Debezium Connector、Sink などの中核モジュール、および利用時のよくある注意点を整理します。

04

データレイク Iceberg

データレイクとデータウェアハウスの違いを整理し、オープンソースのテーブルフォーマット Apache Iceberg の位置づけとコア機能(バージョン管理、メタデータ管理、パーティション管理、スナップショット)を紹介し、選定時の注意点も記録します。

05

Kettle ツールの使い方

Kettle を使って複数データソース間の同期・移行・変換を行った経験の記録。コアとなる概念、よく使うコンポーネントの用途、そしてクエリベースの CDC 方式が適する場面と限界について。