このページの内容

Awesome Data Engineering

Data Engineeringを扱う資料や関連プロジェクトをまとめたAwesomeリストです。

目次

データベース

  • リレーショナル
    • RQLite - Raftコンセンサスプロトコルを用いたSQLiteの再現
    • MySQL - 世界で最も人気のあるオープンソースデータベース
      • TiDB - MySQLプロトコルと互換性を持つ分散NewSQLデータベース
      • Percona XtraBackup - Percona Server、MySQL®、MariaDB®のすべてのバージョン向けの無料、オープンソース、完全オンラインバックアップソリューション
      • mysql_utils - PinterestのMySQL管理ツール
    • MariaDB - MySQLへの強化された、即時置き換え可能な代替品
    • PostgreSQL - 世界で最も先進的なオープンソースデータベース
    • Rivestack - AIワークロード向けにpgvectorを搭載した管理PostgreSQL。HNSWインデックス、4ms未満の遅延、自動埋め込み生成付きの組み込みSQLエディタ
    • Amazon RDS - クラウド上で関係データベースをセットアップ・運用・スケーリングするための簡単な手段
    • Crate.IO - NOSQLの利点を備えたスケーラブルSQLデータベース
  • キーバリュー
    • Redis - BSDライセンスを採用したオープンソース、高度なキーバリューキャッシュとストア
    • Riak - 複数サーバーにデータを分散させることで最大のデータ可用性を実現する分散データベース
    • AWS DynamoDB - すべてのアプリケーションにおいて、スケーラブルかつ、常に1桁ミリ秒未満の遅延を維持する高速で柔軟なNoSQLデータベースサービス
    • HyperDex - スケーラブルかつ検索可能なキーバリューストア。廃止済み
    • SSDB - 多くのデータ構造をサポートする高性能NoSQLデータベース。Redisの代替品
    • Kyoto Tycoon - Kyoto Cabinetキーバリューデータベースに基づいた軽量ネットワークサーバー。高パフォーマンスと並列処理に最適化されたもの
    • IonDB - マイクロコントローラーおよびIoTアプリケーション向けのキーバリューストア
  • カラム指向
    • Cassandra - パフォーマンスを犠牲にせずにスケーラビリティと高可用性を実現するための最適な選択
      • Cassandra Calculator - このシンプルなフォームは、Apache Cassandraクラスタのさまざまな値を試して、アプリケーションへの影響を確認するのに使用できます
      • CCM - ローカルホスト上でApache Cassandraクラスタを簡単に作成・削除するためのスクリプト
      • ScyllaDB - seastarフレームワークを用いたNoSQLデータストア。Apache Cassandraと互換性がある。
    • HBase - ハドープデータベース、分散型かつスケーラブルなビッグデータストア。
    • AWS Redshift - 高速かつ完全に管理された、ペタバイト規模のデータウェアハウス。既存のビジネスインテリジェンスツールを使ってすべてのデータを分析するためのシンプルかつコスト効率の良いソリューション。
    • FiloDB - 分散型。列型。バージョン管理。ストリーミング。SQL。
    • Vertica - 分散型MPP列型データベースで、広範な分析SQLを提供。
    • ClickHouse - OLAP向けの分散型列型DBMS。SQL。
  • ドキュメント
    • MongoDB - 開発とスケーリングが容易なドキュメントデータベース。
      • Percona Server for MongoDB - Percona Server for MongoDB®は、MongoDB®コミュニティエディションの無料、強化された、完全に互換性のあるオープンソース、drop-in置き換えであり、エンタープライズクラスの機能を含む。
      • MemDB - 分散型トランザクションインメモリデータベース(MongoDBに基づく)。
    • Elasticsearch - リアルタイムでデータを検索・分析。
    • Couchbase - 最もパフォーマンスの高いNoSQL分散型データベース。
    • RethinkDB - リアルタイムウェブ向けのオープンソースデータベース。
    • RavenDB - 完全トランザクション対必のNoSQLドキュメントデータベース。
  • グラフ
    • ArcadeDB - ネイティブなグラフ、ドキュメント、キー値、ベクトルサポートを備えたオープンソースマルチモデルデータベース。SQL、Cypher、Gremlinクエリ言語。Apache 2.0ライセンス。
    • Neo4j - 世界で最も普及しているグラフデータベース。
    • Omnigraph - タイプ付きグラフデータベースで、エージェントがGitのように分岐・マージする。S3ネイティブ、Rust、走査+ベクトル+BM25を1つのランタイムで実現。
    • OrientDB - 2世代の分散型グラフデータベース。ドキュメントの柔軟性を備えた1製品で、オープンソースかつ商業利用に適したライセンスを提供。
    • ArangoDB - ドキュメント、グラフ、キー値のための柔軟なデータモデルを備えた分散型無料オープンソースデータベース。
    • Titan - 数百億の頂点とエッジを多マシンクラスタに分散して保存・検索するためのスケーラブルなグラフデータベース。
    • FlockDB - ツイッターが開発した分散型、耐障害性のあるグラフデータベース。非推奨。
    • Actionbase - ユーザーの相互作用(いいね、視聴、フォロー)をグラフとして表現したデータベースで、事前計算された読み取りがリアルタイムで提供される
  • 分散
    • DAtomic - 完全にトランザクション対応であり、クラウド環境に最適化された分散データベース
    • Apache Geode - スケーラブルなアプリケーション向けのオープンソース、分散、メモリ内データベース
    • Gaffer - 大規模グラフデータベース
  • 時系列
    • InfluxDB - メトリクス、イベント、リアルタイム分析用のスケーラブルデータストア
    • OpenTSDB - スケーラブルで分散型のタイムシリーズデータベース
    • QuestDB - タイムシリーズおよびイベントデータに対するリアルタイム分析を目的とした、関係型カラム指向データベース
    • kairosdb - 高速かつスケーラブルなタイムシリーズデータベース
    • Heroic - Spotifyが開発した、CassandraおよびElasticsearchをベースとしたスケーラブルタイムシリーズデータベース
    • Druid - インタラクティブアプリケーションを駆動するのに最適な、カラム指向の分散データストア
    • Riak-TS - Riak TSは、IoTおよびタイムシリーズデータに特に最適化された、エンタープライズ級のNoSQLタイムシリーズデータベースである
    • Akumuli - 数値型タイムシリーズデータベース。リアルタイムでタイムシリーズデータを収集、保存、処理できる。単語”akumuli”はエスペルト語から”accumulate”(蓄積)と翻訳できる
    • Rhombus - Cassandra向けのタイムシリーズオブジェクトストアで、広い行インデックスの構築に必要なすべての複雑性を処理する
    • Dalmatiner DB - 高速分散メトリクスデータベース
    • Blueflood - タイムシリーズデータをイングレスし、処理するための分散システム
    • Timely - AccumuloおよびGrafanaに基づく、タイムシリーズデータへの安全なアクセスを提供するタイムシリーズデータベースアプリケーション
  • その他
    • Tarantool - メモリ内データベースおよびアプリケ連携サーバー
    • GreenPlum - グリーンプランデータベース(GPDB)— 高度で完全に機能を備えたオープンソースデータウェアハウス。パイトバイト規模のデータ量に対して強力で高速な分析を提供する
    • cayley - オープンソースのグラフデータベース。Google.
    • Snappydata - Apache Sparkに基づくOLTP+OLAPデータベース
    • TimescaleDB - PostgreSQLに拡張として構築されたTimescaleDBは、プローブされたストレージエンジン上で高速な分析、スケーラビリティを提供し、自動データ管理を行うタイムシリーズSQLデータベースです
    • DuckDB - 外部依存がない高速なプロセス内分析データベース。Linux/macOS/Windowsで動作し、豊かなSQL文法を提供し、無料かつ拡張可能
    • SlothDB - C++20で記述されたプロセス内分析SQLデータベース。Parquet、CSV、JSON、Avro、Arrow、SQLite、Excelを直接読み込み。単一バイナリ、Pythonパッケージ、1.3MBのブラウザ用WASMビルドを提供
    • chDB - 埋め込み型ClickHouse — 全ClickHouse SQL文法、約80のデータ形式、12以上のソース接続(S3、Postgres、MongoDB、Kafka、Iceberg)を内蔵。Python、Go、Rust、Node、Bun、Zig、Rubyのバインディングを提供
    • zvec - デバイス内RAGやエッジAI向けの埋め込み型ベクトルデータベース。ベクトルデータベースにおけるSQLiteです

データ比較

  • datacompy - Pandas、Polars、SparkなどにおけるDataFramesの比較を支援するPythonライブラリ。単純な等価チェックを越えて、行および列レベルの差異に関する詳細な洞察を提供
  • dvt - データ検証ツールは、ソーステーブルとターゲットテーブルのデータを比較し、一致を確認します。列検証、行検証、スキーマ検証、カスタムクエリ検証、および即時SQL探索を提供
  • koala-diff - RustおよびPolarsを使用してローカルにCSV、Parquetなどの大規模データセットを比較する、高性能なPythonライブラリ。ゼロコピーストリーミングによりOOMエラーを防止し、インタラクティブなHTMLデータ品質レポートを生成
  • FutureSearch SDK - データセットやテーブルの差分・品質を検証するツールです。 各表行を対象に調査し、複数エージェントの結果を構造化カラムへ統合します。

データ取り込み

  • DataSpoc Pipe - 400以上のSingerタップをクラウドバケット(S3、GCS、Azure)内のParquetファイルに接続するデータインジェストエンジン。ストリーミング、インクリメンタル、自動カタログ付き
  • Enrich.sh - REST APIに送られたJSONをCloudflare R2上のHiveパーティションParquetに変換し、DuckDB、ClickHouse、BigQuery、Snowflake、Pythonからクエリ可能な、管理されたイベントインジェストサービス
  • enrich-companies - データの収集、転送、CDC、ETL/ELTを支援する基盤・ツールです。 npm
  • ingestr - 1つのコマンドでデータベース間のデータをコピーできるCLIツール。PostgreSQL、MySQL、MongoDB、Salesforce、Shopifyなど50以上のソースをサポートし、任意のデータウェアハウスに接続可能
  • Kafka - パブリッシュ・サブスクリプションメッセージングを分散型コミットログとして再考
    • BottledWater - PostgreSQLからKafkaへの変更データキャプチャ。廃止済み
    • kafkat - Kafkaブローカーの簡易なコマンドライン管理
    • kafkacat - 非JVMのApache Kafkaの汎用コマンドラインプロダクタおよびコンシューマー
    • pg-kafka - PostgreSQL拡張機能としてApache Kafkaへのメッセージ送信を実現
    • librdkafka - Apache KafkaのC/C++ライブラリ
    • kafka-docker - KafkaのDocker化
    • kafka-manager - Apache Kafkaの管理ツール
    • kafka-node - Apache Kafka 0.8用のNode.jsクライアント
    • Secor - PinterestのKafkaからS3への分散コンシューマー
    • Kafka-logger - UberのNode.js用Kafka-winstonログゲージ
    • Kroxylicious - Kafkaデータの静的暗号化を解決するKafkaプロキシ
  • AWS Kinesis - 大規模分散データストリーム上のリアルタイムデータ処理を提供する、完全に管理されたクラウドベースサービス
  • RabbitMQ - アプリケーション向けに強固なメッセージング
  • dlt - Pythonデータ開発者向けに高速かつシンプルなパイプライン構築ライブラリ。ノートブック、クラウド関数、Airflowなどに実行可能
  • drt - OSS Reverse ETL CLI。YAMLを用いてデータウェアハウスからビジネスツールへ同期
  • FluentD - 統一ログレイヤー向けオープンソースデータコレクタ
  • Embulk - さまざまなデータベース、ストレージ、ファイル形式、クラウドサービス間のデータ転送を支援するオープンソースの大量データローダー
  • Apache Sqoop - Apache Hadoopと構造化データストレージ(関係データベースなど)間の大量データ転送を効率的に実現するツール
  • Heka - データ取得および処理が簡単。非推奨
  • Gobblin - LinkedInのHadoop向けのユニバーサルデータイングリッジフレームワーク
  • Nakadi - Kafkaのようなキュー上でREST APIを提供するオープンソースイベントメッセージングプラットフォーム
  • Pravega - 継続的かつ無限のデータを扱うための新しいストレージ抽象化(ストリーム)を提供
  • Apache Pulsar - オープンソースの分散型パブリッシュ・サブスクリプションメッセージングシステム
  • AWS Data Wrangler - AWS上のデータを扱うためのユーティリティセット
  • Airbyte - 現代のデータチーム向けオープンソースデータ統合
  • DBConvert Streams - 自前でホストできるデータベース移行および変更データキャプチャ(CDC)ツール(組み込みSQL IDEあり)
  • Artie - 変更データキャプチャを活用したリアルタイムデータイングリッジツール
  • Sling - データベース間およびストレージシステム間のデータ移動に特化したCLIデータ統合ツール
  • Meltano - CLIおよびコードファーストELT
    • Singer SDK - Singer規格に準拠したカスタムデータエクストラクタとローダーを構築する最も速い方法
  • Google Sheets ETL - Google Sheetsのすべてをリアルタイムでデータウェアハウスにインポート
  • CsvPath Framework - MFTとデータラクの間のギャップを埋める、区切り文字によるデータプリブレードフレームワーク
  • Estuary Flow - バッチおよびリアルタイムデータイングリップを扱える、ノーリーカーまたは低コードデータパイプラインプラットフォーム
  • db2lake - データベース→データラク/ウェアハウスへの軽量Node.js ETLフレームワーク
  • data-genie - Node.jsおよびTypeScript向けの高性能・ストリーミング中心のETLエンジン(メモリ消費量は一定)
  • Kreuzberg - Rustベースの多言語ドキュメントインテリジェンスライブラリ。Python、TypeScript、Goなどへのバインディングを提供。62以上のドキュメントフォーマットからテキスト、テーブル、メタデータを抽出し、データパイプラインにイングリップ
  • pdfmux - PythonによるPDF-to-Markdownオーガナイザー。各ページを分類し、最適なバックエンド(PyMuPDF、Docling、RapidOCR、Gemini Flash)にルートし、Markdownとページごとの信頼度スコアを発行することで、イングリップパイプラインがLLMやリトリーブに前に送る前に低信頼ページを隔離
  • DataRaven - 管理されたクラウドオブジェクトストレージのイングリップワークフロー用転送
  • Xquik - リアルタイムX(Twitter)データ抽出プラットフォーム(REST API(76エンドポイント)、20のブロードエクストラクションツール、アカウントモニタリング、HMAC署名されたウェブホーク、AIエージェント統合用MCPサーバー)
  • Arpe.io - PostgreSQL、MySQL、Oracle、SQL Serverおよび80以上のソースをサポートする、高速CLIツールによるデータベースのエクスポート、インポート、レプリケーション、移行。CSV、Parquet、JSONおよびクラウドストレージへの並列ストリーミングをサポート
  • Crustdata - 企業および人物インテリジェンス向けリアルタイムB2BデータAPI。REST APIおよびウェブホークを介して、企業情報、人員数シグナル、求人情報、ウェブトラフィック、資金イベントを提供し、データ強化パイプラインに活用
  • crdt-merge - データフレーム、JSON、MLモデルおよび分散エージェントの衝突なしマージ — CRDTsで実現
  • LinkedIn Jobs Scraper - APIキーなしでスケールした構造化LinkedInジョブリストを抽出するCrawleeベースのアクターフレームワーク
  • CARQ - 高可用性と適応型レート制限を実現するコンテキスト意識型RAG処理キュー
  • Duckle - ローカル中心のオープンソースデスクトップETL/ELTスタジオ:パイプラインをキャンバスにドラッグ(または内蔵のデバイスAIアシスタントに説明)し、DuckDBでネイティブスピードで実行。290以上のコンネクタ、スケジューラ、LLMからパイプラインを駆動するMCPサーバー。クラウドもサーバーも不要
  • Rawbbit - 自前で運用可能なオープンソースアナリティクスパイプライン。rawイベントを自前オブジェクトストレージにParquet形式で受け入れ。NATS JetStreamで持続可能なバッファリング、BigQuery外部テーブルでクエリ。rawイベントデータを自ら所有したいチーム向けに設計
  • faucet-stream - Rust向けの構成駆動型データ移動プラットオーラ。プラグイン可能なソースおよびシンクコンネクタを備え、YAMLから宣言的にまたはライブラリとして埋め込みでETL、CDC、ストリーミングパイプラインを実行

ファイルシステム

  • HDFS - コンピュータハードウェアに搭載可能な分散ファイルシステム
    • Snakebite - 純粋なPython HDFSクライアント
  • AWS S3 - どこからでも任意の量のデータを取得できるオブジェクトストレージ
    • smart_open - 大規模ファイルのストリーミングに必要なユーティリティ(S3、HDFS、gzip、bz2)
  • Alluxio - メモリ中心の分散ストレージシステム。SparkやMapReduceなどのクラスタフレームワーク間で、メモリ速度で信頼性のあるデータ共有を可能にする。
  • CEPH - 高いパフォーマンス、信頼性、スケーラビリティを実現する統合型分散ストレージシステム。
  • JuiceFS - 大規模データストレージに特化した、オブジェクトストレージをベースにしたハイパフォーマンスクラウドネイティブファイルシステム。
  • OrangeFS - Orange File Systemは、並列仮想ファイルシステム(PVFS)のブランチ。
  • SnackFS - Cassandra上で構築された、小さなサイズで軽量なHDFS互換ファイルシステム。
  • GlusterFS - Gluster Filesystem。
  • XtreemFS - すべてのストレージニーズに適合する、耐障害分散ファイルシステム。
  • SeaweedFS - Seaweed-FSはシンプルで高スケーラブルな分散ファイルシステム。2つの目標がある:数十億のファイルを保存すること、ファイルを高速で提供すること。完全なPOSIXファイルシステムセマンティクスをサポートするのではなく、キー~ファイルマッピングのみを実装している。“NoSQL”に似た名前を付けられる。“NoFS”と呼べる。
  • S3QL - すべてのデータをGoogle Storage、Amazon S3、OpenStackなどのストレージサービスを使ってオンラインで保存するファイルシステム。
  • LizardFS - ソフトウェア定義ストレージは、分散型、並列型、スケーラブル、耐障害、地理的リダンダンシー、高可用性を備えたファイルシステム。

シリアライズ形式

  • AKF - AIネイティブなファイルフォーマット。20以上のフォーマット(DOCX、PDF、画像、コード)に埋め込まれる信頼スコア、ソースプロヴァイエンス、コンプライアンスメタデータ。EXIF for AI。
  • Apache Avro - Apache Avro™はデータシリアライゼーションシステム。
  • Apache Parquet - Hadoopエコシステム内のどのプロジェクトにも利用可能で、データ処理フレームワーク、データモデル、プログラミング言語に関わらず、列形式のストレージフォーマット。
    • Snappy - 高速圧縮/解圧機能。Parquetと併用。
    • PigZ - 現代のマルチプロセッサ、マルチコアマシン向けのgzipの並列実装。
  • Apache ORC - Hadoopワークロード向けの最小サイズかつ最高速の列形式ストレージ。
  • Apache Thrift - Apache Thriftソフトウェアフレームワーク。スケーラブルなクロス言語サービス開発に用いる。
  • ProtoBuf - プロトコル・バッファーズ - グーグルのデータ交換形式
  • SequenceFile - キー/値ペアのバイナリフラットファイル。MapReduceにおける入出力形式として広く使用されている。
  • Kryo - Java用の高速かつ効率的なオブジェクトグラフシリアライゼーションフレームワーク
  • PFC-JSONL - ブロックレベルのタイムスタンプインデックスとDuckDB統合を備えた特別なJSONLログ圧縮器。時間範囲のランダムアクセスクエリに対応し、約9%の圧縮率(gzipより優れる)を達成。
  • ParquetKit - DuckDB-WASMによって駆動されたブラウザベースの閲覧機能、SQLワークベンチ、およびParquetファイルの変換ツール。完全にクライアントサイドで動作し、アップロード不要。

ストリーム処理

  • Apache Beam - バッチ処理とストリーミングデータ処理の両方を実装する統一されたプログラミングモデル。複数の実行エンジン上で実行可能なジョブを提供。
  • Spark Streaming - スケーラブルかつ障害耐性の高いストリーミングアプリケーションの構築を容易にする。
  • Apache Flink - データストリーム上の分散計算におけるデータ配分、通信、障害耐性を提供するストリーミングデータフローエンジン。
  • Apache Storm - 無料かつオープンソースの分散リアルタイム計算システム。
  • Apache Samza - 分散ストリーミング処理フレーム及。
  • Apache NiFi - 使いやすく、強力で信頼性の高いデータ処理および配布システム。
  • Apache Hudi - リアルタイム処理用ストレージ管理を管理するオープンソースフレームワーク。特に注目すべき機能は、Upsertである。
  • CocoIndex - AI用の新インデックスを構築するオープンソースETLフレームワーク。
  • VoltDB - リアルタイムデータを継続処理するエンジン・フレームワークです。 shared nothing architecture
  • PipelineDB - ストリーミングSQLデータベース。
  • Spring Cloud Dataflow - Spring Bootアプリ間のストリーミングとタスクの実行。
  • Bonobo - Python 3.5以降向けのデータ処理ツールキット。
  • Robinhood’s Faust - asyncioと静的型付けを用いた、永続的にスケーラブルなイベント処理とメモリ内持続K/Vストアとしてのライブラリ。
  • HStreamDB - IoTデータストレージおよびリアルタイム処理に特化したストリーミングデータベース。
  • Kuiper - Golangで実装されたエッジ向け軽量IoTデータ分析/ストリーミングソフトウェア。これにより、リソース制限されたエッジデバイス上で実行可能。
  • Zilla - - イベント駆動アーキテクチャおよびストリーミング向けAPIゲートウェイ。HTTP、SSE、gRPC、MQTT、およびネイティブKafkaプロトコルをサポート。
  • SwimOS - リアルタイムストリーミングデータ処理アプリケーションを構築するためのフレームワークで、多様なイングリッシュソースをサポートしています。
  • Pathway - パフォーマンスに優れたオープンソースPython ETLフレームワークで、Rustランタイムを採用し、300以上のデータソースをサポートしています。

バッチ処理

  • Hadoop MapReduce - 大量のデータ(マルチテラバイトデータセット)を、大規模なクラスタ(数千ノード)上で並列に、信頼性と障害耐性を確保しながら処理できるアプリケーションを簡単に書くためのソフトウェアフレームワークです。
  • Spark - 単一ノードマシンまたはクラスタ上でデータエンジニアリング、データサイエンス、機械学習を実行するためのマルチ言語エンジンです。
    • Spark Packages - Apache Spark向けのパッケージのコミュニティインデックスです。
    • Deep Spark - Apache Sparkと異なるデータストアを接続するもの。非推奨です。
    • Spark RDD API Examples - 陳述者:Zhen Heによる例です。
    • Livy - REST Sparkサーバーです。
    • Delight - 大量のデータを迅速かつコスト効率よく処理できるウェブサービスです。
  • AWS EMR - Kubernetes上でデプロイされたクラウドベースプラットフォームで、Apache Sparkを開発者にとってより使いやすく、コスト効率的にしています。
  • Data Mechanics - データ処理に用いる複雑な有向無サイクルグラフ(DAG)を実現するアプリケーションフレームワークです。
  • Tez - 汎用データ処理用の軽量エンジンで、バッチおよびストリーム分析を含みます。これは、データを_関数_で表現し、データ処理を_列操作_で行う、従来のMapReduceやSQLのようなセット操作に依存しない、独自のデータモデルに基づいています。
  • Bistro - Goで書かれたクラウドネイティブなデータパイプラインおよび変換ツールキットです。
  • Substation - 個人ゲノム解析ツールキットで、raw DNAデータを17カテゴリ(健康リスク、祖先、薬理ゲノム学、栄養、心理学など)で分析し、終端スタイルの1ページHTML可視化を生成します。
  • dna-claude-analysis - スマートなアプリケーション向けの高速かつスケーラブルな機械学習APIです。
  • Batch ML
    • H2O - スケーラブルかつパフォーマンスの高い機械学習アプリケーションを迅速に作成できる環境です。
    • Mahout - Sparkのスケーラブル機械学習ライブラリで、分類、回帰、クラスタリング、協調フィルタリング、次元削減、およびその下位の最適化プリミティブを含みます。
    • Spark MLlib - 純Goによる古典的な機械学習ツールキットおよびデータエンジニアリングユーティリティ。外部依存なしの8アルゴリズムです。
    • Datatrax - スケールされたエンティティ解決を機械学習で実現するオープンソースマスターデータ管理プラットフォーム。Databricks、Microsoft Fabric、Snowflake、AWS、GCPにネイティブ対応。すべてのシステムとソース間で持続的にZingg IDを用いてゴールデンレコードを維持します。
    • Zingg - スケールしたエンティティ解決のために機械学習を用いたオープンソースのマスターデータ管理プラットフォーム。Databricks、Microsoft Fabric、Snowflake、AWS、GCPにネイティブに対応。すべてのシステムおよびソース間で持続的にZingg IDを用いてゴールデンレコードを維持。
  • Batch Graph
    • GraphLab Create - データサイエンティストやアプリ開発者向けに、スケールしたインテリジェントアプリの簡単に作成できる機械学習プラットフォーム
    • Giraph - 高スケーラビリティを実現するイテレーティブなグラフ処理システム
    • Spark GraphX - Apache Sparkにおけるグラフおよびグラフ並列計算用API
  • Batch SQL
    • Presto - 1つ以上の異質なデータソースに分散された大規模データセットをクエリできる分散型SQLクエリエンジン
    • Hive - データウェアハウスソフトウェアは、分散ストレージに保存された大規模データセットのクエリと管理を可能にする
      • Hivemall - Hive/Hadoop向けのスケーラブルな機械学習ライブラリ
      • PyHive - HiveおよびPresto向けのPythonインターフェース
    • Drill - Hadoop、NoSQLおよびクラウドストレージ向けのスキーマなしSQLクエリエンジン

チャートとダッシュボード

  • Highcharts - 純粋JavaScriptで書かれたチャートライブラリで、ウェブサイトやウェブアプリにインタラクティブなチャートを簡単に追加できる
  • ZingChart - 任意のデータセットに適用可能な高速JavaScriptチャート
  • C3.js - D3をベースにした再利用可能なチャートライブラリ
  • D3.js - データに基づいたドキュメント操作を行うJavaScriptライブラリ
    • D3Plus - D3のよりシンプルで使いやすいバージョン。ほとんどが事前に定義されたテンプレートで、データをただ入れるだけで使える
  • SmoothieCharts - ストリーミングデータ向けのJavaScriptチャートライブラリ
  • PyXley - FlaskとReactを使ってダッシュボードを構築するためのPython補助ツール
  • Plotly - Pythonでインタラクティブなウェブベース可視化アプリを構築するためのFlask、JS、CSSのテンプレート
  • Apache Superset - 現代的な、企業向けのビジネスインテリジェンスウェブアプリ
  • Redash - 企業のデータをドリブンに。どんなデータソースにも簡単に接続し、データを可視化して共有できる
  • Metabase - あなたの企業の誰もがデータを問いかけて、データから学べる、簡単でオープンソースの方法
  • stratif.io - オープンソース・セルフホスト型・ウェアハウスネイティブなプロダクト分析。DuckDB、Postgres、Snowflake、ClickHouse上で直接フューリー、リテンション、パスを実行可能
  • PyQtGraph - PyQt4 / PySide および numpy に構築された純粋 Python のグラフィックスおよびGUIライブラリ。数学・科学・工学分野のアプリケーション向けに設計されている。
  • Seaborn - matplotlib をベースにしたPythonの可視化ライブラリ。魅力的な統計グラフの描画に高レベルのインターフェースを提供する。
  • QueryGPT - 自然言語によるデータベースクエリインターフェースで、自動チャート生成をサポート。中国語および英語のクエリに対応。
  • AI for Database - データベース(PostgreSQL、MySQL、MongoDBなど)を接続し、英語でクエリを実行できるアグエントAIプラットフォーム。データ変更によってトリガーされる自己更新型のスマートダッシュボードおよびアクションフローを含む。
  • Dekart - BigQuery、Snowflake、PostGIS向けのオープンソースSQLマッピングプラットフォーム。
  • LunaPad - 再利用可能なSQLワークフロー、インタラクティブレポート、AI支援データ探索を可能にするオープンソース分析ノートブック。

ワークフロー

  • Bonnard - 顧客のデータに安全にアクセスする、多顧客対応のMCP(Multi-Client Platform)。あなたのデータウェアハウス、dbt、または意味論的レイヤーをAIエージェント向けの安全で顧客ごとのMCPに変換できる。
  • Nika - AIデータパイプライン向けの意図-as-codeワークフローエンジン:実行前に静的に検証(スキーマ、許可、コスト下限)されたYAML形式のDAG(有向無環グラフ)を提供し、実行履歴に変更を検出できるようにする。
  • OrionBelt Semantic Layer - BigQuery、ClickHouse、Databricks、Dremio、DuckDB、MySQL、PostgreSQL、Snowflakeの8エンジンにわたるYAMLで定義された次元、測定、メトリクスを最適化されたSQLにコンパイルするオープンソース意味論的サイドカーサービス。統一されたREST、MCP、Postgresのワイヤープロトコル。1つのモデルがAIエージェント、分析、データ品質ルール、KPIを駆動する。
  • Bruin - BigQuery、Snowflake、Post及以降のデータインプット、変換(SQL+Python)、データ品質を1つのCLIで統合したエンドツーエンドデータパイプラインツール。VS Code拡張機能を備え、リアルタイムプレビューを提供。
  • DataFlow - データ準備、合成データ生成、AI/データパイプラインを支援するオープンソースプラットフォーム。データおよびAIタスクのワークフローステップを自動化する再利用可能なスキルを含む。
  • Luigi - 複雑なバッチジョブパイプラインを構築するためのPythonモジュール。
  • CronQ - データパイプラインのオーケストレーション・スケジューリングを支援するツールです。 Used
  • Cascading - Javaベースのアプリケーション開発プラットフォーム。
  • Airflow - データパイプラインをプログラムで作成、スケジュール、監視できるシステム。
  • Azkaban - LinkedInで開発されたHadoopジョブを実行するためのバッチワークフロージョブスケジューラ。Azkabanはジョブの依存関係を通じて順序を解決し、ワークフローのメンテナンスおよび追跡に簡単なウェブインターフェースを提供する。
  • Oozie - Apache Hadoopジョブの管理を目的としたワークフロースケジューラシステム。
  • Pinball - DAGベースのワークフロー管理者。ジョブフローはPythonでプログラム的に定義され、ジョブ間の出力の渡し合いをサポート。
  • Dagster - データアプリケーションの構築に用いるオープンソースPythonライブラリ。
  • Hamilton - データ変換を有向無環グラフ(DAG)として定義するための軽量ライブラリ。dbtのSQL変換に好んでいたなら、HamiltonのPython処理も好むだろう。
  • Kedro - 一貫したプロジェクトテンプレート、データ抽象、設定、パイプライン構築を提供することで、堅牢でスケーラブルなデータパイプラインを簡単に構築できるフレームワーク。
  • Dataform - オープンソースのフレームワークおよびウェブベースのIDEで、データセットとその依存関係を管理できます。SQLXは、既存のSQLウェアハウスの文法に拡張し、依存関係管理、テスト、ドキュメンテーションなどをサポートする機能を追加します。
  • Dotflow - リトライ、並列実行、クロントスケジューリング、およびアシンクサポートを備えた軽量なPythonライブラリで、実行パイプラインを構築できます。
  • Census - クラウドウェアハウスからSalesforce、Marketo、HubSpot、ZendeskなどSaaSアプリケーションへデータを同期する逆ETLツールです。エンジニアリングの知識が不要—ただSQLで実行できます。
  • dbt - データアナリストやエンジニアがウェアハウス内のデータをより効果的に変換できるようにするコマンドラインツールです。
  • Kestra - スケーラブルでイベント駆動、言語に依存しないオーケストレーションとスケジューリングプラットフォームで、数百万のワークフローをコードで宣言的に管理できます。
  • RudderStack - アプリケーション、ウェブサイト、SaaSプラットフォームからデータを収集し、ウェアハウスおよびビジネスツールでアクティブにできる、ウェアハウス中心の顧客データプラットフォームです。
  • PACE - データのアクセス、使用、変換に関する合意を強制できるオープンソースフレームワークで、データプラットフォーム(Snowflake、BigQuery、DataBricksなど)にかかわらず適用できます。
  • OneQuery - 承認されたデータソースのアグリゲートにわたるエージェントの安全かつ検証可能なクエリを実行するためのセルフホスト型ゲートウェイです。
  • Prefect - オーケストレーションと可視性プラットフォーム。開発者は、迅速に頑健なコードを構築・拡張し、障害の原因を簡単に特定できます。
  • Multiwoven - 現代のデータチーム向けのオープンソース逆ETL、データアクティベーションプラットフォームです。
  • SuprSend - 通知サービスのAPIを使って自動化されたワークフローと論理を作成し、テンプレート、バッチ処理、設定、アプリ内インボックスを追加して、データウェアハウスから直接通知をトリガーできます。
  • Mage - データの変換と統合を行うためのオープンソースデータパイプラインツールです。
  • SQLMesh - SQLおよびPythonベースのデータパイプラドの管理、テスト、デプロイを、バージョン管理、環境分離、自動依存関係解決を含むオープンソースデータ変換フレームワークです。

データレイク管理

  • lakeFS - オブジェクトストレージベースのデータラクを高耐性と管理性を提供するオープンソースプラットフォームです。
  • Project Nessie - データラク向けのトランザクションカタログで、Gitのようなセマンティクスを提供。Apache Icebergテーブルと互換です。
  • Ilum - KubernetesおよびHadoop環境におけるApache Sparkクラスタの管理および監視を簡素化するモジュラーデータラクハウスプラットフォームです。
  • Gravitino - データラク、データウェアハウス、外部カタログの統一メタデータ管理を提供するオープンソースプラットフォームです。
  • FlightPath Data - FlightPathはデータラクのブロンレイヤーへのゲートウェイであり、信頼できる発行者として、無効な外部データファイルフィードを保護します。
  • rawquery - Apache Icebergベースのマネージドラクハウスプラットフォームで、DuckDBクエリ計算、S3ストレージ、Postgresワイヤープロトコル、SQL変換を提供します。

ELK(Elasticsearch・Logstash・Kibana)

  • docker-logstash - 高度にカスタマイズ可能なLogstash (1.4.4) - DockerイメージでElasticsearch (1.7.0) - およびKibana (3.1.2)を実行しています。
  • elasticsearch-jdbc - Elasticsearch 用の JDBC インポートツール
  • ZomboDB - PostgreSQL 延長機能で Elasticsearch にバックアップされたインデックスを作成可能

Docker

  • Gockerize - Go サービスを最小限の Docker コンテナにパッケージ化
  • Flocker - Docker コンテナとそのデータを簡単に管理
  • Rancher - RancherOS は 20MB の Linux ディストリビューションで、すべての OS を Docker コンテナとして実行
  • Kontena - 一般の人々向けのアプリケーションコンテナ
  • Weave - Docker コンテナをアプリケーションに統合
  • Zodiac - Docker化されたアプリケーションの簡単なデプロイとロールバックを可能にする軽量ツール
  • cAdvisor - 実行中のコンテナのリソース使用量とパフォーマンス特性を分析
  • Micro S3 persistence - S3 に Docker ボリュームデータを保存・復元するための Docker ミクロサービス
  • Rocker-compose - 複数コンテナから構成されたアプリケーションをデプロイするための、一貫性を保つ機能を備えた Docker コンポジションツール。非推奨
  • Nomad - 長期間実行されるサービスや一時的なバッチ処理ワークロードに適したクラスタマネージャー
  • ImageLayers - Docker イメージとその構成層を可視化

データセット

リアルタイム

  • DexPaprika - 34のブロックチェーンを横断し、3,000万以上のプールと2,700万以上のトークンについて約1秒間隔のDEXデータをSSE配信します。APIキーとレート制限はありません。 Docs
  • Helium MCP - リアルタイム金融データ、320万件以上のニュース記事、機械学習によるオプション価格算定、ニュースの偏り分析を提供するリモートMCPサーバー。無料でAPIキーは不要です。 MCP
  • Twitter Realtime - ストリーミングAPIは開発者がTwitterのグローバルなツイートストリームに低遅延でアクセスできるようにする
  • Sorsa API - リアルタイム X(Twitter)データAPIがツイート、プロフィール、検索、コミュニティ、エンゲージメントメトリクスを提供。公式X APIと比べて最大50倍安価で、20リクエスト/秒の制限、JSON出力
  • Eventsim - イベントデータシミュレーター。ユーザーのセットから偽乱数イベントを生成し、ウェブトラフィックをシミュレート
  • Eventum - 複雑な相関関係を持つ合成イベントストリームを生成するデータ生成プラットフォーム
  • Reddit - Reddit に投稿されたコメント、投稿、リンクなどのリアルタイムデータが提供される

データダンプ

  • GitHub Archive - 2011年から公開されているGitHubの公開タイムライン、1時間ごとに更新
  • Common Crawl - ウェブスクレイピングデータのオープンソースリポジトリ
  • Wikipedia - ウィキペディアがすべてのウィキを完全にコピーしたもの。ウィキテキストソースとXMLに埋め込まれたメタデータの形。また、SQL形式のいくつかの原始データベーステーブルも提供されている。
  • The Quiet-Broke Index - アメリカ合衆国における家庭のコスト負担(住宅、税金、保育、医療、輸送)をカセンACS、BLS消費者支出調査、HUDの公正市場賃料から集計した30メートルの合成データ。オープンメソッド、無料、メールゲートなし。
  • FirstData - 世界で最も包括的かつ信頼できるデータソース知識ベース。政府、国際機関、研究機関から160以上のキュレートされたソースを含む。MCP統合。
  • Mindweave Synthetic Business Data - 42テーブルの合成中小企業データセット。二重記録会計、税務準拠(オーストラリア/アメリカ/イギリス)、時間的現実性を備えている。CSV、SQL、Parquet、SQLite。ETLパイプラインのテストに最適。
  • LatAm Synth - ラテンアメリカの合成金融貯蓄行動生成器:ユーザー、貯蓄目標、取引が50万6千件の実際の記録(2015~2024)に基づいて調整されている。シードで再現可能、100%合成。

監視

Prometheus

  • Prometheus.io - オープンソースのサービス監視システムおよび時系列データベース。
  • HAProxy Exporter - シンプルなサーバーでHAProxyの統計をスクレイピングし、Prometheusの消費に向けたHTTPでエクスポートする。
  • Signals CLI - 意図信号監視CLI。LinkedInのエンゲージャー、キーワード投稿者、職業変更者、資金調達イベントを追跡。データパイプライン向けJSON出力。

プロファイリング

データプロファイラー

  • Data Profiler - DataProfilerは、データ分析、監視、センシティブデータ検出を容易にするPythonライブラリ。
  • YData Profiling - 一般用途のオープンソースデータプロファイラー。データセットの高レベル分析に特化。
  • Desbordante - データ内の複雑なパターンの発見と検証に特化したオープンソースデータプロファイラー。

スキーマ

  • SchemaCrawler - データスキーマの管理・検証・互換性を支援するツールです。

テスト

  • Aegis DQ - オープンソースのエージェント型データ品質フレームワーク。LLMによる診断、原因分析、SQL自動修正提案、31のルールタイプを備えている。DuckDB、Postgres、BigQuery、Databricks、Athena、Snowflakeに対応。
  • Grai - CIシステムに統合されたデータカタログツール。データ変更の下流影響テストを実行し、データパイプラインやBIダッシュボードを破壊する可能性のある変更を防止する。
  • DQOps - データ品質プラットフォーム。データソースのプロファイリングからデータ品質監視の完全自動化まで、データプラットフォームライフサイクル全体をカバー。
  • DataKitchen - エンドツーエンドデータジャーニーの観測、データプロファイリング、異常検出、自動生成されたデータ品質検証テストを提供するオープンソースデータ可観測性。
  • GreatExpectation - データ品質を管理するオープンソースデータ検証フレームワーク。ユーザーはデータがどのように見えるべきか、どのように振る舞うべきかについて「期待」ルールを定義および記録できる。
  • Provero - ベンダー中立かつ宣言型のデータ品質エンジン。YAMLでチェックを定義し、どこでも実行可能。16の組み込みチェックタイプ、SQLバッチ最適化、異常検出、データ契約を含む。
  • Scherlok - ゼロ設定データ品質CLI。初回実行時にすべてのテーブルをプロファイリングし、その後の実行で自動的に異常(ボリュームの減少、スキーマの変化、新鮮度の欠如、分布のシフト)を検出。YAMLやルールの記述不要。Postgres、BigQuery、Snowflake、dbtに対応。
  • RunSQL - MySQL、PostgreSQL、SQL Server向けの無料オンラインSQLプレイヤー。データベース構造を作成し、クエリを実行し、結果を即時共有できる。
  • Spark Playground - Spark PlaygroundのオンラインコンパイラでPySparkコードを書く、実行、テスト。実際のサンプルデータセットにアクセスし、インタビュー問題を解いてデータエンジニアリング職に必要なPySparkスキルを向上させる。
  • daffy - デコレーター中心のデータフレームの契約/検証(列/データ型/制約)を関数境界で行う。Pandas/Polars/PyArrow/Modinに対応。
  • Snowflake Emulator - ローカル開発およびテスト用のSnowflake互換エミュレーター。
  • DataScreenIQ - パイプラインおよびAPI向けのリアルタイムデータ品質ファイアウォール。スキーマのずれ、nullの急増、型の不一致、データ異常をミリ秒単位で行い、PASS/WARN/BLOCKの判断を下す。
  • DataDriven - SQLクエリ実行、Python、データモデリングの練習を含むインタビュー練習。
  • Fixzi - JSON/XMLの検証およびAPI契約モニタリングツール。構造化データのデバッグおよびテストに使用。

コミュニティ

フォーラム

  • /r/dataengineering - データエンジニアリングに関するニュース、ヒント、背景情報。
  • /r/etl - ETLに特化したサブレッド。
  • AI Dev Jobs - AI、ML、データエンジニアリング職種に特化したジョブボード。7,400以上の求人、給与データ、無料REST APIを提供。

カンファレンス

  • Data Council - データエンジニアリング関連のカンファレンスです。

ポッドキャスト

  • Chain of Thought - AIおよびデータインフラのリーダーによる、生産環境システム構築に関するインタビュー。
  • Data Engineering Podcast - 現代データインフラに関する番組。
  • Latent Space - AIエンジニアリングに関する技術的な深掘り。モデルトレーニングからデプロイまで。
  • Practical AI - AIを誰にでも実用的、生産的、アクセス可能にする。
  • Software Engineering Daily - 技術的なソフトウェアテーマに関する毎日のインタビュー。データインフラを含む。
  • The Analytics Engineering Podcast - アナリティクスエンジニアがスケールしたデータパイプラインを構築・維持する方法。
  • The Data Stack Show - データエンジニア、アナリスト、データサイエンティストがデータインフラの構築・維持、データおよびデータ製品の提供、ビジネス全体のデータによる成果向上について語る番組。

書籍

  • Snowflake Data Engineering - Snowflakeクラウドデータプラットフォームにおけるデータエンジニアリングの実用的な導入。
  • Best Data Science Books - このブログは、テーマと学習段階に分類されたトップデータサイエンス書のキュレーションリストを提供し、読者に基礎知識の構築と業界トレンドの把握を支援。
  • Architecting an Apache Iceberg Lakehouse - Apache Icebergのラケーハウスをゼロから設計するためのガイド。
  • Learn AI Data Engineering in a Month of Lunches - 大規模言語モデルをデータワークフローに統合するための速い、親しみやすいガイド。