⚡ 可用性・障害対応:AWS Glueの使いどころ

【Glueの役割(耐障害性と高可用性)】

目次

🔍 1. 結論

💎 一言でいうと AWS Glue は、異なるデータストア(S3やRDSなど)間でデータを抽出し、変換し、ロードする ETL(Extract, Transform, Load)サービス です。サーバーレス であるため、インフラの障害やスケーリングを気にすることなく、弾力的にデータ処理を実行できます。

  • Hadoopクラスター(EMRなど)を自前で立てる必要がなく、インフラ障害の心配が不要。
  • 「ジョブの自動リトライ機能」や、失敗した箇所から再開する「ジョブブックマーク」機能を備える。

📈 2. SAAで出やすいポイント

  • サーバーレスによる弾力性: 処理するデータ量がテラバイト級に跳ね上がっても、裏側でAWSがリソースを自動的にスケール(DPUの追加)させるため、ジョブがメモリ不足等で落ちるリスクが低減されます(インフラ運用からの解放)。
  • AWS Glue Data Catalog: S3などにあるデータが「どんな構造(スキーマ)をしているか」を記録する辞書。これがあるおかげで、Athena や Redshift Spectrum が「どこに何があるか」を瞬時に把握でき、分析環境全体の連携(疎結合と弾力性)が実現します。
  • ジョブブックマーク (Job Bookmarks): S3に継続的にアップロードされるログを処理する際、「前回どこまで処理したか」を記憶する機能。ジョブが途中で失敗しても、次回は未処理のデータから安全に再開できるため、耐障害性が高まります。

🗝 3. キーワードでの判断

問題文のキーワード 疑うサービス・機能
🛠️ 「サーバーレスでETL処理(抽出・変換・ロード)を行いたい」 AWS Glue
📖 「Athenaで検索するためのメタデータ(データ構造)を管理したい」 AWS Glue Data Catalog
🔙 「ETLジョブが失敗した際、重複処理を避けて続きから再開したい」 AWS Glue ジョブブックマーク

⚠️ 4. ひっかけポイント

🚫 よくある誤答パターン – Amazon EMR との違い: – EMR: Hadoop/Sparkのエコシステム(EC2クラスター)を自分で細かくチューニング・管理したい場合。 – Glue: インフラ管理をAWSに丸投げし、Sparkの処理(ETL)だけをサーバーレスで実行したい場合。 SAA試験において、「管理オーバーヘッドを最小化する」という要件があれば Glue が正解です。


💡 5. 覚え方

🧠 暗記ショートカット – Glue(接着剤) = 「データ界の凄腕引っ越し業者」。 – Aの家(S3)からBの家(Redshift)へ荷物(データ)を運ぶ際、箱詰め(抽出)、仕分け(変換)、運び込み(ロード)を全部自動でやってくれる。 – 途中でトラックがエンストしても、「ジョブブックマーク」のメモを見て途中から再開する。


📚 6. 関連サービス

アイコン サービス名 Glueとの関連
📊 Amazon Athena Glueデータカタログを参照して、S3のデータをSQL検索する
🪣 Amazon S3 Glueが処理するデータ(データレイク)の主な保管場所
🐘 Amazon Redshift Glueによって綺麗に変換・整理されたデータの最終ロード先

🗒️ 7. Obsidian管理メモ

  • 見返すタイミング: データ分析基盤(Data Lake)アーキテクチャの学習時
  • 関連ノート候補: AWS_SAA_DataLake_Architecture, AWS_SAA_Glue_vs_EMR

8. HTMLファイル名: AWS_弾力性設計_Glue.html

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

目次