【Glueの役割(耐障害性と高可用性)】
目次
🔍 1. 結論
💎 一言でいうと AWS Glue は、異なるデータストア(S3やRDSなど)間でデータを抽出し、変換し、ロードする ETL(Extract, Transform, Load)サービス です。サーバーレス であるため、インフラの障害やスケーリングを気にすることなく、弾力的にデータ処理を実行できます。
- Hadoopクラスター(EMRなど)を自前で立てる必要がなく、インフラ障害の心配が不要。
- 「ジョブの自動リトライ機能」や、失敗した箇所から再開する「ジョブブックマーク」機能を備える。
📈 2. SAAで出やすいポイント
- サーバーレスによる弾力性: 処理するデータ量がテラバイト級に跳ね上がっても、裏側でAWSがリソースを自動的にスケール(DPUの追加)させるため、ジョブがメモリ不足等で落ちるリスクが低減されます(インフラ運用からの解放)。
- AWS Glue Data Catalog: S3などにあるデータが「どんな構造(スキーマ)をしているか」を記録する辞書。これがあるおかげで、Athena や Redshift Spectrum が「どこに何があるか」を瞬時に把握でき、分析環境全体の連携(疎結合と弾力性)が実現します。
- ジョブブックマーク (Job Bookmarks): S3に継続的にアップロードされるログを処理する際、「前回どこまで処理したか」を記憶する機能。ジョブが途中で失敗しても、次回は未処理のデータから安全に再開できるため、耐障害性が高まります。
🗝 3. キーワードでの判断
| 問題文のキーワード | 疑うサービス・機能 |
|---|---|
| 🛠️ 「サーバーレスでETL処理(抽出・変換・ロード)を行いたい」 | AWS Glue |
| 📖 「Athenaで検索するためのメタデータ(データ構造)を管理したい」 | AWS Glue Data Catalog |
| 🔙 「ETLジョブが失敗した際、重複処理を避けて続きから再開したい」 | AWS Glue ジョブブックマーク |
⚠️ 4. ひっかけポイント
🚫 よくある誤答パターン – Amazon EMR との違い: – EMR: Hadoop/Sparkのエコシステム(EC2クラスター)を自分で細かくチューニング・管理したい場合。 – Glue: インフラ管理をAWSに丸投げし、Sparkの処理(ETL)だけをサーバーレスで実行したい場合。 SAA試験において、「管理オーバーヘッドを最小化する」という要件があれば Glue が正解です。
💡 5. 覚え方
🧠 暗記ショートカット – Glue(接着剤) = 「データ界の凄腕引っ越し業者」。 – Aの家(S3)からBの家(Redshift)へ荷物(データ)を運ぶ際、箱詰め(抽出)、仕分け(変換)、運び込み(ロード)を全部自動でやってくれる。 – 途中でトラックがエンストしても、「ジョブブックマーク」のメモを見て途中から再開する。
📚 6. 関連サービス
| アイコン | サービス名 | Glueとの関連 |
|---|---|---|
| 📊 | Amazon Athena | Glueデータカタログを参照して、S3のデータをSQL検索する |
| 🪣 | Amazon S3 | Glueが処理するデータ(データレイク)の主な保管場所 |
| 🐘 | Amazon Redshift | Glueによって綺麗に変換・整理されたデータの最終ロード先 |
🗒️ 7. Obsidian管理メモ
- 見返すタイミング: データ分析基盤(Data Lake)アーキテクチャの学習時
- 関連ノート候補:
AWS_SAA_DataLake_Architecture,AWS_SAA_Glue_vs_EMR
8. HTMLファイル名:
AWS_弾力性設計_Glue.html