Googleサービスでの8月20日の大規模障害について、Googleが原因と対策を説明
米Googleは8月24日(現地時間)、19日(日本では20日)に発生した一連のサービスの大規模障害について、原因と対策を説明した。
この障害は、19日の午後8時55分~20日の午前3時30日に、複数のG SuiteおよびGoogle Cloud Platform製品でエラー、利用不可、配信の遅延が発生したというもの。日本でもGmailにファイルを添付しようとするとエラーが表示されるなどの不具合が数時間にわたって報告された。
問題は、小規模なものも含めると、Gmail、Googleドライブ、Google Docs、New Google Sites、Chat、Meet、Keep、Google Voice、Jamboard、Admin Console、App Engine、Cloud Logging、Cloud Storageなど多岐にわたった。
根本的な原因は、Googleの多様なサービスで使っている、BLOB(Binary Large OBject)と呼ばれる非構造化データに共通の内部分散システムでの過負荷。このBLOBストレージシステムには、Google内部のクライアントサービスと接続するフロントエンド、メタデータ操作のための中間層、BLOB自体のバックエンドストレージが含まれる。
別のGoogleサービスからのトラフィックの増加により、BLOBメタデータサービスの過負荷が始まって待ち時間が発生し、操作が過度に再試行されたことでリソースが使い果たされた。失敗したリクエストをキャンセルして再試行しようとすることで事態は悪化し、トラフィックがさらに増加した。
なお、Google Cloud Storageも同じBLOBストレージシステム上に構築されているが、メタデータレイヤーが分離されていたため、被害は少なかったという。
今後の対策として、以下を挙げた。
- 根本的な原因の完全修復まで、BLOBメタデータサービスへの計算リソースの割り当て増加
- メタデータサービスタスク起動時のヘルスチェックの改善
- メタデータ操作失敗の際に使うバックオフと再試行の戦略の改善
- 単体エラーがリソース全体でキャンセルリクエストのフラッドになる問題の修復
- BLOBサービスのアラートの改善
- BLOBサービスへのリクエストに対するより包括的なレート制限制御の実装
- BLOB操作のデバッグ方法の改善
- タスク間でのリソース転送速度、効率、自動化の改善
- BLOBサービスのレート制限制御に関する内部マニュアルの改善
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
なぜ酒蔵の許諾なしに? 「VTuberコラボ日本酒」騒動、主催者が経緯説明 仲介者による調整で「準備進んでいると認識」
-
2
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
3
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
4
本物そっくり“AI生成レシート“が経費精算の脅威に マネフォ「自力で見破るのは難しい」 企業はどう備える?
-
5
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
6
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
7
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
-
8
「ペンギンを返して」 Suica新キャラ候補3案公開でSNSに戸惑いの声 一般投票は8日から
-
9
「iPhone Duo」純正ケース話題、「面白いけど高い」……1万4800円と2万4800円
-
10
早すぎる 「めっちゃカメレオン」Switch 2版、即日10万本突破
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR