Google Cloudの大規模障害についてGoogleが原因と対策を説明
米Googleは6月13日午後4時45分(米太平洋時間)、12日の午前10時51分に発生し、同日午後6時18分に収束したGoogle Cloudのサービス障害について、原因と対策を報告した。
原因はAPI管理システムの新機能のコード不備
今回の障害は、GoogleのAPI管理システムである「Service Control」における新しいクォータポリシーチェック機能のコードの不備が主な原因という。
5月29日にService Controlに追加された新しいクォータポリシーチェック機能のコードに、適切なエラーハンドリングが欠けており、また重要な「機能フラグ」による保護もされておらず、6月12日にService Controlが使用する地域ごとのSpannerテーブルに、意図しない空のフィールドを含むポリシー変更が挿入された。
この誤ったポリシーデータが処理される際、不備のあるコードパスが実行され、nullポインタエラーが発生。これによりService Controlのバイナリが世界中でクラッシュループに陥った。
障害発生から2分以内に対処開始
Site Reliability Engineeringチームは、障害発生から2分以内に対応を開始し、10分以内に根本原因を特定した。
問題のあるAPI提供パスを無効化する「赤ボタン」を導入し、障害発生から40分以内にサービスの回復が始まった。サービス回復後すぐに、Service Conrolシステムのすべての変更と手動でのポリシー更新を一時的に停止した。
今後の改善アプローチ
Googleは、こうした障害を繰り返さないために以下の対策を優先的に実施すると表明した。
- Service Controlのアーキテクチャのモジュール化
- グローバルに複製されるデータの監査
- 機能フラグによる保護の徹底
- エラーハンドリングとテストの改善
- 指数関数的バックオフの徹底
- 外部コミュニケーションの改善
- 監視および通信インフラストラクチャの継続的な運用
- API管理プラットフォームの堅牢化
- メタデータの伝播保護
Googleはこの障害報告の冒頭で「この度の障害による影響について深くお詫び申し上げます。Google Cloudのお客様とそのユーザーの皆様は、Googleにビジネスを託してくださっているのですから、私たちは今後、より良いサービスを提供していく所存です。お客様のビジネスとユーザーの皆様だけでなく、弊社のシステムに対する信頼にも影響を与えたことをお詫び申し上げます。今後、このような障害が発生しないよう、改善に努めてまいります」と謝罪した。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
くら寿司、「ちいかわ」コラボ中止 従業員による不正行為判明で
-
2
配布前の「ちいかわ」グッズがメルカリに? くら寿司コラボ第2弾、初日から“内部犯”の臆測呼ぶ 第1弾に続き
-
3
「スーパーリアル麻雀 VR」でゲーセン通いの日々を思い出したマンガ家、ご褒美シーンの“限界突破“に驚愕
-
4
OpenAI、休眠サイトへの自社AIエージェント書き込みを認め、非公表の理由を説明
-
5
サントリー新商品の店頭POPに“生成AI疑惑” 成分表示にも誤りで物議……同社に事実関係を聞いた
-
6
SEGAそっくりのロゴで「MAGA」――トランプ政権公開のWebゲームが物議 移民送還などを題材に 【追記あり】
-
7
RIZAP社員、私用AIに顧客の個人情報入力 氏名や疾患、保険証番号など……同社が謝罪
-
8
OpenAIのAIエージェント、休眠サイトを掲示板化してタスク回答を共有か 研究団体が報告書公開
-
9
ダークチョコ(カカオ85%)を毎日3週間食べる→ネガティブ感情が減少 70%では変化なし 韓国での研究結果
-
10
ELYZAの「業務AIアプリをAIで作成」特許、「新規性ない」と批判殺到→謝罪後も収まらず
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR