AWS、19日からの大規模障害について謝罪し、再発防止策を発表
米Amazon傘下のAmazon Web Services(AWS)は10月22日(米太平洋時間)、19日から20日にわたって続いた大規模障害の概要と対策をまとめ、謝罪するWebページを公開した。
この障害は、主にN. Virginia(us-east-1)リージョンで発生し、「Amazon DynamoDB Service Disruption in Northern Virginia(US-EAST-1) Region」として報告された。影響は10月19日午後11時48分に始まり、主要な回復は10月20日午後2時20分に完了したが、顧客のアプリにはさらに長い影響があった。
この一連の障害の根本的な原因は、DynamoDBの自動DNS管理システム内に潜んでいた潜在的な競合状態だった。この競合状態の結果、システムの自動化が修復に失敗したにもかかわらず、サービスのリージョンエンドポイントに対して誤った空のDNSレコードが適用され、DynamoDBへの接続が不可能となった。
これにより、顧客のトラフィックだけでなく、DynamoDBに依存するAWS内部サービスのトラフィックもDNS障害に見舞われ、その後のEC2インスタンスの起動失敗や、Network Load Balancer(NLB)のヘルスチェックエラーなど、広範な影響につながった。
AWSは、再発防止と回復時間短縮のために複数の変更を実施している。
まず、障害の引き金となったDynamoDBのDNS PlannerおよびDNS Enactorの自動化システムを全世界で無効化した。この自動化システムを再度有効化する前に、競合状態のシナリオを修正し、不正確なDNSプランの適用を防ぐための追加の保護策を導入する予定だ。
NLBについては、ヘルスチェックの失敗が原因でAZフェイルオーバーが発生した場合に、単一のNLBが削除できるキャパシティを制限するための速度制御メカニズムを追加する。
Amazon EC2に関しては、DWFM(DropletWorkflow Manager)の回復ワークフローを検証するための追加のテストスイートを構築し、既存のスケールテストを補強する。また、EC2データ伝播システムにおけるスロットリングメカニズムを改善し、待機キューのサイズに基づいて着信作業をレート制限することで、高負荷時のサービス保護を強化する。
AWSは、今後もすべてのAWSサービスにわたるこの事象の詳細な調査を継続し、将来的に同様の事象による影響を回避し、回復時間をさらに短縮するための追加の方法を探求していくとしている。
最後に「この事象がお客様に与えた影響について、深くお詫び申し上げます」と謝罪した。「この事象が非常に多くのお客様に多大な影響を及ぼしたことを認識しています。当社は、この事象から学び、可用性をさらに向上させるために、できる限りのことを尽くしてまいります」
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
佐川急便、不正アクセスで個人情報流出か 送り主・届け先の氏名や住所など、約100日分の荷物データ対象
-
2
睡眠中に「ピンクノイズ」を聞くと“脳内ゴミ”の洗い流しが強まる? 米MITが人間で実験 Science系列誌で発表
-
3
免許証の悪用防止で申し込み集中 JICCがアプリ受付を一時休止 タイムズカー漏えいの影響か
-
4
「写真で一言 ボケて」きょう午後8時にサービス終了 18年・1億超のボケに幕
-
5
免許証の悪用防ぐ届出集中、CIC・JICCで手続き遅延 タイムズカー情報流出直後に
-
6
日本原子力機構に不正アクセス 研究者の顔写真付き身分証など漏えい
-
7
セイコーマート、会員のほぼ半数に当たる情報漏えい 約57万人分
-
8
「Gポイント」不正アクセスで一時停止 「会員識別子」約7万件漏えいか KDDI不正会計問題のジー・プランが運営
-
9
ドラッグ&ドロップ操作ミスで……TOPPAN、損保ジャパン契約者17万人分のデータを他社に誤送付
-
10
タイムズカー、退会者の免許証画像も「7年」保存していた理由 パーク24に聞いた
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR