AWS、19日からの大規模障害について謝罪し、再発防止策を発表
米Amazon傘下のAmazon Web Services(AWS)は10月22日(米太平洋時間)、19日から20日にわたって続いた大規模障害の概要と対策をまとめ、謝罪するWebページを公開した。
この障害は、主にN. Virginia(us-east-1)リージョンで発生し、「Amazon DynamoDB Service Disruption in Northern Virginia(US-EAST-1) Region」として報告された。影響は10月19日午後11時48分に始まり、主要な回復は10月20日午後2時20分に完了したが、顧客のアプリにはさらに長い影響があった。
この一連の障害の根本的な原因は、DynamoDBの自動DNS管理システム内に潜んでいた潜在的な競合状態だった。この競合状態の結果、システムの自動化が修復に失敗したにもかかわらず、サービスのリージョンエンドポイントに対して誤った空のDNSレコードが適用され、DynamoDBへの接続が不可能となった。
これにより、顧客のトラフィックだけでなく、DynamoDBに依存するAWS内部サービスのトラフィックもDNS障害に見舞われ、その後のEC2インスタンスの起動失敗や、Network Load Balancer(NLB)のヘルスチェックエラーなど、広範な影響につながった。
AWSは、再発防止と回復時間短縮のために複数の変更を実施している。
まず、障害の引き金となったDynamoDBのDNS PlannerおよびDNS Enactorの自動化システムを全世界で無効化した。この自動化システムを再度有効化する前に、競合状態のシナリオを修正し、不正確なDNSプランの適用を防ぐための追加の保護策を導入する予定だ。
NLBについては、ヘルスチェックの失敗が原因でAZフェイルオーバーが発生した場合に、単一のNLBが削除できるキャパシティを制限するための速度制御メカニズムを追加する。
Amazon EC2に関しては、DWFM(DropletWorkflow Manager)の回復ワークフローを検証するための追加のテストスイートを構築し、既存のスケールテストを補強する。また、EC2データ伝播システムにおけるスロットリングメカニズムを改善し、待機キューのサイズに基づいて着信作業をレート制限することで、高負荷時のサービス保護を強化する。
AWSは、今後もすべてのAWSサービスにわたるこの事象の詳細な調査を継続し、将来的に同様の事象による影響を回避し、回復時間をさらに短縮するための追加の方法を探求していくとしている。
最後に「この事象がお客様に与えた影響について、深くお詫び申し上げます」と謝罪した。「この事象が非常に多くのお客様に多大な影響を及ぼしたことを認識しています。当社は、この事象から学び、可用性をさらに向上させるために、できる限りのことを尽くしてまいります」
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
Ankerのスピーカーでまた発火事故 過去にも5回の火災で回収・交換中 消費者庁「直ちに使用中止を」
-
2
「さくらのレンタルサーバ」に不正アクセス 583アカウントが不正ログイン被害、個人データなど漏えいのおそれ
-
3
両毛システムズ、社内システムに不正アクセス被害
-
4
「うんこミュージアム」公式サイト改ざん被害、個人情報4人分流出のおそれ
-
5
千葉水害、半数以上が“ハザードマップの浸水エリア外”で起きていた ウェザーニューズ調査より
-
6
LINE着せかえ“デザイン崩れ”問題、返金フォーム設置 ただ「返金できない場合も」
-
7
「Claude」の“見えない透かし”、Anthropicが仕組みを説明 「完全な書き直しなら消える」
-
8
スマートリングは日本でブレイクするか 高精度な睡眠モニターと分析の「Ultrahuman Ring AIR」を試す
-
9
河川監視のライブカメラ水没か――千葉豪雨、村田川の映像が水中に 「こんなの初めて見た」
-
10
豪雨被害の千葉で「通れた道マップ」トヨタが公開 直近3時間の通行実績が分かる
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR