あれどうなったの? 大規模障害・インシデントのその後2023
覚えてる? 約2週間続いたKDDIのクラウド障害、その後の対応は
2023年も残り数週間。今年もIT業界ではさまざまな出来事があった。大規模障害やインシデントなど、今年に置いていきたい出来事も少なくない。ところで、今年あった障害やインシデントが、その後どんな結末になったかはご存じだろうか。
本連載では、そんな「あれどうなったの?」を、事後対応の参考や、来年に向けた教訓として追いかけていく。第1回となる今回は、1月末から2月にかけてKDDIが起こした大規模クラウド障害に注目。約2週間にわたったクラウド障害は、その後どうなったのか。
約2週間のクラウド障害、原因は……
障害が発生したのは1月28日のこと。同社のクラウドサービス「KDDIクラウドプラットフォーム」の「jp2-east05」ゾーン(リージョンを構成するサーバ群の単位)で、ストレージに起因するトラブルが起きた。完全復旧には2週間以上かかる可能性もあると発表したことから話題になり、東京都葛飾区図書館の公式サイトなど、実際にサービス提供に支障をきたす例も出た。
結局、設備の問題が解消したのは2月8日。KDDIによると、障害は「ハードウェアメモリが故障したことで、ストレージ内に不整合なメタデータ(ストレージ上のデータ保存位置情報)が発生した」ことによるものだったという。
不整合なメタデータによってデータの処理が正常に完了せず、CPUが高負荷状態になり、ストレージの制御機器がアクセス不能な状態に。ストレージの筐体は2つ、制御機器は各筐体に2つずつ備えることで冗長化していたが、うち3つにアクセスできなくなったことで障害につながったとしている。KDDIは当時、ストレージ機器を新規に構築し、データを移行するなどして復旧していた。
「メモリが非公表の不良ロットに該当していた」 その後分かったこと
KDDIは復旧後、再発防止策を講じている。まず、2月18日に障害の原因となったメモリを調査・交換した。故障したメモリは、非公表の不良ロットに該当していたという。新たに構築したストレージでは、不良ロットのメモリを使っていないことも確認した。
3月には、メモリのエラー監視を自動化する仕組みも実現。その後も定期的な復旧訓練などを行っているという。ユーザーに対しては返金も実施。仮想サーバの月間稼働率がSLA(99.99%)に満たなかった場合は、その月の利用料の1割を返金。さらに、仮想サーバが全く利用できない状態が24時間以上続いた場合、その日数分の利用料金を返金したという。
KDDIは公式サイトで「ご迷惑をお掛けしたことを、改めて深くお詫びする。再発防止を徹底するとともに、安心して利用してもらえるサービスを提供する」としている。
Copyright © ITmedia, Inc. All Rights Reserved.
あれどうなったの? 大規模障害・インシデントのその後2023
2023年に発生した大規模障害やインシデントなどの“その後”を追いかける。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
なぜ酒蔵の許諾なしに? 「VTuberコラボ日本酒」騒動、主催者が経緯説明 仲介者による調整で「準備進んでいると認識」
-
2
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
3
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
4
本物そっくり“AI生成レシート“が経費精算の脅威に マネフォ「自力で見破るのは難しい」 企業はどう備える?
-
5
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
6
デジタル庁に不正アクセス、個人情報24.6万件漏えいか 各府省庁の職員情報など
-
7
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
8
松本デジタル相、24.6万件漏えい可能性について説明 「既知の脆弱性を対応前に悪用」
-
9
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
10
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR