„Amazon“ pasaulinis debesijos sutrikdymas: laiko juosta, priežastis ir apimtis

  • Pasaulinis AWS incidentas, kurio epicentras yra JAV rytų 1 zonoje, prasidėjo apie 9:00 val. ryto (pusiasalio laiku).
  • „Amazon“ aptiko šaltinį „DynamoDB“ ir pagrindinę DNS problemą, o iki vidurdienio problema buvo palaipsniui atkurta.
  • Poveikis kelioms paslaugoms: „Alexa“, „Prime Video“, „Canva“, „Duolingo“, „Snapchat“ ir vaizdo žaidimams, tokiems kaip „Fortnite“ ir „Roblox“
  • Konkretus poveikis tęsėsi iki popietės, kol buvo įgyvendintos švelninimo priemonės.

Bendras pasaulinio AWS sutrikimo vaizdas

Dėl plačiai paplitusio „Amazon Web Services“ (AWS) infrastruktūros sutrikimo su pertrūkiais sutriko tūkstančių platformų ir programų veikimas įvairiose šalyse. Šįryt anksti padaugėjo vartotojų pranešimų apie ryšio problemas, delsos problemas ir nepavykusius įkėlimus , ypač Jungtinėse Valstijose, o poveikis buvo matomas Europoje.

Remiantis bendrovės būsenos ataskaitų suvestine, problema kilo JAV rytų 1 regione (Šiaurės Virdžinijoje) ir sukėlė neįprastą klaidų dažnio padidėjimą keliose API. Iki vidurdienio AWS pranešė apie aiškius atsigavimo požymius daugelyje paslaugų, nors komandos vis dar dirbo, kad visiškai išspręstų problemą ir atkurtų visas operacijas į normalias vėžes.

Įvykio chronologija

Pirmieji įspėjimai gauti apie 9.00 val. ryto (Ispanijos pusiasalio laiku), o netrukus po to incidentų skaičius pasiekė piką, o stebėjimo priemonėse, tokiose kaip „DownDetector“, buvo nuolat rodomi pranešimai. Nuo 11.00 val. ryto bendrovė pranešė, kad nustatė galimą priežastį ir pradėjo įgyvendinti švelninimo priemones, kurios paspartino atkūrimą įvairiuose lygmenyse.

Apie vidurdienį AWS pranešė, kad dauguma operacijų grįžta į įprastas vėžes , nors pastebėjo, kad paveiktame regione kartais taikomi tam tikrų prašymų ir konkrečių paslaugų apribojimai. Ankstyvą popietę vis dar buvo jaučiamas likęs poveikis , nes tęsiamos stabilizavimo pastangos.

Iliustracija apie problemas „Amazon“ debesyje

Kur buvo techninė kilmė?

Bendrovė daugiausia dėmesio skyrė „Amazon DynamoDB“ – savo valdomai raktų ir reikšmių duomenų bazių paslaugai, kurios galinis taškas US-EAST-1 rajone patyrė gedimų, dėl kurių keliose priklausomybėse pasireiškė kaskadinės klaidos. AWS nurodė pagrindinę DNS problemą kaip priežastį, kuri buvo sprendžiama etapais.

Praktiškai, kai domenų vardų sistema (DNS) nepavyksta tinkamai išspręsti problemos, programos negali rasti savo išteklių , todėl kyla ryšio klaidų, skirtojo laiko pabaiga ir duomenų įkėlimo trikdžių. Kaip nenumatytų atvejų priemonę, AWS rekomendavo klientams, susiduriantiems su nuolatinėmis problemomis, išvalyti savo DNS talpyklas, kad būtų atkurtas sprendimas teisinguose galiniuose taškuose.

Kas buvo paveiktas

Poveikis buvo platus: pati „Amazon“ pranešė apie problemas su „Alexa“ ir „Prime Video“ , o trečiųjų šalių paslaugos, tokios kaip „Canva“ , „Duolingo“ ir „Snapchat“ , patyrė problemų . Taip pat buvo pastebėta sutrikimų generatyvinio dirbtinio intelekto platformose ir bendradarbiavimo programose, kurios priklauso nuo AWS debesijos.

Skaitmeninės pramogos taip pat nenukentėjo. Žaidimai ir paslaugos, turinčios dideles vartotojų bazes, pavyzdžiui, „Fortnite“ , „Roblox“ ir „Clash Royale“ , pranešė apie prisijungimo ar ryšio klaidas, o kai kurios žaidimų parduotuvės ir paleidimo priemonės įdiegė priemones, kad sumažintų poveikį, kol srautas stabilizuosis.

Poveikis Ispanijoje

Visoje šalyje daugybė vartotojų pranešė apie problemas, susijusias su prisijungimu prie skaitmeninių paslaugų programų ir svetainių, ypač apie vidurdienį. Taip pat buvo paveiktos tokios bilietų pardavimo platformos kaip „Ticketmaster“, todėl buvo atidėti vidurdienį numatyti bilietų išleidimai, įskaitant bilietus į labai laukiamus koncertus.

Finansų įstaigos ir pagrindinės vartotojų platformos pranešė apie pavienius incidentus savo internetinėse sistemose, nors jų poveikis skyrėsi priklausomai nuo regiono ir paslaugos. Įgyvendinus švelninimo priemones paveiktame JAV regione, Europoje pastebėtas laipsniškas prieigos atsigavimas.

Dabartinė situacija ir rekomendacijos

Praėjus kelioms valandoms, AWS nurodė, kad daugumoje savo paslaugų mato reikšmingų atsigavimo požymių , tačiau tam tikroms operacijoms US-EAST-1 regione taiko ribotus apribojimus. Bendrovė toliau stebi našumą ir įgyvendina pakeitimus, kad problema būtų visiškai išspręsta.

Jei vis dar kyla pavienių gedimų, patartina patikrinti oficialią AWS būseną ir, jei reikia, išvalyti DNS talpyklą arba iš naujo paleisti klientus ir paslaugas, kurios priklauso nuo galinių taškų sprendimo paveiktame regione. Kritiniuose diegimuose taip pat rekomenduojama patikrinti perjungimus , tinklo priklausomybes ir pakartotinio bandymo politiką, kad būtų sumažintas delsos ir trumpalaikių klaidų poveikis.

Epizode pabrėžiama, kiek debesų kompiuterijos infrastruktūra tapo struktūrine skaitmeninės ekonomikos dalimi: lokalizuotas gedimas pagrindiniame centre gali sukelti grandinines reakcijas pasauliniu mastu – nuo ​​transliacijų ir vaizdo žaidimų iki finansinių ir produktyvumo programų.


Pridėti kaip pageidaujamą šaltinį „Google“ sistemoje