Microsoft wijt grote storing in Microsoft 365 aan onderhoudsprobleem

Uitgebreide Microsoft-storing door bug tijdens netwerkonderhoud

Microsoft heeft laten weten dat een bug in hun geautomatiseerde systeem voor netwerkonderhoud een grote storing heeft veroorzaakt. Dit systeem verwijderde per ongeluk IP-routes van meer apparaten dan de bedoeling was, waardoor Azure en Microsoft 365-diensten werden verstoord.

De storing begon op donderdag 23 juli om 16:44 uur Nederlandse tijd en trof voornamelijk klanten die Microsoft 365-diensten gebruikten via netwerkstructuren verbonden met de Westelijke VS Azure-regio.

Rond 17:11 uur had Downdetector 2.403 storingsmeldingen geregistreerd, een enorme stijging ten opzichte van het normale aantal van 29. SharePoint had met 78% de meeste klachten, gevolgd door Excel met 11% en het Microsoft 365 Admin Center met 6%.

Beïnvloede diensten waren onder meer:

  • Microsoft OneDrive: Toegang was wisselvallig.
  • SharePoint Online: Gebruikers kregen foutmeldingen.
  • Microsoft Teams: Problemen met chatfuncties, zoals afbeeldingen die niet laadden.
  • Microsoft 365 Admin Center: Laden ging traag of lukte niet.
  • Power Automate: Workflows laadden niet.
  • Copilot Chat: Vertraagde reacties bij taken en zoekopdrachten.
  • Microsoft Loop: Pagina’s konden niet worden geopend.

Andere getroffen diensten waren onder andere Fabric, Power BI, Power Apps, Copilot Studio, Windows 365 en Microsoft Defender. Enkele Defender-klanten merkten ook vertragingen op bij responstijden.

Microsoft probeerde aanvankelijk de storing te verhelpen door het verkeer om te leiden via alternatieve netwerkpaden. Hoewel dit enigszins hielp, bleven veel diensten problemen ondervinden. De oorzaak bleek een recente netwerkverandering te zijn, die vervolgens werd teruggedraaid. Om 20:26 uur was de terugdraaiing voltooid en is de storing opgelost.

Bug tijdens onderhoud veroorzaakte de storing

In een eerste evaluatie van het incident deelde Microsoft mee dat de storing ontstond tijdens routineonderhoud in de Westelijke VS Azure-regio. Hierbij werden specifieke netwerkpaden geïsoleerd.

Het onderhoudsproces zet verzoeken om in instructies die het systeem kan lezen. Het systeem controleert of er ten minste één van de twee redundante paden gezond blijft voordat het werk begint. Echter, door een bug werden meer netwerkapparaten onterecht als onderdeel van het onderhoud aangemerkt.

Hierdoor werden IP-routes verwijderd van meer apparaten dan gepland, wat het netwerkverkeer tussen het datacenter van Microsoft in de Westelijke VS en hun omvangrijke netwerk verstoorde. Verkeer binnen de regio verliep wel normaal.

Deze storing veroorzaakte verbindingsproblemen en vertragingen bij toegang tot vele clouddiensten zoals Azure App Service, Azure AD B2C, Azure Cosmos DB, en nog veel meer.

Ingenieurs bij Microsoft gingen direct aan de slag met het onderzoeken van het probleem toen de storing begon. De initiële aanwijzingen wezen op grootschalige routeveranderingen in hun netwerk. Dit werd uiteindelijk herleid tot een datacenter in de Westelijke VS, gekoppeld aan recente onderhoudsactiviteiten.

Microsoft heeft een compleet intern onderzoek gestart om veilige controles en geautomatiseerde processen voor onderhoudsverzoeken te verbeteren. Er is een uitgebreid incidentrapport beloofd, dat naar verwachting binnen 14 dagen zal worden gepubliceerd.

---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ---- ----
Opzoek naar de laatste updates uit onze securitylog?
Inhoud mede mogelijk gemaakt door OpenAI.