Login Sign Up
Advert
Your ad spot
Reserve this exclusive slot for the selected period.
Buy advertising →
Telegram community logo - Mockingbird Shares
Added 01 Jan 2022

Mockingbird Shares

@mockingbird_shares
Number of subscribers: 125
Photos: 1,250
Videos: 71
Links: 1,040
Description:
Ділюся посиланнями. Контент не генерую. Тематика: ML/AI/LLM, висєри на мера Києва, петиції, навколо наукова/освітня сфера Зв'язок: пишіть в коменти Шітпост: @mockingbird_shitposts Твітор (вмер): @007morf Тепер вже офіційні коменти: @mockingbird_chat
Source

Mockingbird Shares | Disaster recovery це просто, особливо для тих, хто його ніколи не роби...

Telegram community logo - Mockingbird Shares Mockingbird Shares @mockingbird_shares
35 Views/Reach 2026-07-10 17:06 Message №2776
Disaster recovery це просто, особливо для тих, хто його ніколи не робив.Впав сервак, в тебе є другий. Впав дата-центр або availability zone, ти запускаєш резервний. Впав регіон, що буває дуже рідко, але provider має декілька регіонів, тому ми робимо мульти регіон. Ну а якщо впав вже провайдер, що майже ніколи не стається, тоді додаємо іншого провайдера.І такий сетап здається абсолютно bulletproof. Різні варіанти, ready standby, multi master і багато інших цікавих термінів з курсів про системний дизайн. Зробили і сидимо, скролимо твітер, та нічого не боїмось.От і Datadog так думали, пʼять регіонів по AWS, Azure і GCP. Аж поки ще у 2023-му вся ця краса не згасла одночасно. Не землетрус і не пожежа, а рутинний апдейт. Патч для systemd (програма, що керує сервісами на лінукс-серверах) рестартнув мережевий сервіс, а той має звичку викидати всі маршрути, які створив не він. Cilium (те, що будує мережу між контейнерами в кубернетесі) тримав свої правила маршрутизації подів просто в ядрі, systemd не впізнав їх як свої і повидаляв. Чому він це зробив? Тому що може, в лінуксі правила міняти дозволено будь-якому процесу.Звʼязок між нодами обірвався, і не в одному регіоні, а скрізь, бо апдейт викотився на всю гопотеку (40К серваків) в один і той самий момент.Про те, що прод лежить ти зазвичай дізнаєшся від Datadog, до того, як прибіжать юзери. А от коли падає сам Datadog, шо робити? Інженери діагностували і фіксили аварію як діди колись, через ручні SSH-сесії й консолі провайдерів. Розважались майже добу, поки воно не піднялось.І часом дуже добре, шо ти не Датадог.(деталі історії можна подивитись у цьому відео)