Рубрика «надежность»

1 Проблема: ненадежная терминология по надежности

Привычные термины становятся все более запутанными. Если раннее (до 2003 года) система ГОСТ еще была фундаментальна и системно выстроена (причем это были не переводы западных стандартов), то потом система гос‑стандартизации стала резко деградировать.

При этом «Надежность в Технике» — направление, которому уже столетие: уже в 30-е в СССР выходили статьи типа Якуба Б. М. «Показатели и методы расчета надёжности в энергетическом хозяйстве» (журнал «Электричество», № 18, 1934 г.).

Читать полностью »

Работаю в компании «Сибинтек-Софт», занимаюсь поддержкой корпоративных информационных систем. Имею сертификат DevOps-инженера, в рамках задач отдела внедряю ИИ в рабочие процессы.

Как-то мой валидатор забраковал ответ, сославшись на статью, которой не существует.Читать полностью »

В продуктовой B2B‑компании, где я отвечал за надёжность, поставили амбициозную цель: сократить цикл разработки (dev cycle time) на 20%. Забегая вперёд, скажу: к концу года цель достигли. Но уже через несколько месяцев после старта я смотрел на график инцидентов и не верил своим глазам: рост в два раза год к году.

Эта статья — о том, почему так происходит почти всегда, когда компания оптимизирует одну метрику, как мы это починили и — главное — как продать решение руководству. Именно на продаже всё обычно и умирает.

Как цель съедает систему

Читать полностью »

Статья "LLM free" - все изображения и текст органического происхождения. :)

В январе выкладывал пост, в котором рассказывал о ходе эксперимента с 2 флешками - насколько долго они могут сохранить данные в обычных домашних условиях. На сегодня прошло уже 2 года с момента, когда флешки были заполнены данными и отложены в темное сухое место.

Этот эксперимент не претендует на какую-либо научность и практическую значимость. Всё делается просто ради прикола. Just for fun.

Читать полностью »

Суть проблемы

Кластер виртуализации содержит множество гипервизоров. На каждом гипервизоре разворачивается множество виртуальных машин. Каждая машина, как правило, отвечает за работу одного сервиса.

Если части одного сервиса развернуты на нескольких машинах (например, реплики или ноды), для краткости такой сервис будет называться распределенным. Каждый распределенный сервис может быть распределён неравномерно, что снижает его отказоустойчивость.

Далее под распределением сервисов предлагается понимать распределение виртуальных машин, на которых запущены части одного сервиса.

Читать полностью »

У вас есть Grafana. Она показывает графики с Prometheus. Prometheus скрейпит метрики с ваших сервисов. Если сервис упал — вы видите красный на дашборде. Если Prometheus упал — вы не видите ничего. Дашборд замирает на последних известных значениях. Если не знать, что Prometheus лежит, можно час смотреть на «зелёный» дашборд, который на самом деле показывает данные часовой давности.

Это не гипотетика. Я видел это дважды. Первый раз — Prometheus съел диск на мониторинг-сервере (да, Prometheus хранит данные на диске, и этот диск тоже может закончиться). Второй раз — kubelet убил pod с Prometheus из-за OOM, а Pod Disruption Budget не был настроен.

Читать полностью »

Эпические баги: как один Break положил телефонную сеть по всему США в 1990 г - 1

В подразделении, где я работаю, есть традиция - новичку при онбординге вручается ссылка на WikiЧитать полностью »

…Был обычный ноябрьский вечер, 2024 год шёл к своему завершению: на носу была «чёрная пятница». Я вернулся домой в Новосибирск из почти двухнедельной командировки, пробыв в пути 12 часов и поспав часа четыре. В 19:07 алерт сообщил мне о падении одного из контроллеров. В целом, проблема не критичная, так как сервисы зарезервированы. Но всё же одним глазом я заглянул в чат с разбором.

Читать полностью »

Битва кода с множеством проверок против чистого хрупкого кода

Битва кода с множеством проверок против чистого хрупкого кода

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js