Публикуем всё, что заметили проверки, включая короткие деградации и плановые работы. Время московское. Разбор пишем для инцидентов дольше получаса и для всего, что задело данные.
Повышенная задержка API
11:18-12:00. Медиана ответа на /v1/products выросла до 2,1 с, часть клиентов завершала запросы по своему таймауту. Причина - план запроса, который после ночного роста таблицы остатков перестал попадать в индекс. Добавили индекс по паре контур-обновление, план вернулся, задержка упала до обычной за три минуты.
Разбор инцидента →Задержка доставки вебхуков
14:40-16:50. Очередь доставки росла: приёмник одного из контуров отвечал по 30 секунд, и его повторы занимали общие потоки. Медленные подписки вынесли в отдельный пул, очередь разобралась за 20 минут. Ни одно событие не потеряно, все доставлены с задержкой.
Недоступна загрузка файлов
09:12-09:30. Приём прайсов и изображений отвечал 503: на узле приёма кончилось место, потому что после смены пути временных файлов чистка убирала не тот каталог. Освободили место, поправили путь, добавили проверку свободного места в дежурные оповещения.
Письма уходили с задержкой до часа
10:05-11:16. Внешний отправитель ограничил нам скорость после всплеска рассылки, и событийные письма встали в общую очередь. Развели событийные письма с массовыми по разным отправителям, очередь разошлась без потерь.
Плановые работы: обновление панели
03:10-03:50. Выкатывали версию панели с миграцией настроек уведомлений. Панель была недоступна, API и вебхуки работали штатно. Объявляли за неделю.
Инциденты старше 12 месяцев из ленты убираются. Нужен разбор по конкретной дате - запросите его из кабинета, мы храним журналы 13 месяцев.