Услуга · Системное администрирование

Администрирование серверов

Отказ сервера отличается от поломки компьютера масштабом: встаёт не один человек, а вся организация. Поэтому работа строится на предупреждении - наблюдение, календарь обновлений и регулярная проверка того, что архивы действительно разворачиваются.

Сигналы
дежурному, а не в ящик
Окна
обновления по календарю
Архивы
проверяем восстановлением
Опись
схема и учётные данные

Состав работ

Работаем и с Windows, и с Linux по одной схеме: приём по описи, наблюдение, письменный регламент.

Обсудить объём

Службы

Каталог пользователей, файловые ресурсы, печать, веб-серверы, серверы приложений.

Наблюдение

Загрузка, память, свободное место, состояние дисковых массивов, отклик служб.

Обновления

Ставим в оговорённые окна и всегда с заранее подготовленной возможностью вернуться назад.

Архивы

Настраиваем, следим за выполнением и периодически разворачиваем, а не сверяем галочку в задании.

Отказы

После каждого падения выясняем причину и делаем так, чтобы оно не повторилось.

Опись

Схема, назначение каждой машины, учётные данные в защищённом хранилище.

Порядок действий

Приём инфраструктуры занимает несколько дней, дальше всё идёт по установленному распорядку.

01

Опись

Какие машины, какие роли, состояние обновлений, дисков и архивов.

02

Разбор завалов

Первым делом закрываем срочное: заканчивающееся место, старые заплатки, отсутствующие копии.

03

Сигналы

Настраиваем оповещения так, чтобы они доходили до живого дежурного инженера.

04

Распорядок

Плановые работы, окна обновлений, ежемесячная сводка по состоянию.

Оповещения, уходящие на общий почтовый ящик, не читает никто. Формально наблюдение настроено, письма приходят, а на деле сервер встал ещё ночью и об этом узнали от бухгалтера утром. Сигнал должен приходить конкретному человеку, у которого есть и время, и полномочия отреагировать.

Вопросы и ответы

Заплатки, закрывающие уязвимости, - в течение недели после выхода. Остальное - ежемесячно в согласованное окно. Машины, которые не трогали годами, поднимаем ступенями и обязательно со снятым слепком состояния.

Нужно, и стоит оно практически ничего: контроль свободного места, доступности и состояния дисков включается штатными средствами. Разница между «система предупредила заранее» и «пришли и не работает» измеряется часами простоя.

Отделять сетью и планировать замену. Отсутствие заплаток означает, что риск растёт каждый месяц. Пока замена невозможна, ограничиваем к ней доступ и усиливаем наблюдение.

Возьмём серверы под присмотр

Напишите, сколько серверов и какие задачи на них работают. Сделаем опись и покажем, с чего начинать.