Настройка и интерпретация S.M.A.R.T. мониторинга в TrueNAS: полное руководство | AdminWiki

Настройка и интерпретация S.M.A.R.T. мониторинга в TrueNAS: полное руководство

25 июля 2026 9 мин. чтения

Зачем нужен S.M.A.R.T. мониторинг в TrueNAS

S.M.A.R.T. (Self-Monitoring, Analysis and Reporting Technology) - встроенная система самодиагностики накопителей. Она фиксирует механические и электрические параметры диска задолго до его полного отказа. Игнорировать её показания - значит согласиться на внезапную потерю данных.

Статистика Backblaze за 2025 год показывает: около 30% дисков перед отказом подавали сигналы через S.M.A.R.T.-атрибуты. Оставшиеся 70% умирали без предупреждений. Но и эти 30% - сотни сохранённых массивов, вовремя выведенных из эксплуатации.

TrueNAS использует ZFS. Файловая система с контрольными суммами и самовосстановлением данных. Но ZFS не всесильна. Если пул собран без избыточности (stripe) или в массиве остался один рабочий диск - отказ накопителя уничтожит данные. S.M.A.R.T. даёт фору: от нескольких часов до нескольких недель на замену диска до того, как он перестанет отвечать на запросы контроллера.

Настроенный мониторинг S.M.A.R.T. решает три задачи:

  • Выявляет деградацию поверхности и механики до появления ошибок ввода-вывода на уровне ZFS.
  • Автоматически оповещает администратора через email при пересечении пороговых значений.
  • Снижает риск одновременного отказа нескольких дисков в пуле (коррелированные сбои часто связаны с игнорированием первых симптомов).

Если вы обслуживаете production-хранилище, настройка S.M.A.R.T. - не опция. Это обязательный элемент эксплуатации. Домашний NAS с семейным архивом требует того же подхода: восстановить 10 ТБ фотографий и документов с бэкапа дольше и дороже, чем заменить диск по предупреждению.

Типы S.M.A.R.T. тестов и их назначение

TrueNAS поддерживает запуск трёх типов тестов: короткого, длинного и conveyance. Каждый решает свою задачу и создаёт разную нагрузку на диск. Правильное расписание тестов - компромисс между глубиной диагностики и влиянием на производительность хранилища.

Короткий тест (Short)

Проверяет основные электрические цепи, механику позиционирования головок и читает небольшой сегмент поверхности. Занимает 2 минуты на HDD и до 1 минуты на SSD. Нагрузка на диск минимальна - тест можно запускать ежедневно в часы наименьшей активности.

Короткий тест выявляет грубые проблемы: отказ сервопривода, клин шпинделя, критический рост ошибок чтения на тестовом участке. Он не сканирует всю поверхность, поэтому битые сектора за пределами тестовой зоны останутся незамеченными.

Длинный тест (Long)

Посекторно читает всю поверхность накопителя. Для HDD объёмом 8-16 ТБ время выполнения - от 12 до 24 часов. SSD проходит тест быстрее: 4 ТБ NVMe-диск сканируется за 2-3 часа. Нагрузка на диск высокая: параллельная запись в пул во время теста снизит производительность хранилища.

Длинный тест находит скрытые дефекты: слабые сектора, которые пока читаются, но требуют повторных попыток, нестабильные головки, проблемы с микрокодом. Запуск раз в неделю или раз в месяц - стандартная практика. Для SSD частота длинных тестов ниже: ежемесячный прогон достаточен, излишнее чтение ускоряет износ NAND без диагностической пользы.

Conveyance-тест

Специализированный тест для выявления повреждений, полученных при транспортировке. Запускается однократно после установки нового диска. В регулярном расписании не используется.

Пошаговая настройка S.M.A.R.T. тестов в TrueNAS

Все операции выполняются через веб-интерфейс. Версия TrueNAS - CORE 13.x или SCALE 24.x - влияет только на расположение пунктов меню, логика идентична.

Создание задачи для короткого теста

Перейдите в Storage → Disks. Нажмите на строку диска, затем Edit. В открывшейся форме найдите секцию S.M.A.R.T. Tests и нажмите Add.

Заполните поля:

  • Type: Short
  • Schedule: cron-выражение. Для ежедневного запуска в 2:00 - 0 2 * * *

Расшифровка cron: минута (0), час (2), день месяца (*), месяц (*), день недели (*). Звёздочка означает «любое значение». Тест запустится каждую ночь в 2:00.

Повторите для каждого диска в пуле. Разнесите время запуска на 5-10 минут между дисками: 0 2 * * *, 5 2 * * *, 10 2 * * *. Это снизит пиковую нагрузку на контроллер и блок питания.

Создание задачи для длинного теста

В том же меню S.M.A.R.T. Tests нажмите Add ещё раз:

  • Type: Long
  • Schedule: 0 3 * * 0 - каждое воскресенье в 3:00.

Для месячного расписания используйте 0 3 1 * * - первого числа каждого месяца в 3:00.

Важно: не назначайте длинный тест на все диски одновременно. 8-дисковый массив HDD под полной нагрузкой длинного теста может просесть по производительности на 40-60%. Разносите тесты по дням недели: диск 1 - воскресенье, диск 2 - понедельник и так далее.

После добавления задач TrueNAS начнёт выполнять их по расписанию. Проверить статус последнего теста можно в Storage → Disks → строка диска: поле S.M.A.R.T. Status покажет PASSED или FAILED.

Настройка Email-уведомлений о событиях S.M.A.R.T.

Тесты без оповещений бесполезны. Вы не заходите в интерфейс TrueNAS каждый день. Настройка email-алертов гарантирует, что вы узнаете о проблеме в течение 30 минут после её обнаружения.

Конфигурация SMTP сервера

Перейдите в System → Email. Заполните:

  • From Email: адрес, с которого будут уходить письма. Совпадает с логином SMTP-сервера.
  • Outgoing Mail Server: SMTP-хост. Для Gmail - smtp.gmail.com.
  • Port: 587 (STARTTLS) или 465 (SSL).
  • Encryption: TLS или SSL в зависимости от порта.
  • Username/Password: учётные данные. Для Gmail требуется создать App Password в настройках аккаунта, обычный пароль не сработает при включённой двухфакторной аутентификации.

Нажмите Send Test Email. Если письмо не пришло - проверьте логи в /var/log/maillog через SSH. Типичные ошибки: блокировка провайдером порта 25, неверный пароль, отсутствие App Password.

Включение S.M.A.R.T. оповещений

Откройте Services → S.M.A.R.T. и установите:

  • Check Interval: 30 минут. Чаще нет смысла - атрибуты меняются медленно.
  • Power Mode: Never. Если выбрать Standby, TrueNAS не будет опрашивать спящие диски, и вы пропустите деградацию накопителя, который редко используется.

Уровень уведомлений настраивается в Alert Settings. Рекомендую включить Critical и Warning. Info-сообщения (например, «тест завершён успешно») забивают почту и снижают внимание к реальным инцидентам.

Пример письма при сбое:

Subject: TrueNAS Alert: S.M.A.R.T. error on /dev/ada2
Device: /dev/ada2, S.M.A.R.T. status: FAILED. One or more attributes are below threshold.

Детальнее настройка оповещений разобрана в статье по alerting-системе TrueNAS - там же описана интеграция с Telegram и webhook.

Интерпретация S.M.A.R.T. атрибутов: на что смотреть в первую очередь

Сырые данные S.M.A.R.T. - таблица из ID, названия атрибута, текущего значения (Value), худшего за историю (Worst), порога (Threshold) и сырого значения (Raw Value). Value и Worst нормализованы: 100 или 200 - отлично, снижение к Threshold - тревога. Raw Value - счётчик событий в единицах, специфичных для производителя.

TrueNAS показывает статус PASSED или FAILED на основе сравнения Value с Threshold. Но PASSED не означает «диск здоров». Атрибут может деградировать, оставаясь выше порога. Анализируйте Raw Value в динамике.

Критические атрибуты жестких дисков (HDD)

Пять атрибутов, требующих немедленной реакции при росте Raw Value:

  • ID 5 - Reallocated Sectors Count: количество секторов, переназначенных из резервной области. Ненулевое значение - на поверхности есть дефекты. Рост на десятки в неделю - диск под замену. Стабильное значение 5-10 на диске, проработавшем 3 года - вариант нормы.
  • ID 197 - Current Pending Sector Count: сектора, которые диск пытается прочитать, но не может. При следующей записи они либо восстановятся, либо перейдут в ID 5. Значение больше 0 - повод запустить длинный тест и подготовить замену.
  • ID 198 - Offline Uncorrectable Sector Count: сектора, которые не удалось прочитать при фоновом сканировании. Не восстанавливаются. Любое ненулевое значение - красный флаг.
  • ID 10 - Spin Retry Count: количество повторных попыток раскрутки шпинделя. Рост указывает на износ двигателя или проблемы с питанием. Даже единичные срабатывания - предвестник клина.
  • ID 1 - Raw Read Error Rate: частота ошибок чтения. Высокое Raw Value при низком Value - деградация головок или поверхности.

Ключевые атрибуты твердотельных накопителей (SSD)

SSD не имеют механики, их атрибуты отражают износ NAND и проблемы контроллера:

  • Media Wearout Indicator (ID разный у вендоров): нормализованный показатель износа. 100 - новый диск, 1 - ресурс исчерпан. Порог обычно 1-10. Снижение на 1-2 единицы в месяц - норма для активно пишущего сервера.
  • Total Bytes Written (TBW): объём записанных данных. Сравните с паспортным TBW производителя. Диск с 80% выработки ресурса - кандидат на плановую замену.
  • Unexpected Power Loss Count: счётчик нештатных отключений питания. Рост - проверьте UPS и блок питания сервера.
  • Wear Leveling Count: число циклов перезаписи самого изношенного блока. Косвенно подтверждает Media Wearout Indicator.

Для централизованного сбора этих метрик с десятков серверов используйте связку TrueNAS + Zabbix. Готовые шаблоны и настройка UserParameter описаны в руководстве по мониторингу S.M.A.R.T. в Zabbix.

Практические сценарии: что делать при обнаружении проблем

Получили алерт. Паника - плохой советчик. Действуйте по сценарию.

Оценка скорости деградации

Однократный рост Reallocated Sectors на 1-2 единицы - не повод для немедленной замены. Снимите показания, повторите через сутки. Если значение стабильно - диск под наблюдением. Если растёт экспоненциально (2 → 8 → 32 за три дня) - поверхность сыплется лавинообразно, диск под замену немедленно.

Current Pending Sector > 0 при стабильном ID 5 - запустите длинный тест. Он заставит диск перепроверить подозрительные сектора. После теста часть pending-секторов может исчезнуть (перечитались успешно), часть - перейти в Reallocated. Если после теста pending остались - диск не может прочитать эти сектора. Данные по этим адресам потеряны, ZFS восстановит их из избыточности при чтении.

Процедура замены диска в TrueNAS

Алгоритм безопасной замены:

  1. Убедитесь, что пул в состоянии ONLINE и имеет избыточность (mirror, RAID-Z1/Z2). Если пул - stripe, замена диска без потери данных невозможна.
  2. Выполните бэкап критичных данных. Не пренебрегайте этим шагом: во время resilver'а нагрузка на оставшиеся диски максимальна, возможен каскадный отказ.
  3. В Storage → Disks найдите сбойный диск, нажмите Offline. TrueNAS исключит его из пула.
  4. Физически замените диск. Серийный номер нового накопителя отобразится в интерфейсе.
  5. В Storage → Pools → Status нажмите Replace на старом диске и выберите новый. Начнётся resilver - процесс восстановления данных на новом диске.

Для минимизации времени деградации пула держите в сервере hot-spare диск. TrueNAS автоматически начнёт resilver на spare при отказе основного накопителя, без участия администратора.

Интеграция S.M.A.R.T. в общую систему мониторинга

Встроенные email-алерты TrueNAS решают задачу «сообщить о проблеме». Но они не показывают тренды. Рост Reallocated Sectors на 2 единицы в месяц выглядит безобидно, пока вы не увидите график за год.

TrueNAS предоставляет API для получения S.M.A.R.T.-данных. Запрос к /api/v2.0/smart возвращает JSON с полными атрибутами всех дисков. Скрипт на Python или Bash раз в час опрашивает API и отправляет метрики в Prometheus через pushgateway. В Grafana строится дашборд: графики Temperature, Reallocated Sectors, Pending Sectors по каждому диску.

Готовое решение - Netdata. Установка занимает 5 минут, дашборд по S.M.A.R.T. доступен из коробки. Для крупных инсталляций рекомендую связку TrueNAS + Zabbix: кастомные триггеры и LLD-обнаружение позволяют мониторить сотни дисков на десятках серверов с единой панели.

Встроенная Alert System TrueNAS (Alert Settings → Alert Rules) позволяет создать правило на любое условие: температура выше 45°C, SMART-статус FAILED, рост ошибок. Правила гибко настраиваются по severity и получателю. Это первый эшелон мониторинга, который должен быть включён всегда, независимо от внешних систем.

Если вы проектируете хранилище с нуля, статья сравнения NAS-решений 2026 года поможет выбрать платформу, где S.M.A.R.T.-мониторинг будет работать наиболее прозрачно.

Поделиться:
Сохранить гайд? В закладки браузера