Многие знакомы с известной схемой Брендана Грегга, где кли-утилиты сопоставлены с подсистемами. Эта схема действительно полезна, но при возникновении проблем многие бегут в интернет вместо того, чтобы искать нужные команды. В статье представлены инструменты из этой схемы и опенсорсные утилиты для мониторинга. Все утилиты сгруппированы по подсистемам, с краткими описаниями в конце каждого раздела.
На первом уровне, где часто возникают зависания, используются утилиты strace и ltrace для анализа системных вызовов. К ним добавлен journalctl для работы с логами. В случае глубокой диагностики полезны такие утилиты, как rr, bpftrace и sysdig.
Среди других полезных инструментов — perf для профилирования CPU, ftrace для трассировки событий и LTTng для подробного мониторинга. Утилиты BCC eBPF также позволяют быстро идентифицировать проблемы.
Когда количественные показатели хороши, стоит обратить внимание на аппаратные показатели, такие как temperatura и частоты, используя turbostat и rdmsr. Важно также следить за состоянием дисков и памяти, что можно делать при помощи smartctl и slabtop. В статье описаны ключевые утилиты, которые позволят системным администраторам эффективно анализировать систему и устранять возникающие проблемы.