服务器不会说话,它出问题之前往往没有任何征兆。等你发现网站打不开、用户投诉涌入的时候,可能CPU已经飙满几个小时了。一套配置合理的监控告警系统,就是运维人员的眼睛和耳朵。这篇文章完整讲一遍云服务器监控告警的搭建流程,从Agent部署到阈值策略设置,照着做就能落地。

为什么要部署云监控Agent
云平台自带的平台级监控只能采集到宿主机层面的基础数据,比如网络流入流出、弹性公网IP的带宽使用情况。但服务器内部的CPU负载分布、内存占用细节、磁盘IO压力、进程运行状态这些信息,必须依靠安装在操作系统内部的Agent才能采集到。
不装Agent的监控是有盲区的。举个例子,一台4核8G的服务器,从平台监控看带宽很平稳,但实际上某个Java进程内存泄漏已经吃掉了90%的内存,随时可能触发OOM被系统杀掉。装了Agent之后,内存使用率这个指标会实时上报,配合告警规则就能在事故发生前收到通知。
目前主流云厂商的云监控产品基本都是免费的,Agent占用资源也极少,一般内存占用在几十MB以内,CPU几乎可以忽略不计。没有理由不装。
云监控Agent部署步骤
以阿里云为例,新购的ECS实例默认已经预装了云监控插件(Agent),可以直接在云监控控制台的主机监控列表里看到。如果显示未安装,或者你用的是较早创建的实例,需要手动安装。Linux系统下执行一条安装命令即可,安装脚本通常放在 /usr/local/cloudmonitor 目录下,安装完成后可以用命令检查进程是否正常运行。
腾讯云的对应组件叫云监控Barad Agent,华为云叫Telescope,部署逻辑都类似:优先用云平台提供的自动化脚本安装,脚本会自动识别系统发行版、配置软件源、注册系统服务并启动。安装完成后建议重启一次服务器,确认Agent服务设置了开机自启。
Windows服务器的安装方式略有不同,一般是下载exe或msi安装包,双击安装后以系统服务的形式常驻运行。无论哪种系统,装完之后都要回到控制台刷新主机列表,确认状态显示为在线,并且各项监控图表开始有数据产生。如果长时间无数据,常见原因是安全组拦截了Agent上报端口,或者服务器本地防火墙限制,排查时优先检查出站规则。
核心监控指标与阈值参考
Agent部署完成后,控制台会展示大量监控图表,但真正需要配置告警的是几个核心指标。下面这份参考表基于多数线上业务的通用场景,可以根据自己业务的实际情况微调。
| 监控指标 | 建议告警阈值 | 持续时间 | 说明 |
|---|---|---|---|
| CPU使用率 | 大于80% | 连续5分钟 | 避免瞬时高峰误报 |
| 内存使用率 | 大于85% | 连续5分钟 | 结合交换分区使用情况判断 |
| 磁盘使用率 | 大于85% | 持续10分钟 | 建议再设95%的严重级别 |
| 磁盘IO利用率 | 大于90% | 连续5分钟 | 数据库服务器重点关注 |
| 公网带宽使用率 | 大于90% | 连续3分钟 | 带宽打满会直接导致服务不可用 |
| 系统负载 | 大于CPU核数 | 持续5分钟 | load高于核数说明出现排队 |
持续时间的设置很关键。CPU偶尔冲到90%持续十几秒是正常现象,比如定时任务在跑日志压缩。如果阈值触发条件设成一次采样就告警,一天能收到几十条无效通知,很快你就会麻木,然后忽略真正的严重告警。经验做法是所有指标都设置至少3到5分钟的持续时间。
告警策略与通知渠道配置
阈值定了,接下来是配置告警规则和通知方式。进入云监控控制台的告警规则页面,选择目标实例,勾选需要监控的指标,填入阈值和持续时间,然后选择联系人组。建议按业务分组来建联系人和联系人组,比如把Web服务器组的告警发给应用运维组,把数据库组的告警发给DBA,避免所有人接收所有告警。
通知渠道方面,邮件和短信是基础配置,但现在更推荐配合钉钉机器人或企业微信机器人使用。钉钉机器人只需要在群里创建一个自定义机器人,拿到Webhook地址,填进云监控的回调配置里,告警消息就会实时推送到群里,群成员都能看到,响应速度比短信快,也方便团队讨论。
告警级别建议至少分两级。一般告警走群消息提醒,严重告警比如磁盘超过95%、服务器失联、主进程挂掉这类,要叠加电话通知,确保半夜出事也能有人被叫醒处理。
几个实用的高级技巧
第一,给每台服务器配置主机存活监控。前面所有指标的前提是Agent还在工作,如果服务器本身宕机或者Agent失联,其他告警全都失效。所以要单独配置一条Agent失联或心跳超时告警,级别设为最高。
第二,磁盘告警分级阶梯化。同一个磁盘使用率指标配两条规则:85%触发提醒,93%触发警告,这样你能清楚知道空间消耗的速度。如果业务日志增长很快,还可以再加一条进程级别的监控,比如Nginx、MySQL的进程存活探测。
第三,定期复盘告警记录。每个月把告警历史拉出来看一遍,如果某个规则一个月触发了五十次但每次都不需要处理,说明阈值设置不合理,要么调阈值,要么调整持续时间。告警系统的质量不在于配了多少条规则,而在于每一条告警发出来时你都愿意去看一眼。
按照这套流程配下来,一台服务器从Agent安装到完整告警生效大概只需要半小时。多台服务器可以用云平台的批量安装功能或者ansible批量下发脚本,把重复劳动省下来。监控告警是运维工作的地基,越早配好越省心。
云服务器监控告警云监控Agent部署阈值告警策略修改时间:2026-09-07 02:26:30