当 AI 走进运维:这半年的观察与思考
当 AI 走进运维:这半年的观察与思考
写这篇随笔时,正值 2025 年 8 月底。回看这一年多,AI 对运维工作的渗透比我想象中快,但方式又和很多人最初预测的不一样。趁着周末,把这段时间的观察整理成文字——不谈宏大叙事,只说我自己和身边真实发生的变化。
一、它真实地改变了我的日常
排障:从”搜答案”到”问模型”
现在拿到一个报错,我的第一反应已经不是复制去搜索引擎,而是把上下文完整地丢给大模型:
1 | # 我现在喂给 AI 的"排障提问模板"(比直接贴一行报错有用得多) |
把环境、现象、已做过的排查都交代清楚后,模型给的”嫌疑列表”质量明显高出一截——它经常能补上我没想到的方向,比如”检查 keepalive 超时与后端半连接数”这类容易被忽略的点。它不一定直接给答案,但确实帮我缩短了定位时间,尤其是那些”我怀疑是 A,其实是 B”的场景。
脚本与文档:初稿它写,质量关我把
写脚本的效率提升是最直观的。以前写一个日志统计脚本,从回忆语法到调试干净要小半天;现在把需求描述清楚,模型给的初稿基本能用,我再按生产标准改:补参数校验、加失败处理、写清日志输出。
1 | # 典型协作流程(我在终端里的真实工作方式) |
文档也受益——接口变更说明、故障复盘的结构化模板,让 AI 生成初稿再人工校对,省下的时间都花在了把话说准确上。
知识库:把团队的经验”喂”给 AI
企业内部最大的变化,是知识库问答助手的落地。我们把历年的故障记录、变更文档、环境清单整理成语料,做检索增强问答,值班同学遇到问题先问它:
| 语料类型 | 具体内容 | 价值 |
|---|---|---|
| 故障复盘 | 根因、处理链路、止血动作 | 新人不用”重新踩一遍坑” |
| 变更记录 | 什么时间改了什么、影响面 | 快速定位”是不是变更引起的” |
| 环境清单 | 机器清单、拓扑、账号归属 | 少问”这台是干嘛的” |
| 常见问题 | 运维知识库 FAQ | 值班第一道过滤 |
以前”老员工离职知识就断了”的问题,第一次有了系统性的解法。今年年初 DeepSeek-R1 开源之后,这类私有化部署的成本变得可接受,身边不少团队都在做类似的事。
二、我实际用 AI 做什么:一张分布表
| 场景 | 频率 | AI 的角色 | 我的把关点 |
|---|---|---|---|
| 报错分析 / 排障方向 | 每天多次 | 给嫌疑列表 | 环境上下文是否交代清楚 |
| 脚本 / 配置初稿 | 每天 | 写初稿 | 生产标准改造 + 验证 |
| 文档 / 复盘结构 | 每周 | 搭框架 | 事实准确性 |
| 告警 / 日志模式分析 | 每周 | 找规律 | 数据口径是否正确 |
| 知识库检索问答 | 每天 | 定位沉淀文档 | 答案要回到原文核对 |
一个值得记住的观察:AI 用得越多,越发现”把问题描述清楚”本身是稀缺能力——环境、现象、已排查项、期望输出,这些信息组织得好,AI 和同事都能更快帮你。
三、它没有改变的东西
线上出了问题,模型可以告诉我”可能的原因”,但它不会替我被扣绩效,也不会替我跟业务方解释为什么影响了半小时。故障处理里最重的部分从来不是”知道答案”,而是在信息不完整、时间紧迫、多方压力下做决策——这部分需要的不是知识,是判断和担当。
还有一个更微妙的点:模型的建议在”标准环境”里很准,在生产环境里经常差一口气。我们的环境有太多历史包袱——遗留脚本、没文档的配置、说不清来由的依赖——这些”非标准”的东西模型看不到,只有人对这套系统的理解是完整的。所以 AI 给我的建议,我默认只信一半,另一半要靠对业务和环境的理解去校准。
关于”判断力”这件事,我在之前的文章里也聊过:排障的本质不是背命令,而是沿着正确的链路缩小范围——《进程与性能排查实战》、《日志排查体系》 里写的就是这套思路,AI 帮我把”缩小范围”这步做得更快,但”判断哪个方向值得查”仍然是人。
随着 AI 生成代码的能力变强,代码以外的质量责任反而更重了:变更的影响范围、回滚方案、监控覆盖——这些”上线前的最后一道关”,从来都是人在把。
四、行业里几个真实的时间点
这几个是我确切经历过的节点,写在这里提醒自己别被一时喧嚣带偏:
- 2016 年:Gartner 提出 AIOps 概念,”智能运维”的口号喊了很多年;
- 2021 年:GitHub Copilot 发布,代码辅助工具进入大众视野;
- 2023 年:GPT-4、Claude 3 相继到来,大模型开始真正”能用”;
- 2024-12:DeepSeek-V3 发布,开源模型性能第一次追上闭源第一梯队;
- 2025-01:DeepSeek-R1 开源推理模型引爆讨论,也把”私有化部署大模型”的成本打了下来;
- 2025 上半年:身边越来越多团队做出内部 AI 助手,AIOps 的落地场景回归理性——告警降噪、日志异常检测、根因分析辅助这三件事,做得比”端到端自动运维”实在得多。
写到这里特别提醒自己:AI 的发展太快,任何”预测”过三个月就会失真。这篇随笔只记录 2025 年 8 月这个时点真实发生的事,不做预言。下个季度回来看,大概率又不一样了。
五、我给自己定的三条原则
- 把它当放大器,不当拐杖:AI 帮我做得更快的事,我要清楚每一步在干什么——它错了我也要能看出来;
- 围绕”判断力”积累:命令和语法可以被生成,但对系统边界的理解、对风险的嗅觉、对业务的认知,只会越来越值钱;
- 文档和知识库变成硬资产:以前写文档是交接用,现在它们还是 AI 助手的”饲料”——写清楚、结构化,AI 才能帮上忙。
结语
2025 年的这个夏天,AI 对运维来说既不是革命也不是泡沫。它更像一个”能力很强的实习生”:上手快、知识面广,但需要有人定方向、把关、兜底。而我想要的定位,就是那个把关和兜底的人——顺便把实习生用得越来越好。


