可观测性 (Observability) 与混乱守恒定律
是什么 / 为什么重要
研55-Datadog 的核心概念。先厘清与「监控」的区别:
- 监控 (Monitoring):回答你事先想得到的问题(CPU 过高、内存爆了就报警)。前提是故障有限且可预测。
- 可观测性 (Observability):回答你事前根本想不到的问题(「为什么只有安卓、在台北、下午 3-4 点、购物车≥5 件的人结帳会变慢?」)。面对「未知的未知(unknown unknowns)」。
三种核心数据:指标(Metrics)=生命徵象、日志(Logs)=病历(量最大最花钱)、追踪(Traces)=全身断层扫描。真正的护城河是把三者串起来(异常→定位那笔请求→那行代码),几秒走完。
AI 为什么让可观测性从「有很好」变「非有不可」
混乱守恒定律(杰文斯悖论 的维运版):系统复杂度不会凭空消失,AI 让「写程式」变简单,省下的复杂度全搬到「系统维运」端。四个技术本质:
- AI 输出无法重现(非决定性)→ 必须全程录影 → 日志需求暴增。
- 一句指令背后几百次调用(Agent 自我拆解/修正)→ 需要分散式追踪画地图。
- 全新监控维度:Token 消耗、GPU 利用率、模型幻觉、Prompt Injection——每个都是市场净增加。
- 把人拿掉需要更多眼睛:自驾车比人开车装更多传感器;AI 出错以毫秒×整个系统规模扩散。
结论:AI 是可观测性的顺风,不是逆风。
为什么 AI 抄不走(护城河四层)
即使 AI 完美复制 Datadog 代码也无法取代:
- 极端规模的工程复杂度(每秒百万级指标写入的分散式系统调优)
- 一千个整合套件的维护地狱
- 抄得到代码,抄不到数据——跨万家公司十余年的故障数据=网络效应
- AI 监控 AI 会在同一处一起瞎掉——观察者必须独立于被观察者(看门人不能住屋里)。最强印证:OpenAI 有能力自建,却在 DASH 2026 公开表示把 Datadog 当「唯一可信真实信源」。
关键玩家
- DDOG(云原生+全平台整合,市占最快)
- 寡头:Dynatrace(传统大企业)、Grafana/Elastic(开源)、Splunk(被 Cisco 收购,偏资安)、New Relic(老牌 APM)