结论:三大支柱是 Metrics(指标)、Logs(日志)、Traces(链路追踪):指标回答「系统是否健康、趋势如何」,日志回答「具体发生了什么」,追踪回答「一次请求在分布式系统中经过了哪里、慢在哪一环」。
展开:Metrics 是低开销的数值时序(Prometheus 体系),适合做告警和仪表盘,回答聚合层面问题,但基数(cardinality)爆炸是常见事故,高基标签(如 userId)禁止进指标。Logs 是离散事件记录,信息量最大但成本高,云原生下 stdout 输出 + Fluent Bit 采集 + Loki/ES 存储是标准姿势,结构化日志(JSON)比正则解析友好得多。Traces 通过 TraceID/SpanID 串联跨服务调用链(OpenTelemetry 已成事实标准),定位分布式系统的慢调用与错误传播路径。三者要关联才有威力:日志里带 TraceID 可跳到链路,指标 exemplar 可从异常点钻取到具体 trace,这是现代观测平台(Grafana 全家桶)的标配交互。认知升级:三支柱是数据采集视角而非可观测性本身,可观测性的目标是从系统外部输出推断内部状态,回答「未知的未知」问题。易错点:把监控等同于可观测性——监控是预设问题的告警,可观测性支撑开放式排障。