Observability: Metrics Logs Traces
What are the key trade-offs of Observability: Metrics Logs Traces? When would you choose it vs alternatives?
Answers use simple, clear English.
Quick interview answer
Pros: Faster incident diagnosis. Cons: Cost/cardinality explosions.
Detailed answer
Pros: Faster incident diagnosis. Cons: Cost/cardinality explosions. Decision: pick when benefits outweigh operational cost. Core: Metrics for SLIs/SLOs, structured logs, distributed traces. Correlate with TraceId. Alert on symptoms (latency/errors) not only CPU. Real-time example: p99 latency burn alert → trace shows slow DB span → log shows lock wait. Pros: Faster incident diagnosis. Cons: Cost/cardinality explosions. Common mistakes: Paging on raw CPU; no runbooks. Best practices: SLO-based alerts; sampling; exemplars linking metrics→traces. Audience level: Engineering Manager.
Full explanation
Metrics for SLIs/SLOs, structured logs, distributed traces. Correlate with TraceId. Alert on symptoms (latency/errors) not only CPU.
Real example & use case
p99 latency burn alert → trace shows slow DB span → log shows lock wait.
Pros & cons
Pros: Faster incident diagnosis. Cons: Cost/cardinality explosions.
Common mistakes
Paging on raw CPU; no runbooks.
Best practices
SLO-based alerts; sampling; exemplars linking metrics→traces.
Follow-up questions
- How would you test Observability: Metrics Logs Traces?
- What metrics prove Observability: Metrics Logs Traces is healthy in prod?
- How does Observability: Metrics Logs Traces change at 10× traffic?