Overview: We are looking for a Monitoring / Observability Engineer to design, implement, and maintain monitoring and alerting solutions for complex, distributed application environments. You will work closely with development, infrastructure, and operations teams to ensure our systems are observable, reliable, and quickly diagnosable when issues occur.
Tasks
Responsibilities:
- Design, implement, and maintain monitoring and alerting solutions for complex distributed systems.
- Develop and maintain Grafana dashboards and Prometheus-based monitoring.
- Define meaningful metrics, alerts, thresholds, and monitoring strategies.
- Monitor Java-based backend applications, APIs, microservices, and supporting infrastructure.
- Analyze monitoring data to identify performance issues, system failures, and potential incidents.
- Support troubleshooting and root-cause analysis using metrics, logs, and other observability data.
- Continuously improve monitoring coverage, alert quality, and system visibility.
- Collaborate with developers, DevOps, infrastructure, and operations teams to improve system reliability.
- Contribute to the standardization and automation of monitoring and alerting processes.
Requirements
Qualifications:
- Strong hands-on experience with Grafana and Prometheus.
- Proven experience implementing and maintaining monitoring and alerting solutions.
- Experience monitoring Java-based backend applications.
- Experience working with complex distributed systems, microservices, or similar environments.
- Good understanding of application performance, system metrics, and troubleshooting.
- Experience with Linux-based environments.
- Familiarity with cloud, containers, Kubernetes, or other DevOps technologies is a strong advantage.
- Ability to analyze technical issues and work effectively with development and infrastructure teams.
- Good communication skills and a structured, problem-solving approach.
- Fluent in English and German, both written and spoken.