Observability & DevOps Tools Engineering Manager
Observability & DevOps Tools Engineering Manager📍 Location: Raleigh, North Carolina, United States🏢 Industry: IT Services and IT Consulting💼 Work Setting: HybridAre you passionate about building high-performing teams, enhancing system visibility, and driving operational excellence? This role offers the opportunity to lead critical platform initiatives that directly impact engineering efficiency and reliability.An Engineering Manager to lead enterprise observability platforms and developer tooling, driving system reliability and developer productivity at scale.Key ResponsibilitiesLeadership & Team DevelopmentLead, mentor, and grow a high-performing engineering teamFoster a culture of ownership, reliability, and continuous improvementSet priorities and align team efforts with strategic objectivesObservability Strategy & ExecutionDefine and implement observability standards across metrics, logs, traces, and alertingEstablish best practices for monitoring, dashboards, and service health trackingPromote SLI/SLO-based approaches and proactive instrumentationDevOps & Platform GovernanceOversee CI/CD and developer platforms, including tools such as GitHub, Azure DevOps, and JenkinsEstablish governance frameworks for repositories, pipelines, and integrationsEnsure platforms are scalable, reliable, and aligned with enterprise standardsReliability & Incident ManagementPartner with cross-functional teams to improve incident response, root cause analysis, and post-incident reviewsEnhance detection, recovery, and on-call readiness processesDrive continuous improvement in system reliability and availabilityPlatform Engineering & AutomationImplement and manage infrastructure using Infrastructure-as-Code (IaC)Standardize operational practices and optimize platform performanceEvaluate and adopt new tools based on capability, cost, and scalabilitySecurity, Compliance & Cost OptimizationEnsure strong security controls, auditability, and compliance across platformsManage access governance and logging practicesOptimize platform costs while maintaining performance and usabilityCross-Functional CollaborationWork closely with engineering, SRE, security, and infrastructure teamsTranslate technical initiatives into measurable business valueAlign stakeholders across application and platform teamsQualifications & ExperienceProven experience leading engineering teams in observability, SRE, DevOps, or platform engineeringHands-on experience with observability tools such as Datadog, Splunk, Grafana, or OpenTelemetryExperience managing CI/CD platforms (e.g., GitHub, Jenkins, Azure DevOps)Strong understanding of cloud-native architectures (AWS and/or Azure)Experience with Infrastructure-as-Code tools such as Terraform or CloudFormationStrong leadership, communication, and organizational skillsKey SkillsPlatform engineering and automation expertiseObservability and monitoring strategyIncident management and reliability engineeringDevOps and CI/CD governanceStakeholder communication and collaborationCost optimization and compliance awareness