Talent.com
NTT
Pessoa Engenheira SRE — Observabilidade e MonitoramentoNTT • São Paulo, State of São Paulo, Brazil
Pessoa Engenheira SRE — Observabilidade e Monitoramento

Pessoa Engenheira SRE — Observabilidade e Monitoramento

NTT • São Paulo, State of São Paulo, Brazil
Há +30 dias
Descrição da vaga

JOB DESCRIPTION Job Requirements

Pessoa Engenheira SRE — Observabilidade e Monitoramento

Nível: Pleno avançado/Sênior

Modelo de trabalho: Remoto

Sobre a Oportunidade

Buscamos uma pessoa Engenheira SRE para atuar em um projeto com foco em confiabilidade, observabilidade, monitoramento e melhoria contínua de ambientes produtivos.

A pessoa será responsável por apoiar a evolução da estratégia de observabilidade, garantindo que aplicações e serviços estejam bem monitorados, diagnosticáveis e preparados para operação em escala.

Responsabilidades

  • Implementar, evoluir e manter práticas de observabilidade utilizando Datadog.
  • Criar e manter dashboards, monitores, alertas, métricas, logs e traces.
  • Apoiar times de desenvolvimento e operação na instrumentação de aplicações e serviços.
  • Atuar em análise de incidentes, troubleshooting, triagem, causa raiz e planos de melhoria.
  • Definir e acompanhar indicadores de confiabilidade, como SLIs, SLOs e disponibilidade dos serviços.
  • Automatizar rotinas operacionais e reduzir esforço manual por meio de scripts, integrações e ferramentas.
  • Desenvolver automações ou soluções de apoio utilizando Python ou Java.
  • Contribuir com runbooks, documentação técnica e padronização de processos operacionais.
  • Trabalhar em conjunto com times de desenvolvimento, DevOps, infraestrutura e arquitetura.
  • Apoiar melhorias de performance, escalabilidade, resiliência e estabilidade dos ambientes.



Work Experience

Requisitos

  • Experiência em SRE, observabilidade, monitoramento, DevOps ou sustentação de ambientes críticos.
  • Conhecimento sólido em Datadog, especialmente APM, logs, métricas, traces, dashboards e alertas.
  • Experiência com análise de incidentes, troubleshooting e investigação de causa raiz.
  • Conhecimento em desenvolvimento ou automação com Python ou Java.
  • Familiaridade com aplicações distribuídas, APIs, serviços web e ambientes cloud.
  • Conhecimento em Git, CI/CD e boas práticas de automação.
  • Noções de infraestrutura, redes, Linux e containers.
  • Capacidade de comunicação com times técnicos e não técnicos.
  • Perfil colaborativo, analítico e orientado à melhoria contínua.

Diferenciais

  • Experiência com AWS, especialmente CloudWatch, EC2, ECS/EKS, Lambda, RDS, IAM ou serviços correlatos.
  • Conhecimento em OpenTelemetry.
  • Experiência com Kubernetes e Docker.
  • Vivência com Terraform ou outras ferramentas de Infrastructure as Code.
  • Conhecimento em Prometheus, Grafana, Splunk, AppDynamics ou ferramentas similares.
  • Experiência com ServiceNow ou ferramentas de ITSM.
  • Atuação em ambientes de alta disponibilidade, missão crítica ou grande volume transacional.
  • Experiência com práticas de post-mortem, error budget e engenharia de confiabilidade.


Criar um alerta de emprego para esta pesquisa

Pessoa Engenheira SRE — Observabilidade e Monitoramento • São Paulo, State of São Paulo, Brazil