Marco Cristofolini

Principal / Staff
Site Reliability
Engineer

SREPlatform EngineeringCloud Engineering

Há mais de 13 anos, construo confiabilidade em escala — de plataformas cloud-native à liderança técnica — sem abrir mão da execução hands-on.

01 13+ anos

em infraestrutura, SRE e plataformas

02 800+ serviços

organizados em catálogo Backstage

03 Centenas de squads

impactadas por iniciativas globais de plataforma

01 Sobre

Confiabilidade não é uma camada.
É uma decisão de engenharia.

Conecto estratégia, arquitetura e operação para que sistemas e equipes evoluam com segurança.

Sou Principal Site Reliability Engineer e Platform Engineer. Minha trajetória começou em infraestrutura Linux e ambientes 24x7, avançou por automação e cloud e chegou à construção de plataformas internas usadas por centenas de squads.

Atuo na interseção entre confiabilidade, experiência de desenvolvimento e objetivos de negócio. Estruturo SLOs, observabilidade, resposta a incidentes, automação e Golden Paths para reduzir atrito sem esconder os trade-offs técnicos.

Meu trabalho combina profundidade hands-on com influência transversal: desenho arquiteturas, escrevo automações, conduzo RFCs, mentorias e decisões que ajudam times a operar sistemas distribuídos com mais autonomia e previsibilidade.

01

Sistemas antes de sintomas

Investigo arquitetura, dependências e modos de falha para resolver causas, não apenas restaurar o serviço.

02

Plataforma como produto

Transformo padrões operacionais em experiências self-service com adoção, governança e feedback dos usuários.

03

Influência com execução

Conecto decisões de arquitetura a código, automação, mentoria e operação real de ambientes críticos.

ProvisionamentoHoras → minutos
Escala operacionalMilhões de requisições / dia
Modo de atuaçãoEstratégico + hands-on

02 Experiência

Da infraestrutura à plataforma.

Uma trajetória construída em operações críticas, cloud, automação e plataformas internas — sempre próxima do código e dos times que usam o que foi construído.

fev/2025 — atual

Atuação independente

Consultor Principal — SRE, Platform Engineering e DevOps

Consultoria técnica para clientes nacionais em modernização de plataformas, confiabilidade e automação.

SRE advisoryKubernetesGitLab CI/CDArgoCD
  • Transformação de toil, falhas de observabilidade e dependências manuais em automações, runbooks, padrões reutilizáveis e roadmaps técnicos.
  • Evolução de releases com GitLab CI/CD, ArgoCD, runners, políticas de branch, Conventional Commits e Semantic Versioning.
  • Mentoria em arquitetura, troubleshooting, incident response e práticas operacionais sustentáveis.

out/2023 — jan/2025

Caju Benefícios

SRE Tech Lead e Platform Engineer

Liderança técnica de confiabilidade e plataforma em uma fintech regulada de benefícios corporativos.

Amazon EKSIaCObservabilityDevSecOps
  • Estruturação de SLIs, SLOs, error budgets, on-call, incident response, post-mortems e runbooks.
  • Modernização da entrega com ArgoCD, Argo Rollouts e Flagger para estratégias canary e blue-green.
  • IaC e self-service com Terraform, Terragrunt, Pulumi e Crossplane, integrados às esteiras de CI/CD.
  • Observabilidade unificada com OpenTelemetry, New Relic, Prometheus, Grafana, Loki e Datadog.

jan/2020 — ago/2023

Ambev / AB InBev

Principal Site Reliability Engineer / Platform Engineer

Iniciativas globais de SRE e Platform Engineering para centenas de squads na América Latina e Europa.

BackstageMulti-cloudKubernetesDeveloper Experience
  • Liderança da implementação do Backstage como Internal Developer Platform, com catálogo de mais de 800 serviços, scaffolding e Golden Paths.
  • Criação de capacidades self-service, padrões reutilizáveis e jornadas de onboarding para times de produto.
  • Fluxos multi-cloud com GitHub Actions, Azure DevOps, ArgoCD e Flagger, aplicando GitOps e progressive delivery.
  • Mentoria de engenheiros seniores e lideranças, influenciando decisões de arquitetura e confiabilidade de forma transversal.

jan/2013 — dez/2019

Endurance International Group / HostGator

Senior DevOps and Infrastructure Engineer

Infraestrutura e automação para plataformas de hospedagem de alto volume e operação 24x7.

LinuxAWSAutomation24x7 operations
  • Redução do provisionamento de ambientes de horas para minutos com Jenkins, Terraform, Ansible, Docker, Python e Shell Script.
  • Migração de infraestrutura on-premises para AWS com autoscaling, load balancing, networking resiliente e Disaster Recovery.
  • Observabilidade de plataformas com milhões de requisições diárias usando Prometheus, Grafana e ELK.

03 Especialidades

Sistemas que resistem.
Plataformas que avançam.

Capacidades complementares para transformar confiabilidade em velocidade sustentável — do cluster à experiência de quem entrega software.

01

Reliability Engineering

Confiabilidade tratada como capacidade de produto: objetivos mensuráveis, resposta disciplinada a incidentes e redução contínua de toil.

SLIs · SLOs · Error budgets · Incident response · RCA · Post-mortems · Disaster Recovery
02

Platform Engineering

Plataformas internas que convertem complexidade operacional em caminhos seguros, reutilizáveis e desejáveis para engenharia.

Backstage · Golden Paths · Service catalog · Scaffolding · Self-service · Developer Experience
03

Cloud & Kubernetes

Arquiteturas cloud-native resilientes e portáveis, com foco em isolamento, capacidade, escalabilidade e operação sustentável.

AWS · GCP · Azure · EKS · GKE · AKS · Karpenter · HPA · KEDA · Istio
04

Observability

Métricas, logs e tracing conectados ao contexto do negócio para acelerar diagnóstico e tornar alertas realmente acionáveis.

OpenTelemetry · Prometheus · Grafana · Loki · New Relic · Datadog · Dynatrace · ELK
05

IaC, GitOps & Delivery

Infraestrutura e entrega versionadas, auditáveis e progressivas, com automação desde o provisionamento até a produção.

Terraform · Terragrunt · Pulumi · Crossplane · ArgoCD · Argo Rollouts · Flagger · GitHub Actions
06

Governance & DevSecOps

Guardrails automatizados que incorporam segurança, compliance e eficiência de custos ao fluxo normal de engenharia.

OPA/Rego · Gatekeeper · Kyverno · Trivy · Snyk · Vault · Policy as code · FinOps

04 Base técnica

Formação e certificações.

2023 Certified Kubernetes Administrator — CNCF

2023 AWS Certified Solutions Architect — Associate

2022 HashiCorp Certified: Terraform Associate

2022 Istio Certified Associate — CNCF

2017 Site Reliability Engineering Nanodegree — Udacity

2020 Análise e Desenvolvimento de Sistemas — Unicesumar

05 Contato

Vamos elevar
a confiabilidade.

Aberto a posições 100% remotas como Senior, Staff ou Principal SRE, Platform Engineer, Specialist ou Tech Lead.

ModeloRemoto · Brasil
FormatoFull-time · CLT
IdiomasPortuguês · Inglês profissional