em infraestrutura, SRE e plataformas
Marco Cristofolini
Principal / Staff
Site Reliability
Engineer
SREPlatform EngineeringCloud Engineering
Há mais de 13 anos, construo confiabilidade em escala — de plataformas cloud-native à liderança técnica — sem abrir mão da execução hands-on.
organizados em catálogo Backstage
impactadas por iniciativas globais de plataforma
01 Sobre
Confiabilidade não é uma camada.
É uma decisão de engenharia.
Conecto estratégia, arquitetura e operação para que sistemas e equipes evoluam com segurança.
Sou Principal Site Reliability Engineer e Platform Engineer. Minha trajetória começou em infraestrutura Linux e ambientes 24x7, avançou por automação e cloud e chegou à construção de plataformas internas usadas por centenas de squads.
Atuo na interseção entre confiabilidade, experiência de desenvolvimento e objetivos de negócio. Estruturo SLOs, observabilidade, resposta a incidentes, automação e Golden Paths para reduzir atrito sem esconder os trade-offs técnicos.
Meu trabalho combina profundidade hands-on com influência transversal: desenho arquiteturas, escrevo automações, conduzo RFCs, mentorias e decisões que ajudam times a operar sistemas distribuídos com mais autonomia e previsibilidade.
Sistemas antes de sintomas
Investigo arquitetura, dependências e modos de falha para resolver causas, não apenas restaurar o serviço.
Plataforma como produto
Transformo padrões operacionais em experiências self-service com adoção, governança e feedback dos usuários.
Influência com execução
Conecto decisões de arquitetura a código, automação, mentoria e operação real de ambientes críticos.
02 Experiência
Da infraestrutura à plataforma.
Uma trajetória construída em operações críticas, cloud, automação e plataformas internas — sempre próxima do código e dos times que usam o que foi construído.
fev/2025 — atual
Atuação independente
Consultor Principal — SRE, Platform Engineering e DevOps
Consultoria técnica para clientes nacionais em modernização de plataformas, confiabilidade e automação.
- Transformação de toil, falhas de observabilidade e dependências manuais em automações, runbooks, padrões reutilizáveis e roadmaps técnicos.
- Evolução de releases com GitLab CI/CD, ArgoCD, runners, políticas de branch, Conventional Commits e Semantic Versioning.
- Mentoria em arquitetura, troubleshooting, incident response e práticas operacionais sustentáveis.
out/2023 — jan/2025
Caju Benefícios
SRE Tech Lead e Platform Engineer
Liderança técnica de confiabilidade e plataforma em uma fintech regulada de benefícios corporativos.
- Estruturação de SLIs, SLOs, error budgets, on-call, incident response, post-mortems e runbooks.
- Modernização da entrega com ArgoCD, Argo Rollouts e Flagger para estratégias canary e blue-green.
- IaC e self-service com Terraform, Terragrunt, Pulumi e Crossplane, integrados às esteiras de CI/CD.
- Observabilidade unificada com OpenTelemetry, New Relic, Prometheus, Grafana, Loki e Datadog.
jan/2020 — ago/2023
Ambev / AB InBev
Principal Site Reliability Engineer / Platform Engineer
Iniciativas globais de SRE e Platform Engineering para centenas de squads na América Latina e Europa.
- Liderança da implementação do Backstage como Internal Developer Platform, com catálogo de mais de 800 serviços, scaffolding e Golden Paths.
- Criação de capacidades self-service, padrões reutilizáveis e jornadas de onboarding para times de produto.
- Fluxos multi-cloud com GitHub Actions, Azure DevOps, ArgoCD e Flagger, aplicando GitOps e progressive delivery.
- Mentoria de engenheiros seniores e lideranças, influenciando decisões de arquitetura e confiabilidade de forma transversal.
jan/2013 — dez/2019
Endurance International Group / HostGator
Senior DevOps and Infrastructure Engineer
Infraestrutura e automação para plataformas de hospedagem de alto volume e operação 24x7.
- Redução do provisionamento de ambientes de horas para minutos com Jenkins, Terraform, Ansible, Docker, Python e Shell Script.
- Migração de infraestrutura on-premises para AWS com autoscaling, load balancing, networking resiliente e Disaster Recovery.
- Observabilidade de plataformas com milhões de requisições diárias usando Prometheus, Grafana e ELK.
03 Especialidades
Sistemas que resistem.
Plataformas que avançam.
Capacidades complementares para transformar confiabilidade em velocidade sustentável — do cluster à experiência de quem entrega software.
Reliability Engineering
Confiabilidade tratada como capacidade de produto: objetivos mensuráveis, resposta disciplinada a incidentes e redução contínua de toil.
SLIs · SLOs · Error budgets · Incident response · RCA · Post-mortems · Disaster RecoveryPlatform Engineering
Plataformas internas que convertem complexidade operacional em caminhos seguros, reutilizáveis e desejáveis para engenharia.
Backstage · Golden Paths · Service catalog · Scaffolding · Self-service · Developer ExperienceCloud & Kubernetes
Arquiteturas cloud-native resilientes e portáveis, com foco em isolamento, capacidade, escalabilidade e operação sustentável.
AWS · GCP · Azure · EKS · GKE · AKS · Karpenter · HPA · KEDA · IstioObservability
Métricas, logs e tracing conectados ao contexto do negócio para acelerar diagnóstico e tornar alertas realmente acionáveis.
OpenTelemetry · Prometheus · Grafana · Loki · New Relic · Datadog · Dynatrace · ELKIaC, GitOps & Delivery
Infraestrutura e entrega versionadas, auditáveis e progressivas, com automação desde o provisionamento até a produção.
Terraform · Terragrunt · Pulumi · Crossplane · ArgoCD · Argo Rollouts · Flagger · GitHub ActionsGovernance & DevSecOps
Guardrails automatizados que incorporam segurança, compliance e eficiência de custos ao fluxo normal de engenharia.
OPA/Rego · Gatekeeper · Kyverno · Trivy · Snyk · Vault · Policy as code · FinOps04 Base técnica
Formação e certificações.
2023 Certified Kubernetes Administrator — CNCF
2023 AWS Certified Solutions Architect — Associate
2022 HashiCorp Certified: Terraform Associate
2022 Istio Certified Associate — CNCF
2017 Site Reliability Engineering Nanodegree — Udacity
2020 Análise e Desenvolvimento de Sistemas — Unicesumar
05 Contato
Vamos elevar
a confiabilidade.
Aberto a posições 100% remotas como Senior, Staff ou Principal SRE, Platform Engineer, Specialist ou Tech Lead.