For Employers

EX Squared

SRE

Posted 4 days ago
2-5 years experience
Apply Now

Please mention DailyRemote when applying

?
Resume Match Score

See how much of this job your resume covers, and what’s missing.

Want a recruiter to go through it line by line?

Get professional review

Create a cover letter for this job

Upload your resume and we draft a letter for this exact role, tailored to what it asks for.

  • Tailored to this role
  • Based on your resume
  • Fully editable
AI Summary

Automate operational tasks and build observability, reliability objectives, deployment controls, and incident response practices for critical production services. Analyze service capacity and performance, strengthen resilience and recovery, and document SRE standards while collaborating with development and platform teams.

En EX Squared LATAM somos una empresa de transformación digital enfocada en desarrollar soluciones tecnológicas innovadoras y de alto impacto que generan valor real para el negocio. Trabajamos con clientes de primer nivel en mercados globales, regionales y locales, fomentando una cultura colaborativa, inclusiva e impulsada por la innovación, donde las ideas de cada persona realmente importan.


Buscamos un/a Site Reliability Engineer (SRE) con experiencia sólida en operación de servicios críticos y entornos productivos, que combine conocimientos de cloud, automatización, observabilidad y gestión de incidentes para contribuir a la construcción y evolución de plataformas tecnológicas confiables, resilientes y escalables.

La posición trabajará de manera cercana con equipos de desarrollo y plataforma, promoviendo prácticas de confiabilidad desde el diseño hasta la operación y equilibrando la estabilidad de los servicios con la velocidad de entrega de cambios.

Tipo de posición: Tiempo completo, long-term.


Responsabilidades

  • Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos.
  • Implementar y evolucionar prácticas de observabilidad, utilizando métricas, logs y trazas para entender el comportamiento de los servicios.
  • Definir y mantener SLIs y SLOs en conjunto con equipos de desarrollo y stakeholders del negocio.
  • Participar en la atención de incidentes y esquemas de on-call, realizando diagnóstico, contención y recuperación de servicios.
  • Liderar y documentar análisis post-incidente y Root Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas.
  • Promover el modelo “you build it, you run it”, incorporando prácticas de confiabilidad desde el desarrollo.
  • Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines de CI/CD.
  • Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración.
  • Evaluar y fortalecer la resiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios.
  • Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering.


Requisitos

  • Experiencia profesional en Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations.
  • Experiencia hands-on trabajando con servicios críticos y ambientes productivos.
  • Sólidos conocimientos de Linux y troubleshooting de infraestructura y aplicaciones.
  • Experiencia con plataformas de cloud computing.
  • Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento.
  • Experiencia atendiendo incidentes de producción, troubleshooting y Root Cause Analysis.
  • Conocimiento de conceptos de SLI, SLO y SLA y su aplicación en la gestión de confiabilidad.
  • Experiencia con automatización y scripting.
  • Conocimiento de CI/CD y procesos modernos de deployment.
  • Experiencia con Infrastructure as Code, idealmente Terraform.
  • Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad.
  • Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones.


Deseable

  • Experiencia con AWS y arquitecturas cloud-native.
  • Experiencia con Terraform y automatización de infraestructura.
  • Experiencia con Docker y Kubernetes.
  • Conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes.
  • Experiencia trabajando con estrategias de High Availability y Disaster Recovery.
  • Experiencia en análisis de capacidad, performance y escalabilidad.
  • Experiencia participando en esquemas de on-call y gestión de incidentes críticos.
  • Certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.


Beneficios

  • Seguro médico privado.
  • Asociación solidarista.
  • Vacaciones y feriados de acuerdo con la legislación de Costa Rica.
  • Oportunidades de aprendizaje y crecimiento profesional.
  • Participación en proyectos tecnológicos de alto impacto.


Nota de elegibilidad

Esta oportunidad está disponible únicamente para candidatos que residan actualmente en Costa Rica. Aplicaciones fuera de esta región no serán consideradas.

Automatically Apply to the Best Remote Jobs

Stop the endless job search. Our AI finds and applies to the best jobs for you.

Try it Now
Keep looking

Similar Jobs

See all Remote Software Development jobs →

Senior .NET Developer / Tech Lead

Freelance Estonia, Latvia, Lithuania Software Development

Blockchain Developer (Java)

Freelance United States Software Development

Member of Technical Staff, Production Site Reliability Engineer

Full Time United States $200K - $400K per year Software Development

Senior Database Administrator

Other United States $150K - $170K per year Software Development

Lead Mainframe Developer

Full Time United States $132K - $221K per year Software Development

AI & Technical Upskilling Sr Specialist

Full Time United States $72590 - $95000 per year Software Development
Apply Now

Personalize your Remote Job Search in 3 Easy Steps!

Featuring 213,687+ Jobs in Software Development

Answer easy questions

Answer easy questions

213,687+ jobs across 15+ categories

Get your best job matches

Get your best job matches

Only hand-screened, legit jobs

Find a remote job faster

Find a remote job faster

No ads, scams, or junk

“I was the first applicant for a remote marketing position that got listed on the company website the same day I applied. Had an interview within 48 hours!”

Sarah J. — Sarah J. · Marketing Manager ★★★★★ Verified