Paese
Settore
Search a job
INFORMATIQUE-ELECTRONIQUE-NUMERIQUE

SRE Engineer

Fiabilità dei sistemi distribuiti ad alta disponibilità attraverso automazione e analisi degli incidenti

28 000 – 70 000 EUR (€)
Stipendio / anno
Laurea triennale o magistrale in Informatica o Ingegneria Informatica
Livello formazione
00
Automazione
Medio
Difficoltà
Positiva
Occupabilità
6-12 mesi
Tensione del mercato
Media
Mobilità
Possibile
Automazione
Medio
Difficoltà
Positiva
Occupabilità
6-12 mesi
Tensione del mercato
Media
Mobilità
Possibile
Sponsorizza questa scheda mestiereSPAZIO PARTNERSponsorizzaquesta scheda mestiereDiventa sponsor

About

L'SRE Engineer (Site Reliability Engineer) opera in ambienti cloud-native o ibridi per mantenere e migliorare la stabilità dei sistemi in produzione. Utilizza strumenti come Kubernetes, Terraform, Prometheus, Grafana e pipeline CI/CD per gestire infrastrutture scalabili. Collabora con team di sviluppo, product engineering e sicurezza per definire SLO, SLA e error budget. Interviene su incidenti critici, conduce post-mortem e costruisce soluzioni di automazione che riducono il lavoro operativo ripetitivo.

Competenze

Competenze tecniche

  • Esperienza con Kubernetes e container orchestration come Docker e Helm
  • Competenza in Infrastructure as Code con Terraform, Pulumi e Ansible
  • Utilizzo dello stack di observability: Prometheus, Grafana, Loki, Jaeger
  • Ottimizzazione di CI/CD pipelines con GitHub Actions e GitLab CI
  • Conoscenza dei principali cloud provider come AWS, GCP o Azure
  • Scripting avanzato in Python, Go e Bash per automazione
  • Gestione incidenti con strumenti come PagerDuty e OpsGenie
  • Implementazione di chaos engineering con Litmus e Chaos Monkey

Competenze interpersonali

  • Analisi strutturata dei problemi sotto pressione operativa
  • Comunicazione tecnica chiara verso team non specializzati
  • Orientamento alla riduzione sistematica del debito operativo
  • Collaborazione trasversale in ambienti distribuiti e asincroni
  • Rigore documentale nei processi post-incidente

Compiti

  • Definire e monitorare SLO, SLI e SLA con strumenti avanzati come Prometheus e Grafana, mirando a ridurre il tasso di violazione di un 20% trimestrale
  • Automatizzare il provisioning dell'infrastruttura utilizzando Terraform e Ansible, trasformando i tempi di deploy da ore a minuti
  • Progettare runbook operativi e playbook di risposta agli incidenti con PagerDuty e OpsGenie
  • Condurre post-mortem blameless entro 48 ore da ogni incidente P1, creando action item tracciabili
  • Ottimizzare pipeline CI/CD su GitHub Actions o GitLab CI per ridurre il lead time di rilascio sotto i 15 minuti
  • Gestire cluster Kubernetes in produzione con politiche di autoscaling, resource quota e network policy
  • Implementare strategie di chaos engineering con Chaos Monkey o Litmus per testare la resilienza del sistema
  • Analizzare log strutturati su Elasticsearch o Loki per identificare pattern di degrado prima dell'impatto utente
  • Collaborare con i team di sviluppo per ridurre il toil operativo attraverso l'adozione di pratiche GitOps
  • Definire e applicare policy di capacity planning basate su metriche storiche e previsioni di crescita del traffico

Ambienti di lavoro

Gli ambienti di lavoro possono variare:

Scale-up tecnologiche con architetture microservizi avanzate
Grandi aziende con sistemi legacy in migrazione cloud
Società di e-commerce ad alto traffico stagionale
Piattaforme SaaS B2B con SLA contrattuali stringenti
Team di platform engineering in contesti multi-cloud
Aziende FinTech e AdTech con requisiti di uptime elevati

Possibili evoluzioni

  • Progredire verso Staff SRE Engineer per guidare iniziative strategiche
  • Diventare Principal Engineer – Reliability in grandi organizzazioni
  • Assumere il ruolo di Head of Platform Engineering per innovare piattaforme
  • Dirigere come Director of Infrastructure in contesti complessi
  • Ambire al ruolo di CTO in startup tecnologiche

Profilo ricercato

Rigore metodologico nell'analisi delle cause radice
Capacità di scrivere codice per automatizzare operazioni ripetitive
Comfort nella gestione di situazioni di crisi tecnica
Approccio sistematico alla documentazione e alla knowledge base
Come diventare SRE Engineer?

Professioni dello stesso settore