(Senior) AI Platform Engineer (m/f/d)
Buscamos un perfil (Senior) AI Platform Engineer con experiencia para diseñar, Implementar y mejorar plataformas modernas, escalables y orientadas a IA y Machine Learning. Trabajarás con Kubernetes, infraestructuras GPU, automatización e Infraestructura como Código (IaC), así como con procesos modernos de CI/CD y MLOps, tanto en entornos on-premises como en la nube.
Te esperan proyectos variados para clientes de múltiples sectores y un equipo comprometido y apasionado por construir la próxima generación de soluciones de inteligencia artificial. Si deseas aportar tu experiencia a proyectos innovadores, ¡esperamos tu candidatura!
Quiénes somos
evoila es un líder europeo especializado en Cloud Infrastructure, Cloud Native, Data & AI y App Modernization, con un fuerte crecimiento en España. Colaboramos con empresas medianas y grandes para diseñar y construir infraestructuras cloud modernas, escalables y seguras.
Somos partners reconocidos de VMware, Microsoft y otros líderes del sector. ¿Nuestro enfoque? Nada de palabrería—solo competencia y resultados.
En evoila, te esperan proyectos emocionantes, donde desarrollarás e implementarás soluciones innovadoras para clientes de diversas industrias.
Tus responsabilidades
- Diseñar, implementar y operar plataformas y servicios de IA/ML altamente disponibles, principalmente sobre Kubernetes, en entornos on-premises, híbridos y cloud.
- Diseñar e implementar infraestructuras GPU escalables en clústeres Kubernetes, incluyendo mecanismos avanzados de programación y compartición de GPU (por ejemplo: Kueue, KAI Scheduler, Run:ai, NVIDIA MIG o time-slicing), con especial atención a la optimización de costes y recursos.
- Implementar y mantener servicios de inferencia y despliegue de modelos (por ejemplo: vLLM, NVIDIA Triton, KServe, NVIDIA NIM o Ray), tanto para modelos tradicionales de Machine Learning como para Large Language Models (LLMs).
- Desarrollar y operar procesos de MLOps y LLMOps para servicios de IA Generativa en producción, incluyendo controles de seguridad (guardrails), políticas, evaluación de modelos, pruebas de regresión y monitorización de calidad y costes.
- Implementar procesos de fine-tuning y reentrenamiento continuo de modelos (por ejemplo, LoRA y aprendizaje continuo).
- Monitorizar, diagnosticar y optimizar plataformas de IA, incluyendo métricas como utilización de GPU, latencia de inferencia y throughput, garantizando el máximo rendimiento y disponibilidad.
- Asesorar a nuestros clientes sobre mejores prácticas, gobierno de IA, seguridad y protección de datos en plataformas basadas en Kubernetes.
- Colaborar estrechamente con equipos de Data Science, plataformas de datos y desarrollo para garantizar la integración eficiente de soluciones de IA.
Qué buscamos
- Mínimo 3 años de experiencia operando y optimizando plataformas y servicios a gran escala sobre Kubernetes, tanto en entornos cloud como on-premises.
- Conocimientos sólidos en diseño y operación de soluciones escalables basadas en Kubernetes, idealmente incluyendo cargas de trabajo con GPU.
- Experiencia en programación con Python; se valorarán conocimientos de Golang o Java.
- Experiencia con al menos un framework de serving de modelos (como vLLM, NVIDIA Triton o KServe) y conocimientos prácticos de herramientas MLOps (MLflow, Kubeflow, ClearML u otras).
- Experiencia con herramientas de Infraestructura como Código como Terraform y Ansible, así como con herramientas de CI/CD y GitOps (Argo CD, Flux, entre otras).
- Capacidad para interactuar con clientes y explicar conceptos técnicos tanto a equipos de ingeniería como a perfiles de dirección.
- Excelentes habilidades de comunicación en español e inglés.
- No se aceptarán candidaturas en modalidad remota desde otros países. Es imprescindible residir en España.
Requisitos adicionales para el nivel Senior
- Más de 5 años de experiencia relevante en Platform Engineering.
- Responsabilidad sobre el diseño integral de arquitecturas de plataformas de IA y toma de decisiones tecnológicas clave.
- Liderazgo técnico en proyectos con clientes y experiencia en mentoría y acompañamiento de otros profesionales.
Se valorará positivamente
- Experiencia con servicios de IA en la nube como AWS SageMaker, AWS Bedrock, Azure Machine Learning, Azure OpenAI, Azure AI Foundry y su integración con Kubernetes.
- Experiencia en arquitecturas basadas en LLM, incluyendo:
- RAG (Retrieval-Augmented Generation)
- Bases de datos vectoriales
- Servicios de embeddings
- Sistemas Agentic AI
- Model Context Protocol (MCP)
- Conocimientos sobre aspectos de infraestructura de modelos LLM como Rate limiting, Token streaming, Balanceo de carga, Prompt templates, Tool calling, Modelos con capacidades de razonamiento
- Experiencia con componentes emergentes de inferencia como llm-d, Kubernetes Inference Gateway
- Conocimientos en seguridad de plataformas de IA: TLS, RBAC, Network Policies, Gobierno de IA y cumplimiento normativo (incluyendo el Reglamento Europeo de IA - EU AI Act)
- Certificaciones relevantes, como:
- Certified Kubernetes Administrator (CKA)
- Certified Kubernetes Developer (CKAD)
- Certificaciones NVIDIA
- Disponibilidad para realizar viajes puntuales en España o Europa según necesidades de los clientes y proyectos asignados
¿Qué ofrecemos?
- Participación en proyectos innovadores de IA, Machine Learning y Cloud Native.
- Trabajo con tecnologías punteras y arquitecturas de última generación.
- Desarrollo profesional continuo y acceso a formación especializada.
- Un entorno colaborativo, internacional y orientado al aprendizaje.
- Flexibilidad y autonomía dentro de una compañía europea en pleno crecimiento.
¿Te apasiona construir las plataformas que impulsarán la próxima generación de soluciones de Inteligencia Artificial? Entonces queremos conocerte.
En evoila, la formación intensiva y el desarrollo profesional no son solo palabras en papel, sino una realidad para todos nuestros empleados.
Si quieres trabajar en proyectos reales, con profesionales competentes, en un entorno sin burocracia, únete a nuestro equipo y da forma al futuro de la nube.
_____________
(Senior) AI Platform Engineer (m/f/d)
We are looking for an experienced (Senior) AI Platform Engineer (m/f/d) to design, run and keep improving modern, scalable AI and ML platforms. You will work with Kubernetes, GPU infrastructure, automation and Infrastructure-as-Code, along with modern CI/CD and MLOps processes, both on-premises and in the cloud. You can expect varied customer projects across many industries and a committed team that is passionate about building the next generation of AI solutions. If you want to bring your expertise to innovative projects, we look forward to your application!
Who We Are
evoila is an European leader specializing in Cloud Infrastructure, Cloud Native, Data & AI, and App Modernisation, with a strong growth in Spain. We collaborate with medium and large enterprises to design and build modern, scalable, and secure cloud infrastructures.
We are recognized partners of VMware, Microsoft, and other industry leaders. Our approach? No fluff—just expertise and impact.
At evoila, exciting projects await you, where you will develop and implement innovative solutions for customers across various industries.
Your responsibilities
- Plan, build and run highly available AI/ML platforms and services, mainly on Kubernetes, in on-premises, hybrid and cloud environments.
- Design and implement scalable GPU infrastructure in Kubernetes clusters, including GPU scheduling and sharing (e.g. Kueue, KAI Scheduler, Run:ai, NVIDIA MIG/time-slicing), with a focus on utilization and cost efficiency.
- Build and run model-serving and inference services (e.g. vLLM, NVIDIA Triton, KServe, NVIDIA NIM, Ray) for classic ML models and large language models.
- Develop and run MLOps/LLMOps workflows for GenAI services in production, including guardrails and policies, evaluation, regression testing, and cost and quality monitoring.
- Provide fine-tuning and re-training workflows (e.g. LoRA, continuous re-training) on the platform.
- Monitor, troubleshoot and tune AI platforms (e.g. GPU utilization, inference latency, throughput) to keep performance and availability as high as possible.
- Advise our customers on best practices, AI governance, data security and data protection for AI platforms on Kubernetes.
- Work closely with data science, data platform and development teams so that AI solutions integrate smoothly.
What you bring
- At least 3 years of experience running and optimizing platforms and services at scale in Kubernetes environments, on-premises or in the cloud.
- In-depth knowledge of designing and running scalable Kubernetes-based solutions, ideally including GPU workloads.
- Programming skills in Python, ideally also Golang or Java.
- Experience with at least one model-serving framework (e.g. vLLM, NVIDIA Triton, KServe), and some or extensive experience with MLOps tools (e.g. MLflow, Kubeflow, ClearML).
- Experience with Infrastructure-as-Code tools such as Ansible and Terraform, and with CI/CD and GitOps tools (e.g. Argo CD, Flux).
- Excellent communication skills in Spanish and English. Ideally, you have advised customers before and can explain technical topics to any audience, from engineering teams to management.
- NO remote position from other countries, candidates should be based in Spain.
Additionally for the senior role
- 5+ years of relevant experience in platform engineering.
- Architecture ownership: you are responsible for designing AI platforms end-to-end and make the core technology decisions.
- Technical leadership in customer projects (lead role) and mentoring of colleagues.
Nice to have
- Experience with cloud AI services (e.g. AWS SageMaker/Bedrock, Azure ML/Azure OpenAI/Azure AI Foundry) and integrating them with Kubernetes workloads.
- Knowledge of running LLM-based architectures, e.g. RAG pipelines, vector databases and embedding services, as well as agentic AI approaches and the Model Context Protocol (MCP).
- Understanding of the system-level basics of LLM serving (rate limiting, token streaming, load balancing) and of LLM concepts such as reasoning, tool calling and prompt templates.
- Experience with new serving components such as llm-d or the Kubernetes Inference Gateway.
- Knowledge of securing AI platforms, e.g. TLS, RBAC and network policies in Kubernetes environments, and a basic understanding of AI governance (e.g. the EU AI Act).
- Certifications in relevant technologies (e.g. Certified Kubernetes Administrator/Developer, NVIDIA certifications).
- Willingness to travel occasionally in Spain or across Europe.
Intensive onboarding and regular training are not just on paper for us but are a given for all our employees.
If you want to work on real projects, with competent professionals, in a non-bureaucratic environment, join our team and be part of the change.
Permanent Full-Time