Ingeniero de software

Hace 9 horas

castro, castilla león, España Shakers Jornada completa

Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada.

Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado.



🎯 Sobre el ro

lSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy importante — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad. Impacto tangible en la fiabilidad de soluciones IA a escala



?? Lo que har


ás
Arquitecturas de agent

  • es:Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi
  • ng.Distinguir y diseñar workflows vs agentes según caso de u
  • so.Trabajar con MCP (Model Context Protocol) y, idealmente, A
  • 2A.Orquestar sistemas multi-agen


te.
Runtime de agen

  • tes:Gestionar execution loop, state management, orchestration, retries, checkpoint
  • ing.Implementar streaming, human-in-the-loop, gestión de conte
  • xto.Observabilidad avanzada, tracing, tool execution, concurre


ncy.
Evaluación (crít

  • ico):Diseñar evals offline y on
  • line.Construir benchmarks robustos + golden datasets + synthetic data
  • sets.Aplicar LLM-as-a-judge, pairwise compar
  • ison.Regression testing + experiment tracking + reproducibilidad (MLf


low)

  • .
    RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi


ndows.
LLM Engin

  • eering:Prompting, structured outputs, JSON schema, function c
  • alling.Optimización de tokenización, coste, latencia, c
  • aching.Reasoning models + context window mana


gement.
Backend + Observabilidad +

  • Testing:Python backend con FastAPI, Docker, Kub
  • ernetes.OpenTelemetry + Grafana + Pro
  • metheus.Unit testing, integration testing, eval testing, regression suites, CI/CD


para IA.
✅ Impres

  • cindiblesExperiencia sólida diseñando arquitecturas de agentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routi
  • ng, MCP).Experiencia práctica con runtime de agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, conc
  • urrency).Experiencia crítica en evaluación de modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experiment
  • tracking.Dominio avanzado de Python para backend
  • robusto.Conocimiento experto de RAG (chunking, embeddings, reranking, vector DBs, retrieval
  • quality).LLM Engineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoning
  • models).Experiencia con MLflow para experiment
  • tracking.Inglés


avanzado
💡 Muy

  • valorableFrameworks de agentes: LangGraph, OpenAI A
  • gents SDK.A2A (Agent-to-Agent
  • Protocol).Infraestructura: FastAPI, Docker, Kubernetes, Redis, Kafka, P
  • ostgreSQL.Observabilidad: OpenTelemetry, Grafana, P
  • rometheus.Testing: unit + integration + eval + regression suites + CI/C
  • D para IA.Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP


Vertex AI.
💻

  • CondicionesModalidad: freelance v
  • ía Shakers.Duración: 12 meses con alta probabilidad de
  • extensión.Ubicación: 100% remoto de


sde España.
En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. Tú te centras en construir agentes IA fiables y evaluables a escala


productiva.