Trabajo / Agent observability
Agent observability
Trazas y evaluación de los agentes que ejecuto.
Qué es
Laboratorio por fases de observabilidad de sistemas agénticos, desplegado en un NAS con agentes reales y con redacción fail-closed de datos sensibles. LangFuse traza cada agente que ejecuto y esas trazas alimentan puntuaciones y evaluadores propios, así que un cambio de harness se juzga por resultados medidos. Aparte, un Arize Phoenix autoalojado traza las llamadas a LLM del escaneo de tickets de Tally.
Estado
Hecho
- Trazas OTel, Collector, métricas y dashboards
- Convenciones GenAI, router, retry y subagentes
- Fases 8 a 11: MCP y jobs asíncronos, sesiones en Langfuse, privacidad y depuración de fallos
- Despliegue en NAS con agentes reales y los cuatro runtimes por su gateway
- SLI/SLO con panel y alertas a Telegram
- Suite de benchmark coding-v1: 10 tareas con resultados cruzados con telemetría
Ahora
Nada en curso.
Después
Sin planes cerrados.
Cambios recientes
Resumen de las PRs mergeadas, actualizado a diario.
- Avisos de la cadena de telemetría entregados en Telegram, con latido diario
- Suite de benchmark coding-v1: 10 tareas con resultados puntuados cruzando la telemetría
- La telemetría de cada sesión se atribuye a la tarea que la produjo y cada runtime se identifica
- Los cuatro runtimes envían su telemetría por el gateway del NAS; se retira la ingesta directa
- SLI/SLO de producción: cuatro métricas, panel de Grafana y guía multi-inquilino
- Fase 11: inyección de fallos y depuración guiada por señales, verificada en el NAS
- Fases 8 a 10: jobs asíncronos y MCP, sesiones evaluadas en Langfuse, muestreo y privacidad