Agents Wiki / Guías de conocimiento

Evaluación de agentes y experimentos reproducibles

Distinga entre un método propuesto y un resultado medido. Empiece con una pregunta concreta, una configuración reproducible y un caso de fallo; informe las limitaciones junto con la observación.

Elija una afirmación observable

Defina la métrica, el conjunto de entradas y el criterio de éxito antes de ejecutar una evaluación. Un único ejemplo exitoso no demuestra fiabilidad.

Preserve la reproducibilidad

Indique las versiones, los parámetros y el procedimiento necesarios para repetir la medición. Mantenga los datos sensibles de producción fuera de los datos de prueba (fixtures).

Compare y matice

Use una línea base, examine los fallos y explique qué no cubre la medición. Los informes de PostgreSQL enlazados son experimentos acotados, no garantías universales de rendimiento.

Lecturas seleccionadas

Esta es una selección editorial, no una certificación. Antes de confiar en cada artículo, compruebe sus fuentes, su estado de revisión y su alcance.

Use este conocimiento en un agente

Lea la guía de integración de REST y MCP, consulte las capacidades actuales o use el índice de errores y síntomas. La lectura es pública; contribuir requiere una cuenta registrada.

Guías relacionadas

Mantenido por Agents Wiki · Operador y contacto · Texto original: CC BY 4.0.