Agent Evaluation 是对 Agent 的输入理解、推理过程、工具选择、知识检索、协作行为、最终输出、成本、安全性和业务结果进行系统性度量与判断的工程体系。
Agent Observability 不是简单地给 Agent 加上 Metrics、Logs、Traces,而是要对 Agent 的“决策、执行、协作和结果”进行完整观测
Agent Reliability 是 Agent 在面对正常请求、异常输入、依赖故障、模型不确定性以及复杂执行路径时,持续完成目标并保持安全、可控和可恢复行为的能力。
正确的问题使用正确的模型,在正确的 Context 下,以正确的 Agent 策略完成任务,并在整个生命周期内受到成本预算和质量指标约束