Qual a melhor forma de medir a "qualidade da trajetória" de um agente autônomo em produção?

Temos agentes no Vertex AI que executam sequências de até 15 ferramentas por chamada. Avaliar apenas a resposta final é insuficiente — precisamos auditar a trajetória: quais ferramentas foram chamadas, em que ordem, com quais parâmetros. O Google oferece métricas nativas para trajectory matching no Vertex AI Evaluation? E como vocês estão lidando com a correlação entre eficiência de trajetória e qualidade da resposta final?

1 Like