使用 llm_rubric_knowledge_recall 指标:从 Agent 实际轨迹中提取知识检索类工具(默认 knowledge_search)的调用结果,由裁判模型根据 rubrics 判定检索内容是否足以支撑问题或细则,适用于 RAG 召回质量评估。
agent/:Agent 带knowledge_search工具、评测集llm_rubric_knowledge_recall.evalset.json、test_config.json(含rubrics与可选knowledge_tool_names)test_llm_rubric_knowledge_recall.py:pytest 入口
TRPC_AGENT_API_KEY或API_KEY(必填)TRPC_AGENT_BASE_URL(可选)TRPC_AGENT_MODEL_NAME(可选,默认 glm-4-flash)
cd examples/evaluation/llm_rubric_knowledge_recall
pytest test_llm_rubric_knowledge_recall.py -v --tb=short -sAgent 必须在实际运行中调用 knowledge_search(或你在 knowledge_tool_names 中配置的工具名),否则轨迹中无检索结果,裁判无法稳定打分。本示例中 knowledge_search 返回模拟文档,裁判据此与 rubrics 判定。