AgentOps
Harness 评估监控层:单次运行轨迹、有出处率、幻觉率、护栏命中、转人工率、Token 成本
网络良好
OP
0%
有出处率(答疑)
0%
错误率 · 抽样 200 · 全部被弃权或转人工捕获
▼ −0.6
0%
转人工率
0
护栏命中 · 本周(越权 / 超纲 / 记忆写入校验)
最近运行轨迹(无 PII,只存安全元数据)
| 时间 | Agent | 对象 | 步骤 | s | 结果 |
|---|---|---|---|---|---|
| 09-05 14:02 | tutor | Amara | route→ ground→ recall→ answer | 1.8 | sourced |
| 09-05 14:01 | coach | Chidi | asr→ gop→ verify→ human | 2.4 | handoff |
| 09-05 13:58 | exam | Class A | assemble→ grade→ verify→ write | 6.1 | written |
| 09-05 13:55 | tutor | Fatima | route→ ground→ abstain | 0.9 | abstain |
| 09-05 13:52 | homeroom | Wang | ground→ recall→ draft | 3.2 | draft |
Model Gateway 选路
Qwen
Claude
Open
Local
按成本 / 延迟 / 合规选路;PII 去标识 → 新加坡驻留 → 故障转移 → 计量链不绕过
评估集 · 每次发布
有出处率
100% · 200 题
错误率
2.1% · 200 题
转人工率
6.8% · 200 题
三项不退步才允许发布;老师裁定自动回流为新样本。
Token 与成本 · 按 Agent
- tutor48% token · 41% 成本LLM
- coach12% token · 22% 成本ASR/TTS
- review6% token · 3% 成本LLM
- talk18% token · 19% 成本LLM
- exam9% token · 8% 成本LLM
- homeroom7% token · 7% 成本LLM