等待测试
检索知识,再生成回答RESTAURANT POS · EVALUATION
同一个问题,三种处理路径。
针对餐饮 SaaS 收银软件,对比回答、决策与联合处理。
正在检查服务配置…
01输入客服问题
L2-01 · 多知识关联试试
02选择测试模式
同一知识库 · 同一回复规则⌘ / Ctrl + Enter
测试结果 0 / 3
先运行测试,查看回答与决策之间的差异。
等待测试
只做判断,不生成回复等待测试
先判断,再选择处理路径三模式对比
AI 自动评审 · DeepSeek测试完成后自动评分,无需手动选择。按当前知识库与题目参考标准评审,查看逐项理由即可核对。分数是适用项通过比例,含不确定项时不合成总分;Jev Only 仅评两项,总分不与回复模式直接比较。
| 评估指标 | DeepSeek Only | Jev Only | Jev + DeepSeek |
|---|---|---|---|
| 自动评分AI 参考 | — | — | — |
| 正确性 | — | — | — |
| 无幻觉 | — | — | — |
| 追问能力 | — | — | — |
| 风险判断 | — | — | — |
| 规则检查辅助 | — | — | — |
| 回答 / 判断耗时 | — | — | — |
| 回答 / 判断 Token | — | — | — |
| 回答 / 判断成本USD | — | — | — |
| 额外自动评审耗时 · Token · USD | — | — | — |
每个成功的真实测试会额外调用一次 DeepSeek 评审,费用不包含在回答 / 判断成本中。评审可能误判,且与回答使用同一家供应商;这些分数不等于独立人工结论。