实验空间/餐饮收银客服
真实 API
RESTAURANT POS · EVALUATION

同一个问题,三种处理路径。

针对餐饮 SaaS 收银软件,对比回答、决策与联合处理。

01 / 实验

正在检查服务配置…

01输入客服问题

L2-01 · 多知识关联
试试

02选择测试模式

同一知识库 · 同一回复规则
⌘ / Ctrl + Enter

测试结果 0 / 3

先运行测试,查看回答与决策之间的差异。

等待测试

检索知识,再生成回答

等待测试

只做判断,不生成回复

等待测试

先判断,再选择处理路径

三模式对比

AI 自动评审 · DeepSeek

测试完成后自动评分,无需手动选择。按当前知识库与题目参考标准评审,查看逐项理由即可核对。分数是适用项通过比例,含不确定项时不合成总分;Jev Only 仅评两项,总分不与回复模式直接比较。

评估指标DeepSeek OnlyJev OnlyJev + DeepSeek
自动评分AI 参考
正确性
无幻觉
追问能力
风险判断
规则检查辅助
回答 / 判断耗时
回答 / 判断 Token
回答 / 判断成本USD
额外自动评审耗时 · Token · USD

每个成功的真实测试会额外调用一次 DeepSeek 评审,费用不包含在回答 / 判断成本中。评审可能误判,且与回答使用同一家供应商;这些分数不等于独立人工结论。