场次报告
医疗访问,怀疑的心脏科医师
受训者:Marcela R. · 通路:语音 · 12 分钟
87
通过
在派发当下冻结的能力
PROD-001
产品熟稔度
92
OBJ-003
异议处理
78
COMP-014
仿单依从性
95
评估标准(rubric)
AI 洞察 · 强项
在 1 分 15 秒就把 pitch 锚定在 HCP 的高血压患者样态。被挑战疗效时,引用第 3 期试验的结果。
可改进之处
在 4 分 32 秒,HCP 询问与 β 阻断剂的交互作用时,回应模糊(「我查一下再回复您」)。建议:对药物交互作用做精准辅导。
您企业的能力框架
每位企业都有自己的能力与评估标准目录。在 onboarding 时依垂直由中央目录拷贝过来,之后完全可编辑,您可以加入任何目录都没有、属于您业务的能力。
AI 打分。代码决定。
AI 负责打分。通过/不通过规则由可稽核的代码决定,包含「合规 blocker」,可在分数很高的情况下仍判定不通过(例如违反仿单 → 不通过,即使整体 95 分)。
为稽核冻结
评估标准在 Roleplay 启动时冻结。AI 指示锁在特定版本。逐字稿、音频、报表皆保存,且保留期可设置。稽核开箱即用。
从框架到报表。
整条链都是确定且可稽核的。
01
框架维护
企业管理者编辑能力、评估标准与情境脉络。添加、编辑、停用,全部版本化。
02
范本声明
在精灵中,作者选择范本的每一个情境要测试哪些能力。每项标准的权重可设置。
03
Roleplay 冻结
在派发当下,评估标准会快照到 Roleplay 上。即使日后范本被编辑,场次仍依该快照运行。
04
AI 打分,代码决定
异步工作:组合 prompt + 逐字稿、向 AI 请求结构化 JSON、解析、套用通过/不通过规则、保存完整汇整。
为何不采多 AI 共识
多个 AI 不会加总,会发散。
我们试过:跑 4 个模型再取平均。问题是每个模型有不同的系统性偏误,平均会稀释掉答对那个模型的信号。
改采:每个 surface 用一个精挑的模型,搭配对 rubric 验证过的版本化 prompt。确定、可调试、跨场次可比较。
多 AI 共识
- ✗ 4 倍成本但信心并未变 4 倍
- ✗ 稀释发散的偏误
- ✗ 单一分数难以调试
- ✗ 跨场次差异不一致
每个 surface 一个供应商
- ✓ 每次调用成本可控
- ✓ Prompt 版本化且可稽核
- ✓ 结果可重现
- ✓ 跨场次比较一致