框架评估

分数要有意义,
必须锚定在能力框架上。

每个 Roleplay 范本声明每个情境所测试的能力。AI 只对这些评估标准评分,没有关键字启发法、没有强加给您的平台全域目录。

场次报告

医疗访问,怀疑的心脏科医师

受训者:Marcela R. · 通路:语音 · 12 分钟

87

通过

在派发当下冻结的能力

PROD-001

产品熟稔度

92

OBJ-003

异议处理

78

COMP-014

仿单依从性

95

评估标准(rubric)

以临床证据为基础的论述 92
对 HCP 工作流程的理解 85
在强烈异议后的回复 78
带有明确后续步骤的结案 88
RDC 658 仿单依从性(合规 blocker) 95

AI 洞察 · 强项

在 1 分 15 秒就把 pitch 锚定在 HCP 的高血压患者样态。被挑战疗效时,引用第 3 期试验的结果。

可改进之处

在 4 分 32 秒,HCP 询问与 β 阻断剂的交互作用时,回应模糊(「我查一下再回复您」)。建议:对药物交互作用做精准辅导。

您企业的能力框架

每位企业都有自己的能力与评估标准目录。在 onboarding 时依垂直由中央目录拷贝过来,之后完全可编辑,您可以加入任何目录都没有、属于您业务的能力。

AI 打分。代码决定。

AI 负责打分通过/不通过规则由可稽核的代码决定,包含「合规 blocker」,可在分数很高的情况下仍判定不通过(例如违反仿单 → 不通过,即使整体 95 分)。

为稽核冻结

评估标准在 Roleplay 启动时冻结。AI 指示锁在特定版本。逐字稿、音频、报表皆保存,且保留期可设置。稽核开箱即用。

从框架到报表。

整条链都是确定且可稽核的。

01

框架维护

企业管理者编辑能力、评估标准与情境脉络。添加、编辑、停用,全部版本化。

02

范本声明

在精灵中,作者选择范本的每一个情境要测试哪些能力。每项标准的权重可设置。

03

Roleplay 冻结

在派发当下,评估标准会快照到 Roleplay 上。即使日后范本被编辑,场次仍依该快照运行。

04

AI 打分,代码决定

异步工作:组合 prompt + 逐字稿、向 AI 请求结构化 JSON、解析、套用通过/不通过规则、保存完整汇整。

为何不采多 AI 共识

多个 AI 不会加总,会发散。

我们试过:跑 4 个模型再取平均。问题是每个模型有不同的系统性偏误,平均会稀释掉答对那个模型的信号。

改采:每个 surface 用一个精挑的模型,搭配对 rubric 验证过的版本化 prompt。确定、可调试、跨场次可比较。

多 AI 共识

  • ✗ 4 倍成本但信心并未变 4 倍
  • ✗ 稀释发散的偏误
  • ✗ 单一分数难以调试
  • ✗ 跨场次差异不一致

每个 surface 一个供应商

  • ✓ 每次调用成本可控
  • ✓ Prompt 版本化且可稽核
  • ✓ 结果可重现
  • ✓ 跨场次比较一致

准备好改变您团队的培训方式了吗?

专为 50 人以上的组织设计。预约 45 分钟,我们会与您一起规划合适的配置。