简介
2026 年 7 月论文,提出 ESPP 生成式界面评估方法,用一组有证据支撑、心理特征多样的 Persona 取代单个 LLM judge。评审者先独立评价界面截图,再通过有界信任机制交换意见,最后以社会权重聚合结果。
内容总结
ESPP 带来的新信号:
1. 多元评估视角:模拟不同用户群体对同一生成界面的感受,而不是压缩成单一隐含偏好
2. 更贴近人工判断:与人工评分的 Pearson 相关系数从 0.716 提升到 0.922
3. 对照实验清晰:prompt ensemble 只能解释约三分之一的提升
4. 保留分维度分歧:既能看到 Persona 对模型整体排名的共识,也能发现具体界面维度上的差异
5. 可复现实现:公开三阶段评分流程、示例截图和完整案例
1. 多元评估视角:模拟不同用户群体对同一生成界面的感受,而不是压缩成单一隐含偏好
2. 更贴近人工判断:与人工评分的 Pearson 相关系数从 0.716 提升到 0.922
3. 对照实验清晰:prompt ensemble 只能解释约三分之一的提升
4. 保留分维度分歧:既能看到 Persona 对模型整体排名的共识,也能发现具体界面维度上的差异
5. 可复现实现:公开三阶段评分流程、示例截图和完整案例
标签
genuiui-evaluationhuman-preferencesllm-as-a-judgepersonas