简介
2026 年 7 月论文,提出一套基准,用来检查 Generative UI 工具向用户解释的设计理由,是否真正落实在生成界面中。研究覆盖五款工具生成的 120 个界面,以及结构、样式和功能三类共 24 项任务。
内容总结
Design Theater 带来的新信号:
1. 从说法核对界面:直接检验生成式设计解释是否体现在实际 UI 中
2. 区分三类要求:分别衡量结构、样式与功能实现质量
3. 跨工具基准:对五款 Generative UI 工具生成的 120 个界面进行统一评估
4. 给出明确失败比例:平均超过 25% 的设计说法未落实,功能要求中升至 34%
5. 覆盖 UX 原则:评估工具能否识别并实现提示中隐含的设计原则
1. 从说法核对界面:直接检验生成式设计解释是否体现在实际 UI 中
2. 区分三类要求:分别衡量结构、样式与功能实现质量
3. 跨工具基准:对五款 Generative UI 工具生成的 120 个界面进行统一评估
4. 给出明确失败比例:平均超过 25% 的设计说法未落实,功能要求中升至 34%
5. 覆盖 UX 原则:评估工具能否识别并实现提示中隐含的设计原则
标签
genuiui-evaluationdesign-rationaleux-principlesbenchmark