返回列表
📄论文

EvoGenUI-Bench:评测多轮 Generative UI 助手的界面维护能力

Peng Y. et al.
2026-08

简介

2026 年 8 月发布的 Generative UI 基准,检验 LLM 助手能否随着用户需求持续变化,维护同一个可执行 Web 界面。EvoGenUI-Bench 包含 150 个五轮任务,覆盖信息呈现、有状态交互和工具驱动的外部状态,并结合截图、DOM、源码、操作轨迹与运行日志进行浏览器实测。

内容总结

EvoGenUI-Bench 带来的新信号:

1. 评测界面持续演化:不再只看一次性页面生成,而是要求同一产物经历连续修改
2. 量化需求保留能力:提出相邻轮次通过保持率,检查正确界面在下一次修改后是否仍然正确
3. 基于真实执行证据:综合浏览器行为、渲染结果、源码、DOM、轨迹、日志和外部状态回读
4. 揭示长期可靠性落差:最强模型单轮通过率达 74.9%,但完整通过五轮任务的比例只有 37.3%
5. 定位具体失效机制:区分信息架构、派生状态传播、交互绑定、外部状态对齐与需求拆解问题

标签

generative-uimulti-turnbenchmarkstate-managementbrowser-evaluation

相关文章

生成式 UI 精选资源合集。

用 ❤️ 由社区制作