简介
2026 年 8 月发布的 Generative UI 基准,检验 LLM 助手能否随着用户需求持续变化,维护同一个可执行 Web 界面。EvoGenUI-Bench 包含 150 个五轮任务,覆盖信息呈现、有状态交互和工具驱动的外部状态,并结合截图、DOM、源码、操作轨迹与运行日志进行浏览器实测。
内容总结
EvoGenUI-Bench 带来的新信号:
1. 评测界面持续演化:不再只看一次性页面生成,而是要求同一产物经历连续修改
2. 量化需求保留能力:提出相邻轮次通过保持率,检查正确界面在下一次修改后是否仍然正确
3. 基于真实执行证据:综合浏览器行为、渲染结果、源码、DOM、轨迹、日志和外部状态回读
4. 揭示长期可靠性落差:最强模型单轮通过率达 74.9%,但完整通过五轮任务的比例只有 37.3%
5. 定位具体失效机制:区分信息架构、派生状态传播、交互绑定、外部状态对齐与需求拆解问题
1. 评测界面持续演化:不再只看一次性页面生成,而是要求同一产物经历连续修改
2. 量化需求保留能力:提出相邻轮次通过保持率,检查正确界面在下一次修改后是否仍然正确
3. 基于真实执行证据:综合浏览器行为、渲染结果、源码、DOM、轨迹、日志和外部状态回读
4. 揭示长期可靠性落差:最强模型单轮通过率达 74.9%,但完整通过五轮任务的比例只有 37.3%
5. 定位具体失效机制:区分信息架构、派生状态传播、交互绑定、外部状态对齐与需求拆解问题
标签
generative-uimulti-turnbenchmarkstate-managementbrowser-evaluation