返回列表
📄论文

IWC-Bench:从软件测试视角评估 Web 应用生成

Liu C. et al.
2026-09

简介

2026 年发布的 LLM 生成 Web 应用评测基准,通过代码覆盖率引导 browser agent 探索可运行应用。IWC-Bench 对应用进行插桩,把交互轨迹抽象为状态转换图,并基于 369 条真实需求与 5,088 项验收标准分别评估视觉美感、可用性和需求一致性。

内容总结

IWC-Bench 带来的新信号:

1. 基于运行时证据:通过真实浏览器交互评估行为,避免把源码中存在但实际不可达的功能计为成功
2. 覆盖率引导探索:利用插桩后的代码覆盖率,帮助 Agent 发现更多已实现状态与功能
3. 状态转换抽象:先将交互轨迹转换为结构化图,再对生成应用进行评分
4. 质量维度分离:分别衡量视觉美感、可用性与需求一致性,而不是压缩成单一分数
5. 有人类偏好依据:在 197 个经过验证的 arena session 上,与人类成对偏好的符合率达到 85.3%

标签

ui-generationinteractive-evaluationcode-coveragebrowser-agentsbenchmark

相关文章

生成式 UI 精选资源合集。

用 ❤️ 由社区制作