简介
2026 年发布的 LLM 生成 Web 应用评测基准,通过代码覆盖率引导 browser agent 探索可运行应用。IWC-Bench 对应用进行插桩,把交互轨迹抽象为状态转换图,并基于 369 条真实需求与 5,088 项验收标准分别评估视觉美感、可用性和需求一致性。
内容总结
IWC-Bench 带来的新信号:
1. 基于运行时证据:通过真实浏览器交互评估行为,避免把源码中存在但实际不可达的功能计为成功
2. 覆盖率引导探索:利用插桩后的代码覆盖率,帮助 Agent 发现更多已实现状态与功能
3. 状态转换抽象:先将交互轨迹转换为结构化图,再对生成应用进行评分
4. 质量维度分离:分别衡量视觉美感、可用性与需求一致性,而不是压缩成单一分数
5. 有人类偏好依据:在 197 个经过验证的 arena session 上,与人类成对偏好的符合率达到 85.3%
1. 基于运行时证据:通过真实浏览器交互评估行为,避免把源码中存在但实际不可达的功能计为成功
2. 覆盖率引导探索:利用插桩后的代码覆盖率,帮助 Agent 发现更多已实现状态与功能
3. 状态转换抽象:先将交互轨迹转换为结构化图,再对生成应用进行评分
4. 质量维度分离:分别衡量视觉美感、可用性与需求一致性,而不是压缩成单一分数
5. 有人类偏好依据:在 197 个经过验证的 arena session 上,与人类成对偏好的符合率达到 85.3%
标签
ui-generationinteractive-evaluationcode-coveragebrowser-agentsbenchmark