简介
2026 年 7 月论文,评估多模态大模型能否根据视觉设计生成可执行的多视图可视化界面。MV-Bench 以 Tableau 工作簿作为结构化真值,同时衡量视觉还原、数据绑定、联动交互与代码可执行性。
内容总结
MV-Bench 带来的新信号:
1. 不只看单屏外观:专门测试包含多个联动视图的仪表盘界面
2. 可执行基准:提供 1,048 个经验证的实例,包含代码、渲染界面、数据集和交互标注
3. 结构化真值:从 92 个 Tableau 工作簿提取数据绑定与交互关系
4. 强调语义正确性:除视觉相似度外,还测量数据正确性和交互完整性
5. 揭示关键能力缺口:最强模型的布局准确率为 75.45%,数据绑定仅 21.71%,交互完整性仅 11.68%
1. 不只看单屏外观:专门测试包含多个联动视图的仪表盘界面
2. 可执行基准:提供 1,048 个经验证的实例,包含代码、渲染界面、数据集和交互标注
3. 结构化真值:从 92 个 Tableau 工作簿提取数据绑定与交互关系
4. 强调语义正确性:除视觉相似度外,还测量数据正确性和交互完整性
5. 揭示关键能力缺口:最强模型的布局准确率为 75.45%,数据绑定仅 21.71%,交互完整性仅 11.68%
标签
ui-generationmultimodal-modelsdata-visualizationinteractionbenchmark