Tentang
Benchmark Juli 2026 untuk menguji apakah multimodal language model dapat membuat interface visualisasi multi-view yang dapat dieksekusi dari desain visual. MV-Bench memakai workbook Tableau sebagai structured ground truth dan mengevaluasi fidelity visual, data binding, interaksi terkoordinasi, serta kemampuan kode untuk dieksekusi.
Ringkasan
1. Melampaui tampilan satu layar: Menguji dashboard terkoordinasi dengan beberapa view yang saling terhubung
2. Benchmark yang dapat dieksekusi: Menyediakan 1.048 instance terverifikasi beserta kode, interface hasil rendering, dataset, dan anotasi interaksi
3. Structured ground truth: Mengambil binding dan interaksi dari 92 workbook Tableau
4. Evaluasi semantik: Mengukur kebenaran data dan kelengkapan interaksi bersama fidelity visual
5. Kesenjangan kemampuan penting: Model terkuat yang diuji mencapai akurasi layout 75,45%, tetapi hanya 21,71% untuk data binding dan 11,68% untuk interaksi