Kembali ke Daftar
📄Paper

MV-Bench: Benchmarking MLLMs for Coordinated Multi-View Interface Construction

Zhao Y. et al.
2026-07

Tentang

Benchmark Juli 2026 untuk menguji apakah multimodal language model dapat membuat interface visualisasi multi-view yang dapat dieksekusi dari desain visual. MV-Bench memakai workbook Tableau sebagai structured ground truth dan mengevaluasi fidelity visual, data binding, interaksi terkoordinasi, serta kemampuan kode untuk dieksekusi.

Ringkasan

Mengapa MV-Bench Memberi Perspektif Baru:

1. Melampaui tampilan satu layar: Menguji dashboard terkoordinasi dengan beberapa view yang saling terhubung
2. Benchmark yang dapat dieksekusi: Menyediakan 1.048 instance terverifikasi beserta kode, interface hasil rendering, dataset, dan anotasi interaksi
3. Structured ground truth: Mengambil binding dan interaksi dari 92 workbook Tableau
4. Evaluasi semantik: Mengukur kebenaran data dan kelengkapan interaksi bersama fidelity visual
5. Kesenjangan kemampuan penting: Model terkuat yang diuji mencapai akurasi layout 75,45%, tetapi hanya 21,71% untuk data binding dan 11,68% untuk interaksi

Tag

ui-generationmultimodal-modelsdata-visualizationinteractionbenchmark

Artikel Terkait

📄Paper

LEGOUI: Designing with UI-DSL Bricks for Transparent, Controllable Generation

Paper HCI Agustus 2026 yang memperkenalkan framework Generative UI bertahap untuk ideasi desain awal. LEGOUI mencatat keputusan dari prompt dan inferensi model dalam UI DSL yang melacak asal keputusan, memungkinkan pengguna menerima, menolak, atau menambahkan keputusan pada tahap layout, interaksi, relasi, dan style, lalu melakukan rendering dari spesifikasi yang terus berkembang.

genuiui-dsldesign-time
oleh Zhou Y. et al. · 2026-08
Baca Selengkapnya
📄Paper

Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation

Paper Juli 2026 yang memperkenalkan ESPP, metode evaluasi yang mengganti satu LLM judge dengan panel persona yang beragam secara psikologis dan berpijak pada bukti. Setiap panelis menilai screenshot interface yang dihasilkan secara independen, bertukar pendapat melalui mekanisme bounded-confidence, lalu hasilnya digabungkan menggunakan pembobotan sosial.

genuiui-evaluationhuman-preferences
oleh Wu Z. et al. · 2026-07
Baca Selengkapnya
📄Paper

Design Theater: A Benchmark for Generative UI

Paper Juli 2026 yang memperkenalkan benchmark untuk memeriksa apakah tool Generative UI benar-benar menerapkan alasan desain yang disampaikan kepada pengguna. Melalui 120 interface dari lima tool dan 24 tugas struktural, styling, serta fungsional, studi ini mengukur kesenjangan antara keputusan desain yang diklaim dan hasil yang dibuat.

genuiui-evaluationdesign-rationale
oleh Imteyaz K. et al. · 2026-07
Baca Selengkapnya

Kumpulan terkurasi berisi resource Generative UI untuk designer dan developer.

Dibuat dengan ❤️ oleh komunitas