Kembali ke Daftar
📄Paper

Design Theater: A Benchmark for Generative UI

Imteyaz K. et al.
2026-07

Tentang

Paper Juli 2026 yang memperkenalkan benchmark untuk memeriksa apakah tool Generative UI benar-benar menerapkan alasan desain yang disampaikan kepada pengguna. Melalui 120 interface dari lima tool dan 24 tugas struktural, styling, serta fungsional, studi ini mengukur kesenjangan antara keputusan desain yang diklaim dan hasil yang dibuat.

Ringkasan

Mengapa Design Theater Memberi Perspektif Baru:

1. Evaluasi rationale-to-interface: Menguji apakah penjelasan desain yang dihasilkan benar-benar terlihat pada UI aktual
2. Tiga kelas kebutuhan: Memisahkan kualitas implementasi struktural, styling, dan fungsional
3. Benchmark lintas tool: Mengevaluasi 120 interface yang dihasilkan oleh lima tool Generative UI
4. Bukti kegagalan yang konkret: Menemukan bahwa rata-rata lebih dari 25% alasan yang dinyatakan tidak diimplementasikan, dan angkanya naik menjadi 34% untuk kebutuhan fungsional
5. Cakupan prinsip UX: Mengukur apakah tool mengenali dan menerapkan prinsip desain yang tertanam dalam prompt

Tag

genuiui-evaluationdesign-rationaleux-principlesbenchmark

Artikel Terkait

📄Paper

LEGOUI: Designing with UI-DSL Bricks for Transparent, Controllable Generation

Paper HCI Agustus 2026 yang memperkenalkan framework Generative UI bertahap untuk ideasi desain awal. LEGOUI mencatat keputusan dari prompt dan inferensi model dalam UI DSL yang melacak asal keputusan, memungkinkan pengguna menerima, menolak, atau menambahkan keputusan pada tahap layout, interaksi, relasi, dan style, lalu melakukan rendering dari spesifikasi yang terus berkembang.

genuiui-dsldesign-time
oleh Zhou Y. et al. · 2026-08
Baca Selengkapnya
📄Paper

Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation

Paper Juli 2026 yang memperkenalkan ESPP, metode evaluasi yang mengganti satu LLM judge dengan panel persona yang beragam secara psikologis dan berpijak pada bukti. Setiap panelis menilai screenshot interface yang dihasilkan secara independen, bertukar pendapat melalui mekanisme bounded-confidence, lalu hasilnya digabungkan menggunakan pembobotan sosial.

genuiui-evaluationhuman-preferences
oleh Wu Z. et al. · 2026-07
Baca Selengkapnya
📄Paper

MV-Bench: Benchmarking MLLMs for Coordinated Multi-View Interface Construction

Benchmark Juli 2026 untuk menguji apakah multimodal language model dapat membuat interface visualisasi multi-view yang dapat dieksekusi dari desain visual. MV-Bench memakai workbook Tableau sebagai structured ground truth dan mengevaluasi fidelity visual, data binding, interaksi terkoordinasi, serta kemampuan kode untuk dieksekusi.

ui-generationmultimodal-modelsdata-visualization
oleh Zhao Y. et al. · 2026-07
Baca Selengkapnya

Kumpulan terkurasi berisi resource Generative UI untuk designer dan developer.

Dibuat dengan ❤️ oleh komunitas