Kembali ke Daftar
📄Paper

Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation

Wu Z. et al.
2026-07

Tentang

Paper Juli 2026 yang memperkenalkan ESPP, metode evaluasi yang mengganti satu LLM judge dengan panel persona yang beragam secara psikologis dan berpijak pada bukti. Setiap panelis menilai screenshot interface yang dihasilkan secara independen, bertukar pendapat melalui mekanisme bounded-confidence, lalu hasilnya digabungkan menggunakan pembobotan sosial.

Ringkasan

Mengapa ESPP Memberi Perspektif Baru:

1. Evaluasi yang majemuk: Memodelkan cara kelompok pengguna berbeda menilai interface yang sama, bukan mereduksi penilaian menjadi satu sudut pandang tersirat
2. Bukti keselarasan dengan manusia: Meningkatkan korelasi Pearson dengan penilaian manusia dari 0,716 menjadi 0,922
3. Perbandingan terkontrol: Menunjukkan bahwa prompt ensemble hanya memperoleh sekitar sepertiga dari peningkatan tersebut
4. Perbedaan pada tingkat dimensi: Mempertahankan informasi tentang aspek saat persona sepakat pada peringkat tetapi berbeda pada kualitas interface tertentu
5. Implementasi yang dapat direproduksi: Merilis pipeline scoring tiga tahap yang bisa dijalankan, contoh screenshot, dan studi kasus terperinci

Tag

genuiui-evaluationhuman-preferencesllm-as-a-judgepersonas

Artikel Terkait

📄Paper

LEGOUI: Designing with UI-DSL Bricks for Transparent, Controllable Generation

Paper HCI Agustus 2026 yang memperkenalkan framework Generative UI bertahap untuk ideasi desain awal. LEGOUI mencatat keputusan dari prompt dan inferensi model dalam UI DSL yang melacak asal keputusan, memungkinkan pengguna menerima, menolak, atau menambahkan keputusan pada tahap layout, interaksi, relasi, dan style, lalu melakukan rendering dari spesifikasi yang terus berkembang.

genuiui-dsldesign-time
oleh Zhou Y. et al. · 2026-08
Baca Selengkapnya
📄Paper

Design Theater: A Benchmark for Generative UI

Paper Juli 2026 yang memperkenalkan benchmark untuk memeriksa apakah tool Generative UI benar-benar menerapkan alasan desain yang disampaikan kepada pengguna. Melalui 120 interface dari lima tool dan 24 tugas struktural, styling, serta fungsional, studi ini mengukur kesenjangan antara keputusan desain yang diklaim dan hasil yang dibuat.

genuiui-evaluationdesign-rationale
oleh Imteyaz K. et al. · 2026-07
Baca Selengkapnya
📄Paper

MV-Bench: Benchmarking MLLMs for Coordinated Multi-View Interface Construction

Benchmark Juli 2026 untuk menguji apakah multimodal language model dapat membuat interface visualisasi multi-view yang dapat dieksekusi dari desain visual. MV-Bench memakai workbook Tableau sebagai structured ground truth dan mengevaluasi fidelity visual, data binding, interaksi terkoordinasi, serta kemampuan kode untuk dieksekusi.

ui-generationmultimodal-modelsdata-visualization
oleh Zhao Y. et al. · 2026-07
Baca Selengkapnya

Kumpulan terkurasi berisi resource Generative UI untuk designer dan developer.

Dibuat dengan ❤️ oleh komunitas