Tentang
Paper Juli 2026 yang memperkenalkan benchmark untuk memeriksa apakah tool Generative UI benar-benar menerapkan alasan desain yang disampaikan kepada pengguna. Melalui 120 interface dari lima tool dan 24 tugas struktural, styling, serta fungsional, studi ini mengukur kesenjangan antara keputusan desain yang diklaim dan hasil yang dibuat.
Ringkasan
1. Evaluasi rationale-to-interface: Menguji apakah penjelasan desain yang dihasilkan benar-benar terlihat pada UI aktual
2. Tiga kelas kebutuhan: Memisahkan kualitas implementasi struktural, styling, dan fungsional
3. Benchmark lintas tool: Mengevaluasi 120 interface yang dihasilkan oleh lima tool Generative UI
4. Bukti kegagalan yang konkret: Menemukan bahwa rata-rata lebih dari 25% alasan yang dinyatakan tidak diimplementasikan, dan angkanya naik menjadi 34% untuk kebutuhan fungsional
5. Cakupan prinsip UX: Mengukur apakah tool mengenali dan menerapkan prinsip desain yang tertanam dalam prompt