Kembali ke Daftar
📄Paper

FlowEval: Reference-Based Evaluation of Generated User Interfaces

Wu J. et al.
2026-05

Tentang

Riset yang berafiliasi dengan Apple tentang evaluasi kemampuan interface hasil generasi dalam mendukung user journey yang realistis. FlowEval menjalankan tugas tervalidasi pada website referensi dan hasil generasi yang setara, membandingkan navigation trace dengan metrik kemiripan berbasis referensi, lalu menguji keselarasan skor tersebut dengan penilaian pakar UI.

Ringkasan

Mengapa FlowEval Memberi Perspektif Baru:

1. Evaluasi interaction-first: Mengukur task flow lengkap, bukan hanya mengandalkan screenshot atau correctness kode
2. Referensi tepercaya: Membandingkan situs hasil generasi dengan trace dari interface berkualitas tinggi yang telah dikenal
3. Metode yang dapat diotomatisasi: Memakai computer-use agent dan tugas navigasi untuk mengumpulkan urutan interaksi yang sebanding
4. Diagnostik yang mudah ditafsirkan: Kemiripan trace dapat menunjukkan bagian flow hasil generasi yang menyimpang dari pengalaman referensi
5. Bukti keselarasan dengan manusia: Melaporkan korelasi kuat antara metrik berbasis referensi dan evaluasi pakar terhadap UI yang dihasilkan

Tag

ui-evaluationinteraction-flowscomputer-use-agentsbenchmarkhuman-evaluation

Artikel Terkait

📄Paper

LEGOUI: Designing with UI-DSL Bricks for Transparent, Controllable Generation

Paper HCI Agustus 2026 yang memperkenalkan framework Generative UI bertahap untuk ideasi desain awal. LEGOUI mencatat keputusan dari prompt dan inferensi model dalam UI DSL yang melacak asal keputusan, memungkinkan pengguna menerima, menolak, atau menambahkan keputusan pada tahap layout, interaksi, relasi, dan style, lalu melakukan rendering dari spesifikasi yang terus berkembang.

genuiui-dsldesign-time
oleh Zhou Y. et al. · 2026-08
Baca Selengkapnya
📄Paper

Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation

Paper Juli 2026 yang memperkenalkan ESPP, metode evaluasi yang mengganti satu LLM judge dengan panel persona yang beragam secara psikologis dan berpijak pada bukti. Setiap panelis menilai screenshot interface yang dihasilkan secara independen, bertukar pendapat melalui mekanisme bounded-confidence, lalu hasilnya digabungkan menggunakan pembobotan sosial.

genuiui-evaluationhuman-preferences
oleh Wu Z. et al. · 2026-07
Baca Selengkapnya
📄Paper

Design Theater: A Benchmark for Generative UI

Paper Juli 2026 yang memperkenalkan benchmark untuk memeriksa apakah tool Generative UI benar-benar menerapkan alasan desain yang disampaikan kepada pengguna. Melalui 120 interface dari lima tool dan 24 tugas struktural, styling, serta fungsional, studi ini mengukur kesenjangan antara keputusan desain yang diklaim dan hasil yang dibuat.

genuiui-evaluationdesign-rationale
oleh Imteyaz K. et al. · 2026-07
Baca Selengkapnya

Kumpulan terkurasi berisi resource Generative UI untuk designer dan developer.

Dibuat dengan ❤️ oleh komunitas