Tentang
Paper Juli 2026 yang memperkenalkan ESPP, metode evaluasi yang mengganti satu LLM judge dengan panel persona yang beragam secara psikologis dan berpijak pada bukti. Setiap panelis menilai screenshot interface yang dihasilkan secara independen, bertukar pendapat melalui mekanisme bounded-confidence, lalu hasilnya digabungkan menggunakan pembobotan sosial.
Ringkasan
1. Evaluasi yang majemuk: Memodelkan cara kelompok pengguna berbeda menilai interface yang sama, bukan mereduksi penilaian menjadi satu sudut pandang tersirat
2. Bukti keselarasan dengan manusia: Meningkatkan korelasi Pearson dengan penilaian manusia dari 0,716 menjadi 0,922
3. Perbandingan terkontrol: Menunjukkan bahwa prompt ensemble hanya memperoleh sekitar sepertiga dari peningkatan tersebut
4. Perbedaan pada tingkat dimensi: Mempertahankan informasi tentang aspek saat persona sepakat pada peringkat tetapi berbeda pada kualitas interface tertentu
5. Implementasi yang dapat direproduksi: Merilis pipeline scoring tiga tahap yang bisa dijalankan, contoh screenshot, dan studi kasus terperinci