परिचय
जुलाई 2026 का paper, जो ESPP नाम की evaluation method पेश करता है। यह एक LLM judge की जगह evidence-grounded और मनोवैज्ञानिक रूप से विविध personas का panel रखता है। Panelists generated-interface screenshots को स्वतंत्र रूप से rate करते हैं, bounded-confidence mechanism के जरिए राय साझा करते हैं, और उनके scores को social weighting के साथ जोड़ा जाता है।
सारांश
1. बहु-दृष्टिकोण evaluation: फैसले को एक छिपे हुए viewpoint में समेटने के बजाय दिखाता है कि अलग user groups एक ही generated interface को कैसे देखते हैं
2. Human-alignment evidence: Human ratings के साथ Pearson correlation को 0.716 से 0.922 तक सुधारता है
3. Controlled comparison: दिखाता है कि prompt ensemble इस सुधार का केवल लगभग एक-तिहाई ही हासिल करता है
4. Dimension-level disagreement: Personas की ranking पर सहमति के साथ उन खास interface qualities को भी बचाए रखता है जिन पर उनकी राय अलग है
5. Reproducible implementation: चलने योग्य three-stage scoring pipeline, sample screenshots और worked cases जारी करता है