परिचय
Apple से जुड़ी यह research जाँचती है कि generated interfaces वास्तविक user journeys को कितना support करते हैं। FlowEval reference websites और उनके generated analogs पर validated tasks चलाता है, reference-based similarity metrics से navigation traces की तुलना करता है, और जाँचता है कि ये scores expert UI judgments से कितने मेल खाते हैं।
सारांश
1. Interaction-first evaluation: केवल screenshots या code correctness पर निर्भर रहने के बजाय पूरे task flows मापता है
2. Trusted references: Generated sites की तुलना जाने-पहचाने high-quality interfaces से लिए गए traces से करता है
3. Automatable method: तुलनीय interaction sequences इकट्ठा करने के लिए computer-use agents और navigation tasks इस्तेमाल करता है
4. समझने योग्य diagnostics: Trace similarity बता सकती है कि generated flow reference experience से कहाँ अलग होता है
5. Human alignment evidence: Reference-based metrics और generated UIs के expert evaluations के बीच मजबूत correlation रिपोर्ट करता है