NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap Paper • 2608.04397 • Published 1 day ago • 15
NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap Paper • 2608.04397 • Published 1 day ago • 15
When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models Paper • 2508.03483 • Published Jun 17 • 1
EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards Paper • 2607.00218 • Published Jun 30 • 1
EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards Paper • 2607.00218 • Published Jun 30 • 1
When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models Paper • 2508.03483 • Published Jun 17 • 1
When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models Paper • 2605.27851 • Published May 27 • 1
When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models Paper • 2605.27851 • Published May 27 • 1