arxiv:2608.12781
Peng Shangpin
AI & ML interests
Multimodal Large Language Models, Preference Optimization Algorithm, Reinforcement Learning
Recent Activity
authored a paper 10 days ago
Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs